一位資料科學家在 SageMaker 上訓練一個大型 PyTorch 模型;每個訓練任務大約需要 10 小時。他們懷疑訓練沒有收斂,而且 GPU 使用率可能很差。哪種方法所需的開發工作量最少,可以偵測並解決這些訓練問題?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 SageMaker Debugger 的內建規則,例如 vanishing_gradient 和 LowGPUUtilization,來偵測問題並觸發 StopTrainingJob 動作。.
為什麼這是答案
SageMaker Debugger 專為此類問題而設計,提供內建規則來自動監控訓練過程。vanishinggradient 規則可以檢測模型收斂問題,而 LowGPUUtilization 規則則能識別 GPU 使用率低的情況。這些規則可以配置為在檢測到問題時自動觸發 StopTrainingJob 動作,從而節省時間和資源,且開發工作量最少。 其他選項的解釋: 使用 CloudWatch 中的 CPU 使用率指標:CPU 使用率低不一定代表 GPU 使用率低或訓練未收斂,且此方法無法直接監控梯度或收斂問題。 將高解析度自訂指標發佈到 CloudWatch,並使用 Lambda 函數分析:這需要大量的開發工作來編寫自訂指標、發佈邏輯和 Lambda 函數,不符合「開發工作量最少」的要求。 使用 SageMaker Debugger 的內建規則 confusion 和 featureimportanceoverweight:這些規則與收斂問題或 GPU 使用率無關,它們主要用於模型評估和特徵重要性分析。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡