데이터 과학자가 SageMaker에서 대규모 PyTorch 모델을 훈련하며, 각 훈련 작업은 약 10시간이 소요됩니다. 훈련이 수렴되지 않고 GPU 활용률이 저조하다고 의심하고 있습니다. 이러한 훈련 문제를 감지하고 해결하는 데 가장 적은 개발 노력이 필요한 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: SageMaker Debugger의 vanishing_gradient 및 LowGPUUtilization과 같은 내장 규칙을 사용하여 문제를 감지하고 StopTrainingJob 작업을 트리거합니다..
이것이 정답인 이유
SageMaker Debugger는 훈련 중 모델의 동작을 실시간으로 모니터링하고 분석하는 데 최적화된 도구입니다. vanishinggradient 규칙은 모델이 수렴되지 않는 일반적인 원인인 기울기 소실 문제를 감지하며, LowGPUUtilization 규칙은 GPU 활용률 저조 문제를 직접적으로 식별합니다. 이러한 내장 규칙은 최소한의 개발 노력으로 훈련 문제를 자동으로 감지하고, StopTrainingJob 작업을 트리거하여 불필요한 훈련 시간과 비용을 절감할 수 있습니다. CloudWatch에서 CPU 활용률만 모니터링하는 것은 GPU 기반 훈련의 핵심 문제를 놓칠 수 있으며, 사용자 지정 지표를 게시하고 Lambda 함수로 분석하는 것은 더 많은 개발 노력이 필요합니다. confusion 및 featureimportanceoverweight 규칙은 모델의 성능이나 특성 중요도와 관련된 규칙으로, GPU 활용률 저조나 기울기 소실과 같은 훈련 인프라 또는 수렴 문제를 직접적으로 진단하는 데는 적합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음