AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
StreamlineAI는 주기적인 모델 체크포인트를 생성하는 사용자 지정 PyTorch 학습 스크립트(스크립트 모드)를 실행합니다. 비용 절감을 위해 SageMaker Managed Spot Training을 사용하려고 합니다. 학습 스크립트는 체크포인트를 /opt/ml/checkpoints에 기록하고 회사는 아티팩트를 s3://streamlineai-checkpoints/training1/에 저장합니다. 관리형 스팟 SageMaker 학습 작업이 중단 후 마지막 체크포인트부터 재개할 수 있도록 하는 구성은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 관리형 스팟 학습을 활성화하고 학습 작업의 CheckpointConfig를 {S3Uri: 's3://streamlineai-checkpoints/training1/', LocalPath: '/opt/ml/checkpoints'}로 설정합니다. 학습 스크립트가 체크포인트를 /opt/ml/checkpoints에 저장하고 시작 시 최신 체크포인트를 위해 해당 로컬 경로를 확인하는지 확인합니다(SageMaker는 스팟 중단 시 LocalPath를 S3Uri로 업로드/다운로드합니다)..
이것이 정답인 이유
정답은 SageMaker의 관리형 스팟 학습과 체크포인트 기능을 올바르게 활용하는 방법을 설명합니다. CheckpointConfig를 설정하면 SageMaker는 스팟 인스턴스 중단 시 /opt/ml/checkpoints의 로컬 체크포인트를 지정된 S3 URI로 자동으로 업로드하고, 재개 시 S3에서 로컬 경로로 다운로드합니다. 학습 스크립트는 이 로컬 경로에서 최신 체크포인트를 찾아 학습을 재개해야 합니다.
다른 옵션들은 다음과 같은 이유로 올바르지 않습니다.
모델 아티팩트(ModelArtifacts)는 일반적으로 최종 모델을 저장하는 데 사용되며, 주기적인 체크포인트 재개에는 적합하지 않습니다.
SageMaker Debugger(smdebug)는 디버깅 및 프로파일링 도구이며, 체크포인트 재개를 위한 주된 메커니즘이 아닙니다.
EFS를 사용하는 것은 가능하지만, SageMaker 관리형 스팟 학습의 내장된 체크포인트 기능을 활용하는 것이 더 간편하고 비용 효율적입니다. 또한, EFS 마운트만으로는 스팟 중단 시 데이터 지속성을 보장하기 어려울 수 있습니다.