ある ML エンジニアが、SageMaker Studio ノートブックで estimator を使用してニューラルネットワークをトレーニングしています。Python トレーニングスクリプトは、複数の GPU を持つ単一インスタンスで Distributed Data Parallel (DDP) を使用していますが、GPU が十分に活用されていません。エンジニアは、リソース使用量を最適化するために、トレーニングスクリプトのどの部分を特定する必要があるでしょうか。この点を特定するには、どのアプローチが適切ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: トレーニングスクリプトに SageMaker Profiler アノテーションを追加し、それを実行して、結果からプロファイラーレポートを生成する。.
これが解答である理由
SageMaker Profilerは、トレーニングスクリプトにアノテーションを追加することで、GPU使用率、CPU使用率、メモリ使用量、データローディング時間など、トレーニングジョブのパフォーマンスボトルネックを詳細に分析できます。これにより、DDPがGPUを十分に活用できていない根本原因(例:データローディングの遅延、CPUバウンドな処理)を特定し、リソース使用量を最適化するための具体的な改善点を見つけることができます。 CloudWatchメトリクスは高レベルのGPU使用率を提供しますが、ボトルネックの具体的な原因を特定するには不十分です。CloudTrailはAPIアクティビティを記録するサービスであり、GPU使用率の分析には適していません。SageMaker Model Monitorはデプロイされたモデルの品質とドリフトを監視するツールであり、トレーニング中のリソース使用率の最適化には関連しません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要