ある企業が、S3に保存されている200TBのデータを使用してSageMakerでモデルをトレーニングしています。データセットは多数のファイルで構成されており、各ファイルは200MBを超えています。同社は、最小限のセットアップ作業で最速の処理時間を求めています。どのデータアクセス方法を使用すべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: SageMaker FastFile modeを使用して、S3からオンデマンドでファイルをストリーミングします。.
これが解答である理由
FastFileモードは、大規模なデータセット(このケースでは200TB)を効率的に処理するために設計されており、S3からトレーニングインスタンスにデータをオンデマンドでストリーミングします。これにより、トレーニング開始前にデータ全体をダウンロードする時間を省き、セットアップ作業を最小限に抑えながら最速の処理時間を実現します。 SageMaker Fileモードは、トレーニング開始前にデータ全体をインスタンスストレージにコピーするため、200TBのような大規模データセットでは時間がかかりすぎます。Amazon FSx for Lustreは高性能ですが、セットアップ作業がFastFileモードよりも多く、追加の管理が必要です。Amazon EFSはスループットがFSx for LustreやFastFileモードに比べて低く、大規模データセットのトレーニングには適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要