10 GBのAmazon DynamoDBテーブルにIoT土壌センサーデータがあり、Amazon S3に5 GBのJSONファイルとして気象イベントデータがあります。この結合されたデータセットを準備して、管理オーバーヘッドを最小限に抑えながらAmazon SageMakerモデルをトレーニングしたいと考えています。必要な変換を最も適切に実現するアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glueクローラーを実行してデータをカタログ化します。DynamoDBとS3データセットをマージし、マージされた出力をCSVファイルとしてAmazon S3に書き込むAWS Glue ETLジョブを作成します。.
これが解答である理由
正解は、AWS Glueクローラーを実行してデータをカタログ化し、DynamoDBとS3データセットをマージし、マージされた出力をCSVファイルとしてAmazon S3に書き込むAWS Glue ETLジョブを作成することです。AWS GlueはサーバーレスのETLサービスであり、データのカタログ化、変換、S3への出力保存を管理オーバーヘッドなしで実現します。SageMakerはS3から直接トレーニングデータを読み込むことができ、CSVは一般的な形式です。 Amazon EMRは、この規模のデータ処理には過剰なリソースであり、クラスターの管理が必要です。Amazon Redshiftはデータウェアハウスであり、トレーニングデータの一時的なステージングには不要であり、追加の管理オーバーヘッドが発生します。DynamoDB StreamsとLambdaは、リアルタイム処理には適していますが、既存の履歴データを結合してS3に書き込むというユースケースには効率的ではありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要