ある企業がS3データレイク内のデータに対してML分析を実行したいと考えています。この企業には2つの変換ニーズがあります。(1) 毎日決まった時間に到着する300GBの様々な形式のデータに対して、スケジュールされた日次変換を実行すること、(2) レイク内のテラバイト規模のアーカイブデータに対して、1回限りの変換を実行すること。Amazon MWAA DAGがワークフローをオーケストレーションします。これらのニーズを最も費用対効果の高い方法で満たすために、DAGがスケジュールすべき2つのタスクはどれですか?(2つ選択してください。)
解答を選択
オプションをタップして解答を確認してください。
正解: 日次で受信するデータについては、AWS Glueクローラーを使用してスキーマをスキャンおよび識別します。, 日次データとアーカイブデータについては、Amazon EMRを使用してデータ変換を実行します。.
これが解答である理由
AWS Glueクローラーは、S3データレイク内の様々な形式のデータからスキーマを自動的に推論し、AWS Glueデータカタログに登録します。これにより、AthenaやRedshift Spectrumなどのサービスがデータをクエリできるようになり、日次で到着する多形式データのスキーマ識別ニーズに費用対効果高く対応できます。Amazon EMRは、Apache Sparkなどのフレームワークを使用して、テラバイト規模のデータに対する複雑な変換処理を効率的に実行できるため、日次データとアーカイブデータの両方の変換に適しています。 Amazon Athenaはスキーマ推論機能を持たず、クエリ実行前にスキーマ定義が必要です。Amazon Redshiftはデータウェアハウスであり、データレイク内の生データの変換には適していません。Amazon SageMakerは機械学習モデルのトレーニングとデプロイに特化しており、一般的なデータ変換には高コストで不向きです。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要