あるMLエンジニアが、2つのソースからの週次データをマージおよび変換する必要があります。ソースは、S3にある大規模なCSVファイル(それぞれ数百万行)とAmazon Auroraクラスターです。マージされた出力は、別のS3バケットに書き込む必要があります。運用上のオーバーヘッドが最も少ないのは、次のどのオプションですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Apache Sparkエンジンを使用して週次のAWS Glueジョブをスケジュールし、DynamicFrame操作を使用してデータをマージおよび変換します。.
これが解答である理由
AWS Glueは、大規模なデータ統合と変換(ETL)ジョブに最適なサーバーレスサービスです。Apache Sparkエンジンを内蔵しており、数百万行のCSVファイルとAuroraからのデータを効率的に処理できます。DynamicFrameはGlue独自のデータ構造で、スキーマの推論と変更を容易にし、ETLプロセスを簡素化します。週次でジョブをスケジュールできるため、運用上のオーバーヘッドが最小限に抑えられます。 一時的なAmazon EMRクラスターは、プロビジョニングと管理が必要であり、オーバーヘッドが増加します。AWS Lambdaは短時間の処理に適しており、大規模なSparkジョブの実行には不向きです。EC2インスタンスでのAWS Batchジョブは、EC2インスタンスの管理が必要であり、Glueと比較して運用上のオーバーヘッドが大きくなります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要