AmazonAmazon Machine Learning Specialty MLS-C01
·JA
·更新日 26 Jul 2026
データサイエンティストがオンプレミスのETLプロセスをAWSに移行する必要があります。現在のプロセスはスケジュールに基づいて実行され、PySparkを使用して複数の大規模なデータソースをマージおよびフォーマットし、ダウンストリームジョブ用に統合された1つの出力を作成します。クラウドソリューションの要件は、複数のソースを結合し、既存のPySparkコードを再利用し、既存のスケジュールで実行し、管理するサーバーの数を最小限に抑えることです。これらの要件を満たすアーキテクチャはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 生データをAmazon S3に保存します。既存のロジックを再利用するためにPySparkで実装されたAWS Glue ETLジョブを作成します。現在のスケジュールで実行するようにAWS Glueトリガーを設定し、ジョブが処理された出力をAmazon S3の処理済み場所に書き込み、ダウンストリームで使用するようにします。.
これが解答である理由
正解は、既存のPySparkコードを再利用し、スケジュール実行とサーバー管理の最小化という要件を最も効率的に満たすため、AWS Glue ETLジョブを作成するオプションです。AWS GlueはサーバーレスのETLサービスであり、PySparkスクリプトを直接実行でき、Glueトリガーを使用して既存のスケジュールに合わせることができます。
他の選択肢が不正解である理由は以下の通りです。
永続的なAmazon EMRクラスターは、サーバー管理の最小化という要件に反します。
AWS LambdaでPySparkロジックを再実装することは、既存のコードの再利用という要件に反し、Lambdaの実行時間とメモリの制限にも直面する可能性があります。
Amazon Kinesis Data Analyticsはストリーミングデータ処理に特化しており、バッチ処理のPySpark ETLには適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する →
カード不要