ある企業は、S3に保存されている数テラバイトのユーザーインタラクションデータをクリーンアップ、変換、エンリッチ、圧縮するために、大規模なEC2インスタンス上でPythonスクリプトとして実装された日次ETLパイプラインを実行しています。このプロセスには20時間以上かかり、EC2からマネージドなサーバーレスソリューションに最小限の開発労力で移行したいと考えています。これらの要件を満たすアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glueジョブを作成し、スクリプトをPySparkに変換し、Glueジョブを実行してデータを処理し、結果をS3に保存します。.
これが解答である理由
正解は、AWS Glueジョブを作成し、スクリプトをPySparkに変換し、Glueジョブを実行してデータを処理し、結果をS3に保存します。AWS Glueは、マネージドなサーバーレスETLサービスであり、大規模なデータ処理に適しています。既存のPythonスクリプトをPySparkに変換することで、最小限の開発労力で分散処理の恩恵を受けられます。これにより、20時間以上かかっていた処理時間を大幅に短縮できます。 Amazon Redshiftはデータウェアハウスであり、ETLツールではありません。DynamoDBはNoSQLデータベースであり、数テラバイトのバッチ処理には不向きです。個別のLambda関数とStep Functionsは、小規模なタスクのオーケストレーションには適していますが、数テラバイトのデータ変換にはスケーラビリティとコストの面で課題があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要