データエンジニアが、毎月のトレーニングデータをAmazon RedshiftからAmazon S3に抽出しています。ソーススキーマには、TransactionTimestamp (timestamp)、CardName (varchar)、およびCardNo (varchar) が含まれています。エンジニアは、(1) CardNo = NULL の行を削除し、(2) TransactionTimestamp を TransactionDate と TransactionTime に分割し、(3) CardName を NameOnCard に名前変更する必要があります。このソリューションは、インフラストラクチャのセットアップを最小限に抑え、毎月自動化され、Redshift クラスターへの負荷を最小限に抑える必要があります。これらの要件を満たすソリューションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Amazon Redshift クラスターをソースとして、S3 バケットをターゲットとして使用する AWS Glue ジョブを作成します。Glue の組み込み変換 (Filter、Map、RenameField) を使用して必要な変更を適用し、ジョブを毎月スケジュールします。.
これが解答である理由
正解は、AWS Glueジョブが要件を最も満たします。Glueは、サーバーレスのデータ統合サービスであり、インフラストラクチャのセットアップが不要です。Redshiftからデータを読み取り、組み込みの変換(FilterでNULL行を削除、Mapでタイムスタンプを分割、RenameFieldで列名を変更)を適用し、S3に書き出すことができます。ジョブはスケジュール可能で、Redshiftへの負荷を最小限に抑えつつ、自動化された月次処理を実現します。 Amazon EMRは、インフラストラクチャのプロビジョニングと管理が必要であり、最小限のセットアップという要件に反します。EC2インスタンスからの手動エクスポートは自動化の要件を満たしません。Redshift SpectrumはS3上のデータに対してクエリを実行するものであり、RedshiftからS3へのデータ抽出・変換には直接適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要