ある会社がCSVファイルをAmazon S3バケットにアップロードしています。AWS Glueクローラーは、そのデータのテーブルとスキーマを構築し、AWS Glueジョブはテーブルを処理して結果をAmazon Redshiftデータベースに書き込みます。Glueジョブは列マッピングを処理し、必要に応じてRedshiftテーブルを作成します。Glueジョブを再実行すると、Redshiftテーブルに重複する行が表示されます。同社は、重複を発生させずにRedshiftテーブルを更新する方法を必要としています。この要件を満たすアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: AWS Glueジョブを変更して、行をステージングRedshiftテーブルにコピーします。既存の行をステージングRedshiftテーブルからの新しい値で更新するSQLコマンドを追加します。.
これが解答である理由
このアプローチは、Redshiftへのデータのupsert(更新または挿入)を効果的に管理します。まずデータをステージングテーブルに書き込み、次にSQLコマンドを使用して、既存の行を新しい値で更新し、新しい行を挿入することで、重複を回避しながらRedshiftテーブルを更新します。 他の選択肢が不適切な理由は以下の通りです。 MySQLデータベースを使用する方法は、RedshiftからMySQLへのデータの移動と戻しが必要となり、不必要な複雑さとオーバーヘッドが発生します。 Apache SparkのdropDuplicates()は重複を排除しますが、これは既存のRedshiftテーブルの行を更新するのではなく、単に重複した新しい行の挿入を防ぐだけです。 ResolveChoiceは、スキーマの不一致を解決するためのものであり、既存のRedshiftテーブルの重複行を更新する問題には直接対処しません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要