ある会社が、Amazon S3バケットに保存されているXMLデータを処理するために、毎日同じ時間にAWS Glue ETLジョブを実行しています。新しいデータは毎日S3バケットに追加されます。ソリューションアーキテクトは、AWS Glueが実行のたびにすべてのデータを再処理していることに気づきました。ソリューションアーキテクトは、AWS Glueが古いデータを再処理するのを防ぐために、何をすべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: ジョブを編集してジョブブックマークを使用する。.
これが解答である理由
AWS Glueジョブブックマークは、以前に処理されたデータを追跡し、次回の実行時に新しいデータのみを処理するようにします。これにより、同じデータの再処理が回避され、ETLジョブの効率が向上します。データを処理後に削除すると、履歴データが失われるため、分析要件によっては不適切です。NumberOfWorkersを1に設定しても、処理されるデータの量には影響しません。FindMatches ML変換は、重複レコードの識別に使用されるもので、新しいデータのみを処理する問題とは無関係です。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要