ある企業は、多くのソースからS3バケットにデータを収集し、AWS Glue ETLジョブを実行してデータを変換し、変換された出力をAmazon AthenaでクエリされるS3ベースのデータレイクに保存しています。この企業は、共通のユニークな識別子がない場合でも、一致するレコードを特定する必要があります。これを実現するソリューションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: ETLジョブでAWS Lake Formation FindMatches変換をトレーニングして使用します。.
これが解答である理由
AWS Lake FormationのFindMatches変換は、共通のユニークな識別子がない場合でも、重複するレコードや一致するレコードを特定するために設計された機械学習ベースの機能です。これは、データレイク内のデータの品質と統合性を向上させるのに役立ちます。 他の選択肢は適切ではありません。Amazon Macieは機密データの検出に特化しており、レコードのマッチングには使用されません。AWS Glue PySpark Filterクラスは、特定の条件に基づいてレコードをフィルタリングしますが、一致するレコードを特定するための高度なロジックは提供しません。テーブルをパーティション化することは、クエリのパフォーマンスを向上させるためのものであり、レコードのマッチングとは直接関係ありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要