ある投資会社は、増え続ける半構造化データを取り込んでおり、重複するレコードや一般的なスペルミスを削除して、レコードの重複排除を行う必要があります。運用上のオーバーヘッドが最も少ないこの機能を提供するオプションはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 重複するレコードを削除するために、AWS Glue の FindMatches 機能を使用します。.
これが解答である理由
AWS GlueのFindMatches機能は、機械学習を活用して、重複するレコードやスペルミスのあるレコードを特定し、重複排除を行うことができます。これは、半構造化データに対して運用オーバーヘッドを最小限に抑えながら、高い精度でデータ品質を向上させるための最適なソリューションです。 Amazon Athenaの非ウィンドウ関数は、重複排除に利用できますが、スペルミスのような曖昧な重複を検出する機能は持たず、手動でのロジック実装が必要になるため、運用オーバーヘッドが増大します。Amazon Neptune MLとApache Gremlinスクリプトは、グラフデータ分析に特化しており、重複排除の主要な目的には適していません。Amazon DynamoDBのグローバルテーブル機能は、データのレプリケーションと高可用性を提供しますが、重複排除機能は持っていません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要