ある企業は、在庫確認を実行するために、データレイク内のデータの四半期分析を実行しています。データエンジニアは、AWS Glue DataBrew を使用して、データ内の顧客に関する個人を特定できる情報 (PII) を見つけます。会社のプライバシールールには、DataBrew の組み込みデータ品質ルールの一部ではないカスタム PII カテゴリが含まれています。エンジニアは、データレイク内の多くのデータセットでこれらのカスタム PII カテゴリをスキャンするようにプロセスを更新する必要があります。運用上のオーバーヘッドが最も少ない要件を満たすアプローチはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: DataBrew でカスタムデータ品質ルールを作成し、それらのルールをデータセット全体に適用します。.
これが解答である理由
DataBrewでカスタムデータ品質ルールを作成し、データセット全体に適用することで、運用オーバーヘッドを最小限に抑えつつ、カスタムPIIカテゴリを効率的にスキャンできます。DataBrewの組み込み機能としてカスタムルールを定義できるため、多くのデータセットに一貫して適用し、自動化されたスキャンを実現できます。手動レビューは非効率的でエラーが発生しやすく、多くのデータセットには適していません。カスタムPythonスクリプトは開発とメンテナンスのオーバーヘッドが増加し、DataBrewの統合された利点を損ないます。ETLプロセス中に正規表現を使用する方法は、DataBrewのデータ品質管理機能とは異なり、データレイク内の既存データセットに対するスキャンには直接対応しません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要