某公司對資料湖中的資料進行季度分析,以執行庫存檢查。資料工程師使用 AWS Glue DataBrew 在資料中尋找任何關於客戶的個人身份資訊 (PII)。該公司的隱私規則包含一些自訂 PII 類別,這些類別不屬於 DataBrew 的內建資料品質規則。工程師必須更新流程,以掃描資料湖中許多資料集中的這些自訂 PII 類別。哪種方法能以最少的操作負擔滿足此要求?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 在 DataBrew 中建立自訂資料品質規則,並將這些規則應用於所有資料集。.
為什麼這是答案
正確答案是「在 DataBrew 中建立自訂資料品質規則,並將這些規則應用於所有資料集」。AWS Glue DataBrew 支援建立自訂資料品質規則,這讓資料工程師能夠定義針對特定 PII 類別的檢查。將這些自訂規則應用於多個資料集,可以自動化 PII 掃描過程,並顯著減少操作負擔,因為 DataBrew 會在每次運行時自動執行這些檢查。 「手動審查資料集」效率低下且容易出錯,不適合大規模資料湖。 「編寫自訂 Python 腳本」雖然可行,但需要額外的開發和維護工作,增加了操作複雜性,不如 DataBrew 內建的自訂規則功能方便。 「在 ETL 過程中,使用正規表達式來提取 PII」是在資料進入資料湖之前進行的,但題目要求掃描資料湖中現有的資料集,且 DataBrew 的自訂規則能更好地整合到現有流程中,提供更全面的資料品質管理。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡