一家公司对数据湖中的数据进行季度分析,以运行库存检查。数据工程师使用 AWS Glue DataBrew 查找数据中有关客户的任何个人身份信息 (PII)。公司的隐私规则包含一些自定义 PII 类别,这些类别不属于 DataBrew 的内置数据质量规则。工程师必须更新流程,以扫描数据湖中许多数据集的这些自定义 PII 类别。哪种方法能够以最少的运营开销满足要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 DataBrew 中创建自定义数据质量规则,并将这些规则应用于所有数据集。.
为什么这是答案
在 DataBrew 中创建自定义数据质量规则是最佳选择,因为它直接解决了问题中自定义 PII 类别的需求,并能以最少的运营开销应用于多个数据集。DataBrew 旨在处理数据质量和 PII 检测,其自定义规则功能允许工程师定义特定于公司隐私规则的模式。一旦创建,这些规则可以轻松地集成到现有的 DataBrew 流程中,实现自动化扫描,而无需额外的基础设施或持续的手动干预。手动审查数据集效率低下且容易出错,不适合大规模或重复性任务。编写自定义 Python 脚本虽然可行,但会增加开发和维护开销,并且需要将脚本集成到 DataBrew 之外的单独流程中。在 ETL 过程中使用正则表达式提取 PII 是一种方法,但它将 PII 检测与数据质量检查分离,并且可能不如 DataBrew 的集成功能灵活或易于管理,尤其是在需要更新或添加新规则时。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡