某公司将来自多个来源的数据收集到一个 S3 存储桶中,运行 AWS Glue ETL 作业对其进行转换,并将转换后的输出存储在由 Amazon Athena 查询的基于 S3 的数据湖中。该公司需要识别匹配的记录,即使没有共享的唯一标识符。哪种解决方案可以实现此目的?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 ETL 作业中训练并使用 AWS Lake Formation FindMatches 转换。.
为什么这是答案
正确的解决方案是“在 ETL 作业中训练并使用 AWS Lake Formation FindMatches 转换”。这是因为 FindMatches 转换专门用于识别和匹配没有共享唯一标识符的记录,它使用机器学习来识别相似的记录。 “在 ETL 作业中使用 Amazon Macie 模式匹配”不正确,因为 Macie 主要用于发现和保护敏感数据,而不是用于记录匹配。 “在 ETL 作业中训练并使用 AWS Glue PySpark Filter 类”不正确,因为 PySpark Filter 类用于基于特定条件过滤数据,而不是用于识别和匹配相似的记录。 “对表进行分区,并使用 ETL 作业根据唯一标识符对数据进行分区”不正确,因为题目明确指出没有共享的唯一标识符,所以基于唯一标识符进行分区无法解决记录匹配问题。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡