AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一家投资公司正在摄取不断增长的半结构化数据,需要对记录进行去重,删除重复项和常见的拼写错误。哪个选项能以最少的运营开销提供此功能?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS Glue 的 FindMatches 功能删除重复记录。.
为什么这是答案
AWS Glue 的 FindMatches 功能专门设计用于识别和删除重复或近似重复的记录,即使数据不完全匹配(例如,存在拼写错误或格式差异)。它使用机器学习来识别相似的记录,从而实现高效的数据去重,且操作开销最小。
Amazon Athena 的非窗口函数可以用于去重,但对于识别近似重复项(例如拼写错误)效果不佳,需要更复杂的SQL逻辑。Amazon Neptune ML 和 Apache Gremlin 脚本主要用于图数据分析和关系发现,不适用于大规模的去重任务。Amazon DynamoDB 的全局表功能旨在提供多区域复制和高可用性,而不是用于数据去重。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡