AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一家公司将CSV文件上传到Amazon S3存储桶。一个AWS Glue爬网程序为数据构建表和模式,一个AWS Glue作业处理这些表并将结果写入Amazon Redshift数据库。Glue作业负责列映射并根据需要创建Redshift表。重新运行Glue作业会导致Redshift表中出现重复行。该公司需要一种在不引入重复项的情况下更新Redshift表的方法。哪种方法可以满足此要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 修改AWS Glue作业,将行复制到暂存Redshift表中。添加SQL命令,用暂存Redshift表中的新值更新现有行。.
为什么这是答案
正确的做法是修改AWS Glue作业,将数据首先复制到一个临时的Redshift暂存表。然后,通过SQL命令(例如使用MERGE或UPDATE和INSERT的组合)将暂存表中的新数据与主Redshift表进行比较。这样可以更新现有行并插入新行,从而避免重复。
将数据加载到MySQL数据库并执行upsert操作会增加不必要的复杂性和数据传输开销,因为数据最终仍需回到Redshift。使用Apache Spark的dropDuplicates() API只能删除完全相同的重复行,但如果数据是更新而不是完全重复,则无法处理。AWS Glue的ResolveChoice转换用于处理数据类型不一致的问题,与本场景中避免重复行的需求无关。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡