一家公司有一个本地的 Oracle 数据仓库,并且正在 Amazon S3 上构建一个数据湖。他们需要将数据仓库表加载到 S3 中,并通过每日增量数据保持同步。每个表都有一个单调递增的列,大小在 50 GB 以下,每晚凌晨 1 点到 2 点之间刷新,BI 查询在上午 10 点到晚上 8 点之间运行。哪种方法在操作上效率最高?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS Database Migration Service (AWS DMS) 全量加载加 CDC 任务,将包含单调递增数据列的表从本地数据仓库加载到 Amazon S3。在 AWS Glue 中使用自定义逻辑将每日增量数据附加到 Amazon S3 中的全量加载副本。.
为什么这是答案
正确答案是使用 AWS DMS 进行全量加载加 CDC 任务,然后用 AWS Glue 处理增量数据。AWS DMS 能够高效地将本地 Oracle 数据仓库的全量数据迁移到 Amazon S3,并通过变更数据捕获 (CDC) 持续同步增量数据,利用了单调递增列的特性。AWS Glue 可以进一步处理这些增量数据,将其追加到 S3 中的全量副本,实现每日同步。这种方法操作上效率最高,因为它利用了 DMS 的专业迁移能力和 Glue 的数据处理能力,同时避免了重复的全量加载。 其他选项的不足: 使用 AWS Glue JDBC 连接和书签:虽然可行,但对于 50 GB 以下的数据量,DMS 在全量加载和 CDC 方面通常更高效且管理更简单。自定义逻辑处理增量数据是必要的,但DMS在源端捕获变更更具优势。 AWS DMS 全量迁移,每天覆盖:这种方法每天都会进行全量加载,对于 50 GB 的表来说效率低下,且在 BI 查询运行期间可能导致数据不一致或性能问题。 AWS Glue 每天全量加载并覆盖:与上一个选项类似,每天全量加载 50 GB 数据并覆盖,效率低下且资源消耗大,不适合每日增量同步的需求。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡