一家公司在多个区域运营 AWS 资源,并且每个区域都有一个 Amazon EFS 文件系统。数据科学团队只在一个区域工作,他们的数据必须保留在该区域。数据工程师必须通过使用编排 Lambda 函数的 Step Functions 状态机来处理存储在每个区域 EFS 上的文件,从而创建整合数据集。哪种方案能以最少的精力实现这一目标?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS DataSync 将文件从每个区域 EFS 传输到数据科学团队区域的 EFS。配置数据科学团队区域中的 Lambda 以挂载该本地文件系统并处理数据。.
为什么这是答案
正确答案是使用 AWS DataSync 将文件从每个区域 EFS 传输到数据科学团队区域的 EFS,然后在此区域配置 Lambda 处理数据。这种方法利用 DataSync 的高效数据传输能力,将所有数据集中到数据科学团队所在的单一区域,避免了跨区域访问的复杂性和延迟。Lambda 函数可以直接挂载本地 EFS,确保了数据处理的效率和合规性(数据保留在指定区域)。 其他选项的不足: 将 VPC 对等连接并从数据科学团队区域挂载每个区域的 EFS 会引入显著的跨区域网络延迟,并且管理多个远程挂载点复杂。 EFS 跨区域复制虽然能将数据复制过来,但通常用于灾难恢复或读副本,而不是频繁的数据同步和处理,且可能增加不必要的存储成本。 在每个区域部署 Lambda 函数处理数据并将输出写入 S3,虽然可行,但增加了部署和管理多个区域 Lambda 的复杂性,并且数据科学团队仍需从 S3 整合数据,不如 DataSync 集中到 EFS 更直接。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡