一家公司使用对象键路径(例如 s3://bucket/prefix/year=2023/month=01/day=01)对其 Amazon S3 数据湖进行分区。当添加新分区时,AWS Glue Data Catalog 必须与 S3 保持同步。哪种方法可以以最低的延迟保持目录最新?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用将数据写入 Amazon S3 的代码来调用 Boto3 AWS Glue create_partition API。.
为什么这是答案
当数据写入 Amazon S3 后立即调用 Boto3 AWS Glue createpartition API 是最低延迟的解决方案。这种方法确保了 Glue Data Catalog 几乎实时地与 S3 中的新分区同步,因为分区创建是数据写入过程的一部分。 安排 AWS Glue crawler 每天运行会引入延迟,因为目录更新只会在爬网程序运行时发生,这可能导致在爬网程序运行之前无法查询新数据。每天手动运行两次 AWS Glue CreatePartition API 不仅效率低下且容易出错,而且也无法实现低延迟,因为更新依赖于人工干预。从 AWS Glue 控制台运行 MSCK REPAIR TABLE 命令(或通过 Athena/Redshift Spectrum)会扫描 S3 路径以查找新分区,这会产生一定的延迟,并且对于大型数据湖而言,扫描操作可能耗时且成本较高。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡