一位数据工程师配置了一个 AWS Glue crawler 来编目 S3 存储桶中的数据,该存储桶包含 .csv 和 .json 文件。该 crawler 被设置为排除 .json 文件,但当运行 Athena 查询时,.json 文件仍然被处理。工程师必须在不改变对 .csv 文件访问权限的情况下解决此问题,并且希望查询时间尽可能短。最佳解决方案是什么?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将 .json 文件重新定位到 S3 存储桶中的不同路径。.
为什么这是答案
将 .json 文件重新定位到 S3 存储桶中的不同路径是最佳解决方案。AWS Glue crawler 的排除规则只影响它创建的表定义,而不影响 Athena 查询实际扫描 S3 存储桶中的数据。当 Athena 查询一个表时,它会根据表定义中的位置信息扫描 S3。如果 .json 文件与 .csv 文件在同一路径下,即使 crawler 排除它们,Athena 仍然会扫描这些文件。将 .json 文件移动到单独的路径,可以确保 Athena 在查询 .csv 数据时不会扫描这些文件,从而减少查询时间和成本,并保持对 .csv 文件的访问不受影响。调整 AWS Glue crawler 设置无法解决 Athena 扫描的问题。使用 Athena 控制台排除文件需要每次查询都手动操作,效率低下。使用 S3 存储桶策略会阻止对 .json 文件的所有访问,与要求不符。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡