AmazonAmazon AWS Certified Solutions Architect – Associate (SAA-C03)
·CN
·更新于 19 Jul 2026
一个报告系统每天向 Amazon S3 存储桶传输数百个 .csv 文件。公司必须将这些文件转换为 Apache Parquet 格式,并将结果存储在转换后的数据存储桶中。哪种解决方案能以最少的开发工作量满足此要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个 AWS Glue 爬网程序来发现数据,并创建一个 AWS Glue 提取、转换和加载 (ETL) 作业来转换数据,将转换后的数据存储桶指定为 ETL 输出。.
为什么这是答案
AWS Glue 是一种完全托管的 ETL 服务,非常适合此场景。AWS Glue 爬网程序可以自动发现 S3 存储桶中的 .csv 文件的模式,并将其元数据存储在 AWS Glue Data Catalog 中。然后,AWS Glue ETL 作业可以使用这些元数据,通过自动生成的 PySpark 或 Scala 脚本轻松地将数据从 .csv 转换为 Apache Parquet 格式,并将其写入目标 S3 存储桶,从而最大限度地减少开发工作量。
其他选项的不足之处:
Amazon EMR 需要管理集群,并且需要编写和维护 Spark 应用程序,开发和运维开销较大。
AWS Batch 可以运行自定义脚本,但需要手动处理数据发现、模式演变和转换逻辑,开发工作量大。
AWS Lambda 函数对于处理数百个文件可能需要复杂的协调和错误处理机制,并且单个 Lambda 函数的执行时间限制可能不适合大型文件转换,增加了开发复杂性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡