AmazonAmazon Machine Learning Specialty MLS-C01
·CN
·更新于 26 Jul 2026
您需要一个无服务器的实时摄取和分析管道,用于处理大容量流式 JSON 事件。该管道必须缓冲数据,将 JSON 转换为针对查询优化的列式格式而不会丢失数据,将结果存储在高可用性数据存储中,并允许分析师运行 SQL 查询和连接 BI 仪表板。哪种设计最能满足这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在托管式 Data Catalog 中为传入格式定义一个 schema。使用托管式流式传输服务摄取事件,使用 Data Catalog 将其转换为列式格式(Parquet 或 ORC),并将结果交付到对象存储。让分析师使用无服务器 SQL 查询引擎查询对象存储,并使用其 JDBC 连接器连接 BI 工具。.
为什么这是答案
正确答案描述了使用托管式流式传输服务(如 Kinesis Data Firehose)摄取数据,该服务可以缓冲数据、使用 Data Catalog 定义的 schema 将 JSON 转换为 Parquet 或 ORC 等列式格式,并将结果存储在 S3 中。然后,分析师可以使用无服务器 SQL 查询引擎(如 Athena)查询 S3 中的数据,并通过 JDBC 连接器连接 BI 工具。这满足了高容量流式 JSON 事件的实时摄取、数据转换、高可用性存储以及 SQL 查询和 BI 集成等所有要求。
其他选项的不足之处:
将每个 JSON 记录写入对象存储,然后触发无服务器函数进行转换,效率较低,且可能无法满足实时处理的要求。
将处理后的数据插入托管式关系数据库不适合高容量流式数据,且关系数据库通常成本更高,扩展性不如对象存储。
使用实时 SQL 流处理服务直接转换为 Parquet 缺少 Data Catalog 的 schema 管理能力,且可能无法完全满足所有要求。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡