您需要对PB级数据集执行探索性数据分析 (EDA),并且不管理集群基础设施,只为运行的查询付费,并使用 Jupyter notebook 以 Python 编写分析。哪种解决方案满足这些限制?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 Amazon Athena 中运行 Apache Spark。.
为什么这是答案
正确答案是“在 Amazon Athena 中运行 Apache Spark”。Amazon Athena 是一项无服务器交互式查询服务,允许您使用标准 SQL 直接分析 Amazon S3 中的数据。它支持 Apache Spark,这意味着您可以使用 Jupyter notebook 以 Python 编写分析,而无需管理任何集群基础设施,并且只需为运行的查询付费。这完美符合所有要求。 “在 Amazon SageMaker 中运行 Apache Spark”是错误的,因为虽然 SageMaker 支持 Spark,但它通常涉及管理实例或集群配置,不完全是无服务器按查询付费模型。 “在您预置的 Amazon EMR 集群上运行 Apache Spark”是错误的,因为它要求您预置和管理 EMR 集群,这与“不管理集群基础设施”的要求相悖。 “使用与 Amazon Redshift 集成的 Apache Spark”是错误的,因为 Amazon Redshift 是一个数据仓库服务,需要预置和管理集群,并且其计费模式基于集群运行时间,而非纯粹的按查询付费。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡