一个数据科学团队将存储许多不同的训练数据集,并且必须支持自动扩展、成本效益和基于 SQL 的探索。哪种存储方法最适合此用例?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将数据集作为文件保存在 Amazon S3 中。.
为什么这是答案
将数据集作为文件保存在 Amazon S3 中是最佳选择。S3 提供高可扩展性、持久性和成本效益的存储,非常适合存储大量训练数据集。它与各种AWS服务(如Amazon Athena)无缝集成,支持基于SQL的探索,无需加载数据到其他数据库。 将数据集存储在附加到EC2实例的Amazon EBS卷上不具备自动扩展能力,且成本效益较低,需要手动管理存储容量。将数据集作为表保存在多节点Amazon Redshift集群中虽然支持SQL查询,但Redshift主要用于数据仓库和分析,存储大量原始训练数据成本较高,且不适合作为原始文件存储。将数据集作为全局表存储在Amazon DynamoDB中不适合存储大型文件或非结构化数据,DynamoDB是NoSQL数据库,主要用于键值和文档数据,不适合基于SQL的探索。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡