一家初创公司使用 GPU 运行复杂的深度神经网络训练。工作流从 S3 拉取数据集,从公司 git 仓库加载 TensorFlow 模型,在本地运行,并将进度写入 S3。该作业支持暂停和恢复,集中排队,目前需要数小时。管理人员希望将每周的工作负载自动化,使其在每个星期一运行,并在星期五之前完成,同时以最低成本进行扩展。哪种架构能以最低成本最好地满足此要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将工作负载打包到 AWS Deep Learning Containers 中,并使用支持 GPU 的 Spot Instances 在 AWS Batch 上作为作业运行。.
为什么这是答案
正确答案通过结合多种AWS服务,以最低成本满足了所有要求。AWS Deep Learning Containers预装了深度学习框架,简化了环境设置。AWS Batch能够高效管理和调度长时间运行的GPU密集型任务,支持暂停和恢复,并能处理集中排队。使用支持GPU的Spot Instances可以显著降低计算成本,同时AWS Batch能够自动处理Spot中断。这种组合提供了高度自动化、可扩展且经济高效的解决方案。 选项B不具备扩展能力,且Instance Scheduler主要用于启动/停止实例,不适合管理复杂的深度学习任务。选项C中,AWS Fargate目前不支持GPU实例,不适用于深度神经网络训练。选项D中,Amazon ECS虽然支持Spot Instances,但相比AWS Batch,其在管理和调度长时间运行的批处理作业方面功能较弱,且没有深度学习容器的直接集成优势。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡