您运行一个为多个团队提供服务的 GKE 集群。ML 团队需要 Nvidia Tesla P100 GPU 进行模型训练,并希望以最少的投入和成本完成。您应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 向现有 GKE 集群添加一个支持 GPU 的节点池,并让 ML 团队将其 pod 添加 cloud.google.com/gke-accelerator: nvidia-tesla-p100 节点选择器。.
为什么这是答案
向现有 GKE 集群添加一个支持 GPU 的节点池,并让 ML 团队将其 pod 添加 cloud.google.com/gke-accelerator: nvidia-tesla-p100 节点选择器,这是最经济高效且管理方便的解决方案。通过添加一个专门的 GPU 节点池,ML 团队可以按需使用 GPU 资源,而不会影响集群中其他团队的工作负载。节点选择器确保只有需要 GPU 的 Pod 才会被调度到这些节点上,从而优化资源利用率并控制成本。 要求 ML 团队在其 pod 规范中添加 accelerator: gpu 注解是不够的,因为这只是一个通用的请求,并不能保证集群中有可用的 GPU 资源。重新创建 GKE 集群中的每个节点以在所有节点上启用 GPU 会导致不必要的成本增加,因为并非所有工作负载都需要 GPU。在 Compute Engine 上创建一个单独的 Kubernetes 集群会增加管理开销和成本,因为需要维护两个独立的集群。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡