Un point de terminaison SageMaker en temps réel de production exécutant le modèle de détection d'objets intégré sur une instance P3 affiche une faible utilisation du GPU. Quel changement de déploiement permettra de mieux utiliser les ressources d'inférence provisionnées ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Redéployer le modèle sur une instance M5 et attacher des accélérateurs Amazon Elastic Inference..
Pourquoi c'est la réponse
Le redéploiement du modèle sur une instance M5 avec des accélérateurs Amazon Elastic Inference (EI) est la solution la plus rentable et la plus efficace pour une faible utilisation du GPU. Les instances P3 sont optimisées pour l'entraînement de modèles et fournissent des GPU complets qui peuvent être sous-utilisés pour l'inférence en temps réel, surtout si le débit est faible. Les accélérateurs EI fournissent juste la bonne quantité d'accélération GPU pour l'inférence, ce qui permet d'économiser des coûts par rapport à l'utilisation d'instances GPU complètes. L'exécution en tant que tâche de transformation par lots n'est pas une inférence en temps réel. Le déplacement vers une instance P3dn plus grande augmenterait les coûts sans résoudre le problème de sous-utilisation. L'hébergement sur ECS avec une instance P3 ne résout pas non plus la sous-utilisation du GPU.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise