Un point de terminaison SageMaker exécutant le modèle intégré de classification d'images sur une instance ml.m5.xlarge subit une latence d'inférence inacceptable, et ModelLatency est le contributeur dominant. La latence s'aggrave lorsque plusieurs utilisateurs appellent le point de terminaison simultanément. Quelle action réduira la latence d'inférence pour ces chercheurs ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Attacher un accélérateur Amazon Elastic Inference (par exemple, un ml.eia2.medium) à l'instance du point de terminaison..
Pourquoi c'est la réponse
L'attachement d'un accélérateur Amazon Elastic Inference (EI) est la solution la plus efficace car il est conçu pour accélérer les inférences de modèles d'apprentissage profond à moindre coût, en particulier pour les modèles de classification d'images. Les accélérateurs EI fournissent des ressources GPU pour l'inférence sans nécessiter des instances GPU complètes, ce qui réduit la latence sans augmenter excessivement les coûts. Changer pour une instance burstable ml.t3 n'est pas idéal car ces instances sont conçues pour des charges de travail avec des pics d'utilisation occasionnels et peuvent ne pas maintenir des performances élevées sous une charge soutenue, ce qui aggraverait la latence. SageMaker Autopilot est un outil de création de modèles automatisée et n'affecte pas directement la latence d'inférence d'un modèle déjà déployé. Changer pour une instance optimisée pour la mémoire n'est pas pertinent car le problème est la latence de calcul (ModelLatency), non un manque de mémoire.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise