Un endpoint de SageMaker en tiempo real de producción que ejecuta el modelo de detección de objetos integrado en una instancia P3 muestra una baja utilización de la GPU. ¿Qué cambio en la implementación hará un mejor uso de los recursos de inferencia aprovisionados?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Volver a implementar el modelo en una instancia M5 y adjuntar aceleradores Amazon Elastic Inference..
Por qué esta es la respuesta
La opción correcta es volver a implementar el modelo en una instancia M5 y adjuntar aceleradores Amazon Elastic Inference. Los aceleradores Elastic Inference (EI) son ideales para escenarios de baja utilización de GPU, ya que permiten adjuntar la cantidad justa de aceleración de GPU a instancias de CPU o GPU existentes. Esto optimiza el uso de recursos y reduce costos al evitar el aprovisionamiento excesivo de GPU completas. Cambiar a un trabajo de transformación por lotes no es una solución para un endpoint en tiempo real. Mover a una instancia P3dn (una GPU más grande) agravaría el problema de baja utilización, ya que se estaría aprovisionando aún más capacidad de GPU no utilizada. Alojar el modelo en un clúster de Amazon ECS con una instancia P3 no resuelve el problema subyacente de la baja utilización de la GPU en la instancia P3.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta