Un endpoint de SageMaker que ejecuta el modelo de clasificación de imágenes integrado en una instancia ml.m5.xlarge está experimentando una latencia de inferencia inaceptable, y ModelLatency es el factor dominante. La latencia empeora cuando varios usuarios llaman al endpoint simultáneamente. ¿Qué acción reducirá la latencia de inferencia para estos investigadores?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Adjuntar un acelerador Amazon Elastic Inference (por ejemplo, un ml.eia2.medium) a la instancia del endpoint..
Por qué esta es la respuesta
La opción correcta es adjuntar un acelerador Amazon Elastic Inference (EI). Los aceleradores EI están diseñados específicamente para reducir la latencia y el costo de la inferencia de aprendizaje profundo al agregar aceleración de GPU a instancias de CPU existentes, como ml.m5.xlarge. Esto es ideal para modelos que requieren aceleración de GPU pero no necesitan una instancia de GPU completa. La latencia empeora con usuarios simultáneos, lo que indica que el cuello de botella es la capacidad de inferencia, y un acelerador puede aliviar esto. Cambiar a una instancia ml.t3 no es adecuado porque las instancias ráfaga como ml.t3 están diseñadas para cargas de trabajo de uso bajo a moderado y podrían empeorar la latencia bajo carga sostenida. Habilitar SageMaker Autopilot es para el ajuste de hiperparámetros y la selección de modelos, no para reducir la latencia de inferencia en un modelo ya implementado. Cambiar a una instancia optimizada para memoria no abordaría directamente la latencia de inferencia de un modelo de clasificación de imágenes, que generalmente se beneficia más de la capacidad de cómputo (GPU) que de la memoria adicional.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta