FinInsights implementó un endpoint de modelo fundacional de JumpStart para la generación de texto financiero de baja latencia en una instancia ml.g5.xlarge. Después de un piloto exitoso, necesitan un rendimiento sostenido 3 veces mayor con un comportamiento de cola de latencia similar. ¿Cuál es el cambio más directo y soportado en el endpoint de SageMaker JumpStart para cumplir con este requisito?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Actualizar la configuración del endpoint de SageMaker para usar un tipo de instancia de GPU más grande (por ejemplo, ml.g5.12xlarge) o cambiar a múltiples instancias ml.g5.xlarge detrás del endpoint (aumentar el recuento de instancias) y habilitar el autoescalado del endpoint. Volver a implementar el modelo usando la misma imagen de contenedor de JumpStart y la nueva configuración del endpoint..
Por qué esta es la respuesta
Para lograr un rendimiento 3 veces mayor con latencia similar, la estrategia más directa es escalar los recursos computacionales. Aumentar el tamaño de la instancia a una ml.g5.12xlarge proporciona más GPU y memoria, lo que permite procesar más solicitudes simultáneamente. Alternativamente, aumentar el número de instancias ml.g5.xlarge y habilitar el autoescalado distribuye la carga entre múltiples instancias, mejorando el rendimiento y la disponibilidad. Ambas opciones son cambios soportados en la configuración del endpoint de SageMaker JumpStart y no requieren modificar el modelo subyacente. Las otras opciones son incorrectas porque: HyperParameterTuningJob optimiza hiperparámetros del modelo, no la capacidad del endpoint. Elastic Inference no es compatible con instancias G5 y está diseñado para acelerar la inferencia en instancias de CPU o GPU más pequeñas, no para un aumento de rendimiento de 3x en una instancia G5 existente. SageMaker Serverless Inference es para cargas de trabajo intermitentes y no garantiza un rendimiento sostenido 3 veces mayor con baja latencia para modelos fundacionales grandes, además de que la latencia puede ser mayor debido al arranque en frío.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta