Una empresa de medios necesita recomendaciones de artículos de baja latencia para lectores en una ciudad. El tráfico alcanza su punto máximo en momentos predecibles (mañana, almuerzo, después del trabajo) y es ligero en otros momentos. Las respuestas de inferencia son de menos de 4 MB. ¿Qué opción de despliegue minimiza la latencia y es la más rentable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Inferencia serverless con concurrencia provisionada para minimizar la latencia de cold-start..
Por qué esta es la respuesta
La inferencia serverless con concurrencia provisionada es la opción más rentable y de menor latencia. La concurrencia provisionada asegura que las funciones estén "cálidas" y listas para responder rápidamente durante los picos de tráfico predecibles, eliminando la latencia de "cold-start". Al ser serverless, solo se paga por el tiempo de cómputo consumido, lo que es ideal para cargas de trabajo variables con períodos de bajo tráfico. Un endpoint de inferencia en tiempo real con auto scaling podría incurrir en costos más altos al mantener instancias aprovisionadas incluso durante períodos de baja demanda, y el auto scaling puede introducir latencia al escalar. La inferencia asíncrona y los trabajos de Batch transform no cumplen con el requisito de baja latencia, ya que están diseñados para procesamiento diferido o por lotes, no para recomendaciones en tiempo real.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta