Una empresa desea realizar inferencias en dispositivos de borde con la latencia más baja posible utilizando modelos de lenguaje. ¿Qué enfoque de despliegue logra esto de la mejor manera?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Desplegar modelos de lenguaje pequeños optimizados (SLM) directamente en los dispositivos de borde.
Por qué esta es la respuesta
Desplegar modelos de lenguaje pequeños optimizados (SLM) directamente en los dispositivos de borde es la mejor opción para lograr la latencia más baja. Al ejecutar el modelo localmente en el dispositivo, se elimina la necesidad de enviar datos a la nube para inferencia, lo que reduce drásticamente los retrasos de red. Los SLM están diseñados para ser eficientes en recursos computacionales limitados, lo que los hace adecuados para dispositivos de borde. Desplegar LLM directamente en el borde no es factible debido a sus requisitos computacionales y de memoria. Usar una API centralizada, ya sea con SLM o LLM, introduce latencia de red, lo que va en contra del objetivo de la latencia más baja posible.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta