Una empresa educativa está creando una aplicación que permite a los usuarios escribir una pregunta o subir una imagen de una pregunta. La aplicación debe devolver una respuesta escrita y una explicación. ¿Qué tipo de modelo se adapta mejor a este caso de uso?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Large multi-modal language model.
Por qué esta es la respuesta
Un modelo de lenguaje grande multimodal (LMM) es la mejor opción porque puede procesar y comprender múltiples tipos de datos de entrada, como texto (la pregunta escrita) e imágenes (la imagen de la pregunta). Luego, puede generar respuestas en formato de texto, que incluyen tanto la respuesta a la pregunta como una explicación detallada. Un modelo de visión por computadora solo procesaría la imagen, pero no generaría una explicación textual. Un modelo de difusión se usa principalmente para la generación de imágenes o datos, no para responder preguntas. Un modelo de texto a voz convertiría texto en audio, lo cual no es el requisito principal aquí.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta