Un científico de datos entrenó un modelo secuencia-a-secuencia para la traducción de inglés a japonés utilizando 500.000 pares de oraciones. Las oraciones cortas (aproximadamente cinco palabras) se traducen bien, pero las traducciones de oraciones muy largas (alrededor de 100 palabras) son deficientes. ¿Qué cambio es el más probable que solucione el problema?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ajustar los hiperparámetros relacionados con el mecanismo de atención..
Por qué esta es la respuesta
El problema de las traducciones deficientes para oraciones largas en modelos secuencia-a-secuencia es un síntoma clásico de que el modelo tiene dificultades para mantener la información relevante a lo largo de secuencias extendidas. Un mecanismo de atención permite al modelo enfocarse en partes específicas de la secuencia de entrada al generar cada elemento de la secuencia de salida, lo cual es crucial para manejar dependencias de largo alcance. Ajustar sus hiperparámetros (como el tipo de atención, la cantidad de cabezas de atención en Transformers, o la forma en que se calcula la atención) puede mejorar significativamente la capacidad del modelo para capturar relaciones en oraciones largas. Preprocesar el texto en n-gramas no resuelve el problema subyacente de la memoria a largo plazo en secuencias largas. Aumentar el número de unidades RNN sin atención no garantiza una mejor retención de información relevante. Usar un esquema de inicialización de pesos diferente es una técnica general de optimización que no aborda directamente la limitación de la memoria en secuencias largas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta