Un científico de datos utilizó el modelo de temas neuronales (NTM) de SageMaker para recomendar etiquetas para publicaciones de blog almacenadas como JSON en S3. El modelo sugiere palabras vacías (stopwords) como "a", "an" y "the", y a veces palabras raras pero válidas. El equipo quiere mantener las palabras raras pero asegurarse de que no se recomienden las palabras vacías. ¿Qué debe hacer el científico de datos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Eliminar las palabras vacías del texto del blog usando CountVectorizer de scikit-learn y reemplazar los datos en S3 con los resultados vectorizados..
Por qué esta es la respuesta
La opción correcta es eliminar las palabras vacías del texto del blog usando CountVectorizer de scikit-learn y reemplazar los datos en S3 con los resultados vectorizados. CountVectorizer permite preprocesar el texto, incluyendo la eliminación de stopwords, antes de entrenar el modelo NTM. Esto asegura que el modelo se enfoque en palabras significativas. Invocar el reconocimiento de entidades de Amazon Comprehend no es la solución adecuada porque está diseñado para identificar entidades nombradas (personas, lugares, organizaciones), no para eliminar palabras vacías en un contexto de modelado de temas. Ejecutar PCA (Análisis de Componentes Principales) es una técnica de reducción de dimensionalidad que se aplica a datos numéricos, no a texto sin procesar, y no aborda directamente el problema de las palabras vacías. Usar el algoritmo de detección de objetos de SageMaker es incorrecto porque está diseñado para identificar objetos en imágenes o videos, no para procesar texto o modelar temas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta