Un científico de datos debe producir un análisis exploratorio inicial de los comentarios de los clientes utilizando gráficos y una nube de palabras, y quiere aplicar ingeniería de características antes de construir un modelo de PNL. ¿Qué dos técnicas de ingeniería de características se deben usar para preparar el texto para la visualización y el modelado? (Elija dos).
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Stemming, Term frequency–inverse document frequency (TF‑IDF).
Por qué esta es la respuesta
El stemming (derivación) reduce las palabras a su raíz o forma base (por ejemplo, "corriendo", "corrió" y "corre" se convierten en "corr-"). Esto es crucial para la visualización y el modelado, ya que agrupa palabras con significados similares, lo que mejora la precisión de las nubes de palabras y reduce la dimensionalidad para los modelos de PNL. TF-IDF (frecuencia de término-frecuencia inversa de documento) es una técnica de vectorización que asigna un peso numérico a cada palabra, reflejando su importancia en un documento en relación con una colección de documentos. Esto es esencial para el modelado de PNL, ya que convierte el texto en un formato numérico que los algoritmos de aprendizaje automático pueden procesar, y también puede informar la visualización al resaltar términos clave. La resolución de correferencias y el reconocimiento de entidades nombradas son técnicas de PNL más avanzadas que se centran en la comprensión del contexto y las relaciones, no en la preparación básica para la visualización o la vectorización inicial. El análisis de sentimientos es una tarea de PNL en sí misma, no una técnica de ingeniería de características para la preparación general del texto.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta