Usando SageMaker Data Wrangler, un ingeniero encuentra una característica categórica de texto con miles de valores ligeramente diferentes causados por errores ortográficos. ¿Qué método de codificación se debe usar para que la característica procesada pueda usarse para la clasificación?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar codificación de similitud para agrupar y representar categorías con ortografía similar..
Por qué esta es la respuesta
La codificación de similitud es la mejor opción porque aborda directamente el problema de los errores ortográficos en una característica categórica. Este método agrupa valores con ortografía similar, lo que permite tratarlos como la misma categoría subyacente. Esto reduce la dimensionalidad y mejora la calidad de los datos para el modelo de clasificación. La codificación ordinal asignaría un orden a las categorías, lo cual no es apropiado aquí y no resolvería los errores ortográficos. La codificación one-hot crearía una columna para cada una de las miles de categorías distintas (incluyendo las mal escritas), lo que resultaría en una matriz dispersa y de alta dimensionalidad, ineficiente y propensa a sobreajuste. La codificación de destino mapea categorías a una estadística del objetivo, lo cual es útil para características categóricas limpias, pero no corrige los errores ortográficos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta