Ha recibido un conjunto de datos CSV en S3 que utilizará para el entrenamiento de ML. Antes del entrenamiento, debe encontrar valores faltantes o no válidos y contar los valores atípicos con el menor esfuerzo operativo. ¿Qué enfoque cumple con este requisito?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Mantenga los datos como CSV, impórtelos a SageMaker Data Wrangler y use el informe de Data Quality and Insights..
Por qué esta es la respuesta
La opción correcta es mantener los datos como CSV, importarlos a SageMaker Data Wrangler y usar el informe de Data Quality and Insights. SageMaker Data Wrangler está diseñado específicamente para la preparación de datos y ofrece una interfaz visual intuitiva para identificar valores faltantes, inválidos y atípicos, generando un informe detallado con el menor esfuerzo operativo. Las otras opciones son menos eficientes para este caso de uso. Convertir a Parquet con AWS Glue y luego usar Athena es un proceso más complejo y requiere escribir consultas SQL para cada estadística, lo que aumenta el esfuerzo. Mantener el CSV y usar un crawler de AWS Glue con Athena también implica escribir SQL y no proporciona las capacidades de visualización y generación de informes automáticos de Data Wrangler. Si bien Data Wrangler puede importar Parquet, convertir el CSV a Parquet primero añade un paso innecesario cuando Data Wrangler puede procesar CSV directamente.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta