Recibes un archivo Apache Parquet de 50 MB para un modelo de detección de fraude que contiene varias columnas correlacionadas e innecesarias. ¿Cuál es la forma más sencilla de eliminar esas columnas del archivo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Crear un flujo de datos en SageMaker Data Wrangler y añadir un paso de transformación para eliminar las columnas innecesarias..
Por qué esta es la respuesta
La opción correcta es crear un flujo de datos en SageMaker Data Wrangler y añadir un paso de transformación para eliminar las columnas. SageMaker Data Wrangler es una herramienta visual de preparación de datos que permite importar, analizar, transformar y exportar datos para el aprendizaje automático de manera eficiente. Su interfaz de usuario facilita la selección y eliminación de columnas innecesarias sin necesidad de escribir código complejo. Las otras opciones son menos eficientes o apropiadas para esta tarea: Descargar el archivo a la estación de trabajo local y usar un script Python es posible, pero menos escalable y más manual, especialmente si los datos crecen o la tarea se repite. La codificación one-hot no es relevante para la eliminación de columnas. Crear un trabajo de Apache Spark en Amazon EMR es una solución robusta para grandes volúmenes de datos, pero para un archivo de 50 MB, es una sobreingeniería y requiere más configuración y gestión que Data Wrangler. Iniciar un trabajo de procesamiento de SageMaker con el SDK de Python es una opción programática, pero Data Wrangler ofrece una solución sin código o con poco código que es más rápida y sencilla para la eliminación de columnas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta