Una empresa tiene una carpeta S3 que contiene tipos de archivos mixtos (CSV, JSON, XLSX y Apache Parquet). Un ingeniero de ML utilizará AWS Glue DataBrew para procesar los datos y debe guardar la salida final de nuevo en S3 para que AWS Glue pueda consumirla más tarde. ¿Qué enfoque satisface estos requisitos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Separar los archivos en carpetas distintas por tipo de archivo, procesar cada carpeta con DataBrew y escribir las salidas en formato Apache Parquet..
Por qué esta es la respuesta
AWS Glue DataBrew puede procesar datos de una carpeta S3 que contiene tipos de archivos mixtos. Sin embargo, para una ingestión y procesamiento óptimos por parte de AWS Glue posteriormente, es una buena práctica organizar los datos. Separar los archivos por tipo en carpetas distintas permite a DataBrew procesar cada conjunto de datos de manera más eficiente y aplicar transformaciones específicas si es necesario. Guardar la salida en formato Apache Parquet es la opción más eficiente porque Parquet es un formato de almacenamiento en columnas optimizado para el análisis de big data, lo que lo hace ideal para el consumo por parte de AWS Glue y otros servicios analíticos. La opción de "AWS Glue Parquet" no es un formato de archivo distinto; AWS Glue consume Parquet estándar.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta