Un ingeniero de datos debe cargar archivos .csv estructurados (15 columnas) en un data lake de Amazon S3. Los analistas ejecutan consultas de Amazon Athena que normalmente hacen referencia a solo una o dos columnas y rara vez escanean el archivo completo. ¿Qué enfoque es el más rentable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Crear un trabajo de extracción, transformación y carga (ETL) de AWS Glue para leer desde la fuente de datos estructurados .csv. Configurar el trabajo para escribir los datos en el data lake en formato Apache Parquet..
Por qué esta es la respuesta
La opción correcta es utilizar AWS Glue para convertir los datos a Apache Parquet. Parquet es un formato de almacenamiento columnar optimizado para el rendimiento y el costo en consultas analíticas. Dado que los analistas consultan solo unas pocas columnas, Parquet permite a Athena leer únicamente los datos relevantes, reduciendo la cantidad de datos escaneados y, por lo tanto, el costo. Las otras opciones son menos eficientes: Mantener el formato .csv (opción 1) es costoso porque Athena escanearía el archivo completo para cada consulta, incluso si solo se necesitan unas pocas columnas. JSON (opción 2) es un formato basado en filas, lo que también resultaría en un escaneo completo del archivo para consultas de columnas específicas. Apache Avro (opción 3) es un formato basado en filas que, aunque es bueno para la evolución del esquema, no ofrece las mismas ventajas de rendimiento y costo para consultas columnares que Parquet.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta