Para acelerar las consultas de Amazon Athena, un ingeniero de datos descubre que todos los archivos de entrada son .csv sin comprimir y que la mayoría de las consultas seleccionan una sola columna. ¿Qué cambio MEJORARÁ MÁS el rendimiento de las consultas de Athena?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Cambiar el formato de datos de .csv a Apache Parquet. Aplicar compresión Snappy..
Por qué esta es la respuesta
Convertir los archivos .csv a Apache Parquet con compresión Snappy es la mejor opción. Parquet es un formato de almacenamiento columnar optimizado para análisis, lo que significa que Athena solo necesita leer las columnas consultadas, no todo el archivo. Esto reduce significativamente la cantidad de datos escaneados y, por lo tanto, el costo y el tiempo de la consulta. La compresión Snappy es un buen equilibrio entre velocidad de compresión/descompresión y tamaño de archivo. Las otras opciones son menos efectivas: Convertir a JSON no ofrece los beneficios de un formato columnar y puede ser menos eficiente para consultas selectivas. Aplicar compresión Snappy a los CSV existentes mejora el tamaño del archivo, pero no resuelve el problema de que Athena aún debe leer filas completas. Comprimir con Gzip es una buena compresión, pero Gzip no es "splittable" (divisible), lo que puede limitar el paralelismo de Athena, y sigue sin ser un formato columnar.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta