Una PoC de una aerolínea almacena métricas diarias en formato CSV en S3, particionadas por fecha, y las consulta con Amazon Athena. A medida que los datos crecen, la empresa quiere optimizar el almacenamiento para mejorar el rendimiento de las consultas. ¿Qué dos acciones debería tomar? (Elija dos)
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar un bucket de S3 que esté en la misma AWS Region donde la empresa ejecuta las consultas de Athena., Preprocesar los datos .csv a formato Apache Parquet obteniendo solo los bloques de datos que son necesarios para los predicados..
Por qué esta es la respuesta
La opción de usar un bucket de S3 en la misma región que las consultas de Athena es correcta porque reduce la latencia de red y evita costos de transferencia de datos entre regiones, lo que mejora significativamente el rendimiento de las consultas. La opción de preprocesar los datos CSV a formato Apache Parquet es correcta porque Parquet es un formato columnar optimizado para el análisis. Permite a Athena leer solo las columnas necesarias para una consulta (proyección de columnas) y saltar bloques de datos irrelevantes (poda de particiones y predicados), lo que disminuye la cantidad de datos escaneados y acelera las consultas. Añadir una cadena aleatoria a las claves de S3 no mejora el rendimiento de las particiones; de hecho, podría dificultar la poda de particiones. Usar un bucket en la misma cuenta no garantiza un mejor rendimiento si no está en la misma región. Preprocesar a JSON no es óptimo porque JSON es un formato basado en filas y no ofrece las mismas ventajas de rendimiento columnar que Parquet.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta