Debe consultar un conjunto de datos en Amazon S3 usando Amazon Athena. El conjunto de datos contiene más de 800 000 registros CSV; cada registro tiene 200 columnas y un tamaño aproximado de 1,5 MB, pero la mayoría de las consultas acceden solo a 5-10 columnas. ¿Qué conversión de formato minimizará el tiempo de ejecución de la consulta?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Convertir el conjunto de datos al formato columnar Apache Parquet..
Por qué esta es la respuesta
Convertir a Apache Parquet es la mejor opción porque es un formato de almacenamiento de datos columnar optimizado para el rendimiento de consultas analíticas. Almacena los datos columna por columna, lo que permite a Athena leer solo las columnas necesarias para una consulta, minimizando la cantidad de datos escaneados y, por lo tanto, el tiempo de ejecución y el costo. Dado que la mayoría de las consultas acceden solo a 5-10 de 200 columnas, Parquet es ideal. JSON y XML son formatos de fila y no ofrecen esta optimización. Comprimir CSV con GZIP reduciría el tamaño de almacenamiento, pero Athena aún tendría que escanear y descomprimir todas las columnas de cada fila, lo que sería menos eficiente que Parquet para consultas selectivas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta