Una empresa minorista carga archivos CSV de pedidos minoristas diarios en una única ruta de S3 y utiliza Amazon Redshift Spectrum para consultar subconjuntos de los datos de más de 100 columnas. La fuente de terceros produce más de 30 archivos CSV por día (de 50 a 70 MB cada uno). Los usuarios agregan métricas diarias, pero el rendimiento de las consultas se ha degradado. ¿Qué combinación de acciones resolverá los problemas de rendimiento con el menor esfuerzo de desarrollo? (Elija dos)
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Configurar la aplicación de terceros para que produzca los archivos en un formato columnar., Particionar los datos de pedidos en el bucket de S3 por fecha de pedido..
Por qué esta es la respuesta
La configuración de la aplicación de terceros para producir archivos en un formato columnar (como Parquet u ORC) es crucial. Redshift Spectrum se beneficia enormemente de los formatos columnares porque solo lee las columnas necesarias para una consulta, reduciendo la cantidad de datos escaneados y mejorando el rendimiento. Particionar los datos de pedidos en el bucket de S3 por fecha de pedido es la otra acción clave. Esto permite a Redshift Spectrum podar particiones, es decir, escanear solo los datos relevantes para el rango de fechas consultado, lo que acelera significativamente las consultas diarias. Combinar los archivos CSV en uno solo no resuelve el problema fundamental de escaneo de datos. Producir JSON no es tan eficiente como un formato columnar para Redshift Spectrum. Cargar JSON en una columna SUPER en Redshift no aborda el rendimiento de Spectrum sobre S3.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta