Una empresa almacena datos diarios de clickstream de series temporales en Amazon S3 (millones de filas por día). Los ingenieros de ML ejecutan informes diarios y analizan tendencias de tres días con Amazon Athena. Los datos deben retenerse durante 30 días antes de su archivo. ¿Qué diseño ofrece el mayor rendimiento de recuperación de datos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Particionar los objetos de series temporales en S3 por prefijo de fecha y aplicar políticas de S3 Lifecycle para archivar particiones de más de 30 días en S3 Glacier Flexible Retrieval..
Por qué esta es la respuesta
Particionar los objetos de series temporales en S3 por prefijo de fecha (por ejemplo, s3://bucket/año=YYYY/mes=MM/día=DD/) es la solución más eficiente. Amazon Athena se beneficia enormemente de las particiones, ya que solo escanea los datos relevantes para la consulta, reduciendo la cantidad de datos procesados y mejorando el rendimiento y reduciendo costos. Las políticas de S3 Lifecycle automatizan el archivo de datos antiguos a S3 Glacier Flexible Retrieval, optimizando el almacenamiento. Las otras opciones son menos eficientes. Mantener todos los datos sin particiones obliga a Athena a escanear todo el conjunto de datos, lo que es lento y costoso. Usar AWS Lambda para copiar archivos es una solución más compleja y costosa que las políticas de ciclo de vida. Almacenar cada día en su propio bucket de S3 es impráctico y no ofrece las ventajas de rendimiento de las particiones de Athena.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta