Un ingeniero de ML debe procesar miles de archivos CSV existentes, además de nuevas cargas de CSV, almacenados en un bucket central de S3. Todos los CSV comparten el mismo diseño de columna e incluyen una columna de fecha de transacción que debe ser consultada. ¿Qué solución logra esto con la menor sobrecarga operativa?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar un Amazon Athena CREATE TABLE AS SELECT (CTAS) para construir una tabla (particionada o filtrada por transaction date) sobre los datos de S3, y luego consultar esa tabla..
Por qué esta es la respuesta
La opción correcta es ejecutar un Amazon Athena CREATE TABLE AS SELECT (CTAS) porque Athena permite consultar directamente los datos en S3 utilizando SQL estándar, sin necesidad de mover o transformar los datos. Al usar CTAS, se puede crear una tabla particionada por la fecha de transacción, lo que optimiza significativamente el rendimiento de las consultas y reduce los costos al escanear menos datos. Esta solución es de baja sobrecarga operativa ya que Athena es un servicio sin servidor. Las otras opciones implican mover datos a un nuevo bucket de S3 o usar servicios más complejos como AWS Glue o Kinesis Data Firehose, lo que aumenta la sobrecarga operativa y los costos. S3 Object Lambda no es ideal para consultas complejas sobre miles de archivos CSV, y AWS Glue para Apache Spark, aunque potente, es una solución más pesada para este caso de uso. Kinesis Data Firehose está diseñado para ingesta de datos en tiempo real, no para consultas de datos existentes.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta