Necesita un pipeline de ingesta y análisis en tiempo real sin servidor para eventos JSON de streaming de alto volumen. El pipeline debe almacenar datos en búfer, convertir JSON a un formato columnar optimizado para consultas sin perder datos, almacenar los resultados en un almacén de datos de alta disponibilidad y permitir que los analistas ejecuten consultas SQL y conecten paneles de BI. ¿Qué diseño cumple mejor con estos requisitos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Defina un esquema en un Data Catalog gestionado para el formato entrante. Utilice un servicio de entrega de streaming gestionado para ingerir los eventos, transformarlos a un formato columnar (Parquet u ORC) utilizando el Data Catalog y entregar los resultados al almacenamiento de objetos. Permita que los analistas consulten el almacén de objetos utilizando un motor de consulta SQL sin servidor y conecten herramientas de BI con su conector JDBC..
Por qué esta es la respuesta
La opción correcta utiliza un servicio de entrega de streaming gestionado (como Amazon Kinesis Data Firehose) para ingerir y transformar los datos JSON a un formato columnar optimizado (Parquet u ORC) usando un Data Catalog (como AWS Glue Data Catalog) para el esquema. Luego, los datos se almacenan en un almacenamiento de objetos (Amazon S3), que es de alta disponibilidad y rentable. Un motor de consulta SQL sin servidor (como Amazon Athena) permite a los analistas consultar directamente S3, y las herramientas de BI se conectan a través de JDBC. Este diseño es completamente sin servidor y cumple con todos los requisitos. Las opciones incorrectas presentan deficiencias: Escribir cada registro JSON individualmente en S3 y luego usar una función sin servidor para convertirlo es ineficiente y costoso para alto volumen, ya que cada registro activaría una función. Insertar cada registro convertido en una base de datos relacional gestionada sería muy costoso y escalaría mal para eventos de streaming de alto volumen, además de no ser ideal para análisis de datos masivos. Un servicio de procesamiento de streaming SQL en tiempo real (como Kinesis Data Analytics) puede convertir a Parquet, pero la opción correcta ofrece una solución más completa y gestionada para la ingesta, transformación y almacenamiento final.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta