È necessaria una pipeline serverless di acquisizione e analisi in tempo reale per eventi JSON in streaming ad alto volume. La pipeline deve eseguire il buffering dei dati, convertire JSON in un formato colonnare ottimizzato per le query senza perdita di dati, archiviare i risultati in un datastore ad alta disponibilità e consentire agli analisti di eseguire query SQL e connettere dashboard di BI. Qual è il design che soddisfa al meglio questi requisiti?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Definire uno schema in un Data Catalog gestito per il formato in ingresso. Utilizzare un servizio di delivery in streaming gestito per acquisire gli eventi, trasformarli in un formato colonnare (Parquet o ORC) utilizzando il Data Catalog e consegnare i risultati all'object storage. Consentire agli analisti di interrogare l'object store utilizzando un motore di query SQL serverless e connettere gli strumenti di BI con il suo connettore JDBC..
Perché questa è la risposta
L'opzione corretta utilizza un servizio di delivery in streaming gestito (es. Amazon Kinesis Data Firehose) per acquisire eventi JSON ad alto volume, che può bufferizzare i dati e integrarli con un Data Catalog (es. AWS Glue Data Catalog) per definire lo schema. Kinesis Data Firehose può quindi trasformare i dati in un formato colonnare ottimizzato per le query (Parquet o ORC) e consegnarli all'object storage (es. Amazon S3), che offre alta disponibilità. Un motore di query SQL serverless (es. Amazon Athena) può interrogare direttamente i dati su S3, e la connettività JDBC permette l'integrazione con strumenti di BI. Le opzioni errate presentano inefficienze o non soddisfano tutti i requisiti: Scrivere ogni record JSON in S3 e poi usare una funzione serverless per la conversione è meno efficiente per l'alto volume e introduce latenza. Inserire ogni record convertito in un database relazionale gestito è costoso e meno scalabile per volumi elevati rispetto all'object storage per l'analisi di dati grezzi. Un servizio di elaborazione di stream SQL in tempo reale non gestisce intrinsecamente il buffering e la conversione in Parquet per l'archiviazione finale in modo così integrato e serverless come Kinesis Data Firehose.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta