Una nueva aplicación produce ~150 GB/día de JSON para fin de año. Requisitos: desacoplar productor/consumidor, almacenamiento indefinido de datos sin procesar rentable, SQL casi en tiempo real e historial consultable con SQL de más de 2 años. ¿Qué pipeline de ingesta y almacenamiento satisface estas necesidades?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Publicar eventos en Cloud Pub/Sub y usar un pipeline de Dataflow para convertir JSON a Avro, escribiendo en Cloud Storage y BigQuery..
Por qué esta es la respuesta
La opción correcta satisface todos los requisitos. Cloud Pub/Sub desacopla el productor del consumidor y permite la ingesta de eventos en tiempo real. Un pipeline de Dataflow puede procesar los datos de forma escalable, convirtiendo JSON a Avro para una mayor eficiencia de almacenamiento y consulta. Escribir en Cloud Storage proporciona almacenamiento indefinido y rentable de datos sin procesar. Escribir en BigQuery permite consultas SQL casi en tiempo real y el historial de más de dos años. Las otras opciones tienen deficiencias: La API con poller y Cloud Storage no permite consultas SQL casi en tiempo real ni desacopla completamente. Escribir directamente en Cloud SQL no es ideal para 150 GB/día de JSON y las exportaciones periódicas no son casi en tiempo real. Spark en Dataproc con HDFS en discos persistentes es más complejo y costoso para el almacenamiento indefinido y no ofrece la misma integración con BigQuery para SQL en tiempo real.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta