Un socio externo deposita CSV diarios con algunas filas mal formadas en GCS. Necesitas cargar estos datos en BigQuery e inspeccionar las filas incorrectas. ¿Qué diseño de pipeline es el adecuado?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar un pipeline por lotes de Google Cloud Dataflow para importar los datos en BigQuery y enviar los errores a otra tabla de "dead-letter" para su análisis..
Por qué esta es la respuesta
La opción correcta es usar un pipeline de Google Cloud Dataflow. Dataflow es ideal para procesar y transformar grandes volúmenes de datos, permitiendo la limpieza y el manejo de errores. Puede leer los CSV de GCS, aplicar transformaciones para corregir o identificar filas mal formadas y cargar los datos válidos en BigQuery. Las filas erróneas pueden dirigirse a una tabla de "dead-letter" para su posterior análisis sin detener el proceso principal. Las fuentes de datos federadas no permiten la limpieza de datos antes de la carga ni el manejo de errores. Habilitar el monitoreo de BigQuery en Stackdriver solo alertaría sobre fallos, pero no resolvería el problema de las filas mal formadas ni las aislaría. Importar con gcloud CLI y maxbadrecords=0 detendría la carga ante la primera fila incorrecta, impidiendo que los datos válidos lleguen a BigQuery.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta