Hai dei job Spark on-prem che elaborano quotidianamente file Parquet. Migrando a Google Cloud, desideri servizi gestiti, modifiche minime all'ETL e disponibilità di BigQuery per pipeline future. Cosa dovresti fare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Migrare i dati su Cloud Storage e migrare i metadati su Dataproc Metastore (DPMS). Rielaborare i job Spark per leggere/scrivere su Cloud Storage ed eseguirli su Dataproc Serverless..
Perché questa è la risposta
La migrazione dei dati su Cloud Storage e dei metadati su Dataproc Metastore (DPMS) consente di mantenere il formato Parquet e la compatibilità con Spark, minimizzando le modifiche all'ETL. L'esecuzione dei job su Dataproc Serverless offre un servizio completamente gestito, eliminando la necessità di gestire cluster e scalando automaticamente, allineandosi all'esigenza di servizi gestiti. Inoltre, Cloud Storage è la base ideale per future integrazioni con BigQuery tramite tabelle esterne o BigLake. Le altre opzioni sono meno ottimali: Registrare il bucket come risorsa Dataplex non sostituisce la necessità di un metastore per Spark. Migrare i dati direttamente in BigQuery richiederebbe una riscrittura più significativa dei job Spark per adattarsi al modello di BigQuery. BigLake è una tecnologia che si basa su Cloud Storage, non un sostituto. Eseguire Dataproc su Compute Engine non è un servizio completamente serverless, contraddicendo l'esigenza di servizi gestiti.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta