Je wilt een trage PySpark batch-pipeline herbouwen met behulp van een serverless, SQL-gebaseerde aanpak. Ruwe data bevindt zich in Cloud Storage. Hoe moet je de pipeline implementeren om de ontwikkeling en runtime te versnellen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Laad de data vanuit Cloud Storage in BigQuery, vertaal PySpark-transformaties naar BigQuery SQL en schrijf de resultaten naar een nieuwe BigQuery-tabel..
Waarom dit het antwoord is
De correcte aanpak is om de data vanuit Cloud Storage direct in BigQuery te laden en de PySpark-transformaties te vertalen naar BigQuery SQL. BigQuery is een serverloze, schaalbare datawarehouse-oplossing die geoptimaliseerd is voor SQL-gebaseerde analyses, wat resulteert in snellere ontwikkeling en runtime vergeleken met PySpark op Dataproc. De output kan vervolgens direct naar een nieuwe BigQuery-tabel worden geschreven. De andere opties zijn minder optimaal: PySpark-commando's converteren naar SparkSQL en uitvoeren op Dataproc behoudt de complexiteit en operationele overhead van een Spark-cluster, wat niet serverloos is. Data importeren in Cloud SQL is ongeschikt voor grote datasets en analytische workloads, en federated queries vanuit BigQuery voor ML is een aparte stap die de initiële transformatie niet versnelt. Herimplementeren met Apache Beam Python SDK is een geldige optie voor serverloze dataverwerking, maar het vereist het herschrijven van de pipeline in een andere programmeertaal en framework, wat meer ontwikkelingsinspanning kan kosten dan het vertalen naar BigQuery SQL.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig