Je gaat een model bouwen met BigQuery ML en hosten op Vertex AI. Vendorstreams komen continu binnen en kunnen ongeldige waarden bevatten. Wat moet je doen voor near-realtime verwerking en sanering vóór BigQuery?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een Pub/Sub-onderwerp en stuur alle vendor data ernaartoe. Gebruik Dataflow om de Pub/Sub-gegevens te verwerken en te saneren en deze naar BigQuery te streamen..
Waarom dit het antwoord is
De correcte aanpak is om Pub/Sub te gebruiken voor het opvangen van de continue datastromen van vendors. Pub/Sub is een schaalbare messaging-service die geschikt is voor near-realtime data-ingestie. Vervolgens is Dataflow de meest geschikte service voor het verwerken en saneren van deze gegevens. Dataflow biedt krachtige mogelijkheden voor streamverwerking (ETL) en kan de onbewerkte data uit Pub/Sub transformeren, ongeldige waarden opschonen en de gesaneerde data naar BigQuery streamen. De optie om direct naar BigQuery te streamen met streaming inserts is minder ideaal omdat BigQuery zelf geen ingebouwde robuuste sanerings- en transformatiemogelijkheden heeft voor complexe streamverwerking. Een Cloud Function kan wel saneren, maar is minder geschikt voor hoge volumes en complexe transformaties vergeleken met Dataflow. Een BigQuery ML-model direct op "ingestion"-data trainen zonder voorafgaande sanering leidt tot slechte modelprestaties door de ongeldige waarden.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig