Je hebt een pipeline nodig om tijdreeks transactiedata naar BigQuery te kopiëren voor analyse. De initiële grootte van de dataset is 1,5 PB en groeit met 3 TB/dag; duizenden transacties worden elk uur bijgewerkt met een nieuwe status. De data is sterk gestructureerd en wordt gebruikt voor ML. Welke twee strategieën pas je toe om de prestaties en bruikbaarheid te maximaliseren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Denormaliseer de data zoveel mogelijk., Ontwikkel een datapipeline waarbij statusupdates aan BigQuery worden toegevoegd (appended) in plaats van bijgewerkt (updated)..
Waarom dit het antwoord is
Denormalisatie is cruciaal voor BigQuery's prestaties, vooral bij grote datasets en ML-gebruik, omdat het joins vermindert en de querysnelheid verhoogt. De data is al sterk gestructureerd, wat denormalisatie vergemakkelijkt. Het toevoegen van statusupdates (append) in plaats van het bijwerken (update) is essentieel voor BigQuery's architectuur. BigQuery is geoptimaliseerd voor het toevoegen van data en minder efficiënt voor frequente updates, vooral bij duizenden transacties per uur. Dit voorkomt dure en trage UPDATE operaties, wat de prestaties en bruikbaarheid maximaliseert. Het behouden van de structuur zou leiden tot meer joins en tragere queries. BigQuery UPDATE is inefficiënt voor deze schaal. Een dagelijkse snapshot in Cloud Storage met externe tabellen zou de realtime analyse van uurlijkse updates belemmeren.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig