Het streamen van IoT-gegevens van Cloud Pub/Sub via Dataflow naar BigQuery toont ~2% corrupte records in een preview. Hoe moet u de Cloud Dataflow-pipeline aanpassen om corrupte gegevens eruit te filteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Voeg een ParDo-transformatie toe in Cloud Dataflow om corrupte elementen te verwijderen..
Waarom dit het antwoord is
Een ParDo-transformatie is de meest geschikte methode om corrupte records uit een Dataflow-pipeline te filteren. ParDo staat voor "Parallel Do" en is de kern van de verwerking in Apache Beam (waar Dataflow op gebaseerd is). Het stelt u in staat om een functie toe te passen op elk element in een PCollection, waardoor u elk record afzonderlijk kunt inspecteren en beslissen of het moet worden opgenomen in de uitvoer PCollection. In dit geval zou de ParDo-transformatie logica bevatten om te controleren op corruptie en alleen de geldige records door te geven. Een SideInput is bedoeld voor het verrijken van gegevens, niet voor filtering op basis van de inhoud van het element zelf. Een Partition-transformatie verdeelt een PCollection in meerdere PCollections op basis van een sleutel of functie, maar verwijdert geen elementen. Een GroupByKey-transformatie groepeert elementen met dezelfde sleutel en is niet bedoeld voor het filteren van individuele corrupte records.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig