Een Dataflow-taak die gzipped tekstbestanden inleest, gebruikt SideInputs om gegevens te joinen en schrijft fouten naar een dead-letter queue, maar de runtime van de taak is langer dan verwacht. Welke wijziging versnelt de pipeline?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik CoGroupByKey in plaats van de SideInput..
Waarom dit het antwoord is
Het gebruik van CoGroupByKey in plaats van SideInput kan de pipeline versnellen omdat SideInput de volledige side input in het geheugen van elke worker laadt, wat inefficiënt kan zijn bij grote datasets. CoGroupByKey daarentegen is ontworpen voor het efficiënt joinen van grote datasets door sleutels te groeperen en de join-logica gedistribueerd uit te voeren. Het wijzigen naar gecomprimeerde Avro-bestanden kan de I/O verbeteren, maar pakt de inefficiëntie van de join-strategie niet direct aan. Het verlagen van de batchgrootte kan de overhead verhogen en de prestaties verminderen. Het opnieuw proberen van records die een fout veroorzaken, is een foutafhandeling en heeft geen invloed op de algemene runtime van een correct werkende pipeline.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig