Ein Dataflow-Job, der gzipped-Textdateien aufnimmt, verwendet SideInputs, um Daten zu verbinden, und schreibt Fehler in eine Dead-Letter-Queue. Die Job-Laufzeit ist jedoch länger als erwartet. Welche Änderung beschleunigt die Pipeline?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: CoGroupByKey anstelle des SideInput verwenden..
Warum dies die Antwort ist
Die Verwendung von CoGroupByKey anstelle von SideInput kann die Pipeline beschleunigen, da SideInput bei großen Side-Inputs zu Engpässen führen kann, da die gesamten Daten auf jeden Worker repliziert werden müssen. CoGroupByKey hingegen verteilt die Daten über die Worker und führt die Gruppierung parallel aus, was bei großen Datensätzen effizienter ist. Das Umstellen auf komprimiertes Avro würde zwar die Dateigröße reduzieren, aber nicht unbedingt die Verarbeitungslogik beschleunigen. Das Reduzieren der Batch-Größe würde die Verarbeitungszeit wahrscheinlich erhöhen, da mehr Overhead für kleinere Batches entsteht. Das erneute Versuchen fehlerhafter Datensätze würde die Laufzeit verlängern, anstatt sie zu verkürzen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich