Een Dataproc Spark-taak met veel shuffles leest parquet-bestanden van elk ~200-400 MB en draait op preemptible workers met slechts twee niet-preemptible nodes. Welke wijziging moet u aanbrengen om de prestaties kosteneffectief te verbeteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Schakel over van HDD's naar SSD's, overschrijf de configuratie van de preemptible VM's om de grootte van de opstartschijf te vergroten..
Waarom dit het antwoord is
De Spark-taak heeft veel shuffles en draait op preemptible workers, wat betekent dat de taak gevoelig is voor prestatieproblemen door I/O en het verlies van workers. Het overschakelen van HDD's naar SSD's verbetert de I/O-prestaties aanzienlijk, wat cruciaal is voor shuffle-intensieve taken. Het vergroten van de opstartschijfgrootte op preemptible VM's biedt meer ruimte voor Spark's shuffle-bestanden en tijdelijke gegevens, waardoor disk spills worden verminderd en de stabiliteit en prestaties van de taak worden verbeterd, vooral bij het omgaan met preemptie. Het vergroten van parquet-bestanden naar 1 GB is niet direct de meest kosteneffectieve oplossing voor shuffle-prestaties en kan zelfs leiden tot minder parallelle verwerking. TFRecords zijn niet het meest geschikte formaat voor Spark-taken en bieden geen voordelen ten opzichte van Parquet voor deze use case. Het kopiëren van gegevens naar HDFS en terug naar GCS introduceert onnodige complexiteit en overhead, en is niet kosteneffectief.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig