Een schijf-I/O-intensieve Hadoop-taak draait veel langzamer op Dataproc met Cloud Storage voor intermediates dan op on-prem bare-metal HDFS. Hoe los je dit op terwijl je opslag en compute gescheiden houdt?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Provisioneer meer persistent disk en bewaar de intermediate data van die taak op native HDFS.
Waarom dit het antwoord is
De taak is schijf-I/O-intensief, wat betekent dat de prestaties worden beperkt door de snelheid van de opslag. Cloud Storage is geoptimaliseerd voor schaalbaarheid en duurzaamheid, maar kan hogere latentie hebben dan lokale schijven, vooral voor kleine, willekeurige I/O's die vaak voorkomen bij intermediates in Hadoop. Door meer persistent disk te provisioneren en native HDFS te gebruiken, worden de intermediates lokaal op snelle schijven opgeslagen, wat de I/O-prestaties aanzienlijk verbetert. Meer geheugen helpt alleen als de intermediates in het geheugen passen, wat vaak niet het geval is voor I/O-intensieve taken. Meer CPU-cores verhoogt niet direct de netwerkbandbreedte of schijf-I/O. Extra NIC's verbeteren de doorvoer naar Cloud Storage, maar lossen het onderliggende probleem van de latentie van Cloud Storage voor kleine I/O's niet op.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig