Een bedrijf heeft het volume aan CSV-bestanden dat is opgeslagen in een Amazon S3-bucket aanzienlijk vergroot. Datatransformatiescripts en -query's zijn veel trager geworden. Een ML-engineer moet een oplossing implementeren die de gegevens optimaliseert voor queryprestaties met de MINSTE operationele overhead. Welke optie voldoet aan deze vereiste?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Configureer een AWS Glue extract, transform, and load (ETL)-taak om de .csv-bestanden te converteren naar Apache Parquet-formaat..
Waarom dit het antwoord is
De correcte optie is het configureren van een AWS Glue ETL-taak om de .csv-bestanden te converteren naar Apache Parquet-formaat. Parquet is een kolomgeoriënteerd opslagformaat dat geoptimaliseerd is voor analytische query's, wat resulteert in aanzienlijk snellere prestaties en lagere kosten dan CSV. AWS Glue is een serverloze ETL-service die de operationele overhead minimaliseert. Het opsplitsen van CSV-bestanden in kleinere objecten (optie 1) kan de prestaties enigszins verbeteren, maar lost het fundamentele probleem van het rijgeoriënteerde CSV-formaat niet op en voegt operationele complexiteit toe. Het verwijderen van kolommen met string-type waarden (optie 2) is geen algemene oplossing voor queryprestaties en kan leiden tot gegevensverlies. Een Amazon EMR-cluster (optie 4) biedt krachtige verwerkingsmogelijkheden, maar heeft een hogere operationele overhead dan AWS Glue, wat in strijd is met de vereiste van "MINSTE operationele overhead".
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig