Een ML-engineer gaat Amazon SageMaker Canvas gebruiken om een model te trainen met complex gestructureerde data die is opgeslagen in Amazon S3. Welk bestandsformaat minimaliseert de voorverwerkingstijd voor die data?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Apache Parquet-bestanden.
Waarom dit het antwoord is
Apache Parquet is een kolomgeoriënteerd bestandsformaat dat geoptimaliseerd is voor analytische queries en grote datasets. Het comprimeert data efficiënt en maakt het mogelijk om alleen de benodigde kolommen te lezen, wat de I/O-kosten en voorverwerkingstijd aanzienlijk vermindert, vooral bij complex gestructureerde data. CSV-bestanden, zelfs gecomprimeerd met Snappy, zijn rijgeoriënteerd en vereisen het lezen van alle kolommen, wat minder efficiënt is. JSON-objecten en JSON-bestanden (zelfs gecomprimeerd met gzip) zijn ook rijgeoriënteerd en hebben een hogere overhead voor parsing en opslag in vergelijking met Parquet, wat resulteert in langere voorverwerkingstijden.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig