Een data scientist gaat Amazon SageMaker Data Wrangler gebruiken om historische S3-gegevens in te laden voor verkennende data-analyse (EDA) om zeldzame afwijkingen te vinden. Welke importoptie moet de data scientist kiezen om de compute resources te minimaliseren tijdens het uitvoeren van EDA?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Importeer de gegevens met de optie First K, waarbij K wordt geselecteerd op basis van domeinkennis..
Waarom dit het antwoord is
De optie 'First K' importeert de eerste K rijen van de dataset. Dit minimaliseert de compute resources omdat alleen een klein, vast deel van de gegevens wordt geladen en verwerkt, wat ideaal is voor snelle EDA, vooral bij het zoeken naar zeldzame afwijkingen die mogelijk al vroeg in de dataset voorkomen. De waarde van K wordt gekozen op basis van domeinkennis om een representatief, maar klein genoeg, deel van de gegevens te garanderen. De optie 'None' importeert de volledige dataset, wat de compute resources maximaliseert en onnodig is voor EDA. 'Stratified' en 'Randomized' importeren een steekproef, maar vereisen meer compute resources dan 'First K' omdat ze de hele dataset moeten scannen om de steekproef te trekken, wat minder efficiënt is voor het minimaliseren van resources.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig