Je hebt een CSV-dataset ontvangen in S3 die je gaat gebruiken voor ML-training. Voordat je gaat trainen, moet je ontbrekende of ongeldige waarden vinden en uitschieters tellen met de minste operationele inspanning. Welke aanpak voldoet aan deze vereiste?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Behoud de data als CSV, importeer deze in SageMaker Data Wrangler en gebruik het Data Quality and Insights rapport..
Waarom dit het antwoord is
De juiste aanpak is om de data als CSV te behouden en deze te importeren in SageMaker Data Wrangler om het Data Quality and Insights rapport te gebruiken. SageMaker Data Wrangler is speciaal ontworpen voor data-preparatie en biedt ingebouwde functionaliteit om ontbrekende waarden, ongeldige waarden en uitschieters te identificeren met minimale operationele inspanning. Het Data Quality and Insights rapport automatiseert deze analyse. De opties met AWS Glue en Athena zijn mogelijk, maar vereisen meer handmatige SQL-query's en configuratie, wat resulteert in hogere operationele inspanning. Het converteren naar Parquet is nuttig voor prestaties bij grote datasets, maar niet strikt noodzakelijk voor de initiële exploratie van datakwaliteit en voegt een extra stap toe.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig