Je ontvangt een Apache Parquet-bestand van 50 MB voor een fraudedetectiemodel dat verschillende gecorreleerde, onnodige kolommen bevat. Wat is de manier met de minste inspanning om die kolommen uit het bestand te verwijderen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een dataflow in SageMaker Data Wrangler en voeg een transformatiestap toe om de onnodige kolommen te verwijderen..
Waarom dit het antwoord is
De meest efficiënte oplossing is het gebruik van SageMaker Data Wrangler. Dit is een visuele tool die speciaal is ontworpen voor het voorbereiden van gegevens voor machine learning. Je kunt eenvoudig een dataflow maken, het Parquet-bestand importeren en met een paar klikken de onnodige kolommen verwijderen via een ingebouwde transformatiestap. Dit vereist minimale code en inspanning. Het downloaden naar je lokale werkstation en een Python-script gebruiken is mogelijk, maar minder efficiënt voor grotere datasets en vereist handmatige code. Een Apache Spark-taak op Amazon EMR is overkill voor een bestand van 50 MB en vereist meer configuratie en beheer. Een SageMaker Processing Job is een goede optie voor complexere transformaties of grotere datasets, maar voor het simpelweg verwijderen van kolommen is Data Wrangler sneller en gebruiksvriendelijker.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig