Een specialist heeft een zeer grote trainingsdataset in S3 (miljoenen records). Ze willen voorkomen dat alle data naar het 5 GB EBS-volume van een SageMaker notebook wordt gekopieerd, maar toch trainen op de complete dataset. Welke workflow maakt het mogelijk om de volledige dataset te gebruiken voor training met minimale lokale kopieeracties?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik een kleine subset van de data op het notebook om de trainingscode te valideren, start vervolgens een SageMaker trainingstaak die de volledige S3-dataset leest met behulp van Pipe input mode..
Waarom dit het antwoord is
De correcte optie beschrijft een efficiënte workflow voor grote datasets. Door eerst de code te valideren met een kleine subset op het notebook, bespaar je tijd en resources. Vervolgens maakt het starten van een SageMaker trainingstaak met Pipe input mode het mogelijk om de volledige dataset direct vanuit S3 te streamen naar de trainingcontainer, zonder deze eerst lokaal te kopiëren. Dit voorkomt het overschrijden van de 5 GB EBS-limiet en minimaliseert dataverplaatsing. De andere opties zijn minder optimaal: Het starten van een EC2-instantie en het koppelen van de S3-bucket is een handmatiger proces en omzeilt de voordelen van SageMaker's beheerde training. AWS Glue is primair een ETL-service en niet direct bedoeld voor het testen van modeltrainingcompatibiliteit. Lokaal trainen op een EC2 Deep Learning-instantie is mogelijk, maar SageMaker's beheerde trainingstaak met Pipe input mode is de aanbevolen en meest schaalbare aanpak voor dit scenario.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig