Een data scientist traint een groot PyTorch-model op SageMaker; elke trainingstaak duurt ongeveer 10 uur. Ze vermoeden dat de training niet convergeert en dat het GPU-gebruik mogelijk slecht is. Welke aanpak vereist de minste ontwikkelingsinspanning om deze trainingsproblemen te detecteren en aan te pakken?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik de ingebouwde regels van SageMaker Debugger, zoals vanishing_gradient en LowGPUUtilization, om problemen te detecteren en de StopTrainingJob-actie te activeren..
Waarom dit het antwoord is
De juiste aanpak is het gebruik van de ingebouwde regels van SageMaker Debugger, zoals vanishinggradient en LowGPUUtilization, om problemen te detecteren en de StopTrainingJob-actie te activeren. SageMaker Debugger is specifiek ontworpen voor het monitoren en debuggen van trainingsjobs op SageMaker, met minimale ontwikkelingsinspanning. De ingebouwde regels kunnen automatisch veelvoorkomende trainingsproblemen identificeren, zoals een laag GPU-gebruik (wat duidt op inefficiëntie) of vanishing gradients (wat duidt op convergentieproblemen). Het stoppen van de job bespaart tijd en kosten. Het monitoren van CPU-gebruik in CloudWatch is minder relevant voor GPU-intensieve PyTorch-modellen en biedt geen directe inzichten in convergentieproblemen. Het publiceren van aangepaste metrics en het gebruik van een Lambda-functie vereist aanzienlijk meer ontwikkelingsinspanning en is minder geautomatiseerd dan SageMaker Debugger. De regels confusion en featureimportanceoverweight zijn geen standaard ingebouwde regels van SageMaker Debugger voor het detecteren van de gespecificeerde problemen.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig