Amazon MLS-C01: Training, Distributed Training & Hyperparameter-optimalisatie — Studiegids

Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Training-taken, containers en overgangen naar cloud-training met minimale code

Bij het verplaatsen van training-workloads naar SageMaker is het belangrijkste ontwerpdoel om het herschrijven van modelcode te vermijden, terwijl wordt gegarandeerd dat de container-runtime de verwachte SageMaker-omgevingsvariabelen en channel-paden beschikbaar stelt. Gebruik de SageMaker Script Mode met de framework-specifieke Estimator (PyTorch, TensorFlow, XGBoost) zodat hetzelfde trainingsscript lokaal en in de cloud draait met minimale aanpassingen: lees data van SM_CHANNEL_TRAIN, schrijf het model naar SM_MODEL_DIR, en respecteer SM_NUM_GPUS/SM_HOSTS/SM_CURRENT_HOST. Voor aangepaste omgevingen, bouw een Docker-image die de officiële AWS Deep Learning Containers (of de SageMaker training toolkit) uitbreidt en push deze naar Amazon ECR; zorg ervoor dat het entrypoint van de container voldoet aan het ’training contract’ van SageMaker. Selecteer instance types op basis van het compute-profiel: CPU-gebonden taken op ml.c5/m5-families, GPU-training op ml.p3, ml.p4d, g4dn of g5 instances; kies de instance-grootte op basis van geheugen en de GPU-naar-CPU-verhouding. Veelvoorkomende valkuilen zijn hardgecodeerde lokale bestandspaden, de aanname van een enkele host (wat faalt bij gedistribueerde taken), en het niet declareren van de training input mode (Pipe vs File), wat de I/O-prestaties beïnvloedt. Voor reproduceerbaarheid en voorspelbare kosten, schakel managed spot training pas in na het toevoegen van robuuste checkpointing en het instellen van max_wait > max_run om Spot-onderbrekingen toe te staan.

Gedistribueerde trainingspatronen, data-invoermodi en opslagkeuzes

Gedistribueerde deep learning vereist een balans tussen modelparallellisme, dataparallellisme en de I/O-architectuur. Gebruik voor multi-GPU single-host en multi-host training de native primitieven van frameworks—torch.distributed of TensorFlow’s MultiWorkerMirroredStrategy—of maak gebruik van SageMaker’s smdistributed-bibliotheken: smdistributed.dataparallel voor dataparallelle schaling en smdistributed.modelparallel of DeepSpeed voor zeer grote transformermodellen. Gebruik S3 als de canonieke opslag voor grote datasets, maar vermijd veel kleine S3 GET-verzoeken: consolideer bestanden in minder archieven, gebruik RecordIO/TFRecord sharded bestanden, of koppel een POSIX-bestandssysteem. Kies Pipe-modus om trainingsdata voor grote datasets direct vanuit S3 te streamen om lokaal schijfgebruik en opstarttijd te verminderen; gebruik File-modus wanneer de training willekeurige toegang (random-access) vereist of wanneer je de volledige dataset op een EBS-volume nodig hebt. Voor hoge doorvoersnelheden en POSIX-semantiek over meerdere instances, mount Amazon FSx for Lustre of Amazon EFS; FSx is beter voor high-performance parallelle leesacties. Veelgemaakte fouten zijn het niet sharden van data over hosts (wat duplicaten veroorzaakt), het overschatten van de S3-doorvoersnelheid per instance, en het negeren van de schaalregels voor batch-grootte en learning rate bij het verhogen van het parallellisme.

Spot training, checkpointing en strategieën voor kostenoptimalisatie

Managed Spot training kan de kosten drastisch verlagen als je trainingsontwerp onderbrekingen tolereert. Configureer managed spot via de SageMaker Estimator (use_spot_instances=True), plus checkpointing: geef een persistente checkpoint_s3_uri en een lokale checkpoint_dir op, en sla checkpoints vaak genoeg op om de tijd voor herbewerking te beperken. Stel max_wait aanzienlijk hoger in dan max_run zodat de taak onderbroken instances binnen het spot-venster opnieuw kan proberen. Implementeer voor frameworks atomaire checkpoint-schrijfacties en een robuuste hervattingslogica die het laatste S3-checkpoint inspecteert, de staat van de optimizer en scheduler herstelt, en vervolgens de training voortzet. De checkpoint-frequentie moet een balans vinden tussen de schrijf-overhead en potentieel verspilde rekentijd; voor lange epochs of zeer grote modellen, maak checkpoints halverwege een epoch met behulp van ‘gradient accumulation snapshots’ of stap-gebaseerde opslagmomenten. Valkuilen op het gebied van kosten zijn onder meer het vergeten om checkpoints naar S3 te persisteren (wat een volledige herstart veroorzaakt bij een onderbreking), vertrouwen op efemere instance storage, en het instellen van max_wait gelijk aan max_run, wat nieuwe pogingen voorkomt. Combineer spot met mixed precision (AMP) voor extra besparingen op rekenkracht en met kleinere checkpoint-payloads (sla alleen gewichten + optimizer op) om de S3-schrijfkosten en de hervattingslatentie te verminderen.

Hyperparameter-optimalisatie, tuningstrategieën en praktische beslissingscriteria

Effectieve HPO combineert een zoekstrategie, resourcetoewijzing en ’early stopping’. SageMaker’s HyperparameterTuner ondersteunt ‘Random’ en ‘Bayesian’ search, met configureerbare bereiken voor ContinuousParameter, IntegerParameter en CategoricalParameter; begin voor grote zoekruimtes met ‘random search’ om breed te verkennen, en voer daarna Bayesiaanse optimalisatie uit om veelbelovende gebieden te benutten. Gebruik ’early stopping’-methoden zoals Hyperband of de ingebouwde ’early stopping’ van SageMaker om budget te besparen, en gebruik ‘warm-start tuning’ om resultaten van gerelateerde experimenten te hergebruiken. Kies ‘objective metrics’ zorgvuldig (validatie-AUC voor taken met ongebalanceerde data, F1 voor fraude-detectie met klasse-onbalans, aangepaste kostengewogen metrieken voor scenario’s met voorraadtekorten). Veelvoorkomende valkuilen zijn te brede bereiken die veel mislukte taken veroorzaken, het gebruik van categorische codering voor hyperparameters die in wezen continu zijn, en het niet schalen van resource-bewuste HPO: korte ‘probe jobs’ op kleinere instances om globale regio’s te vinden, gevolgd door langere runs op full-size GPU-instances. Voor gedistribueerde training, tune zowel de algoritmische hyperparameters (learning rate, batch size) als de ‘knoppen’ op systeemniveau (gradient accumulation steps, aantal data shards). Instrumenteer met SageMaker Debugger en gebruik CloudWatch-metrieken om ruis in metingen te detecteren; verhoog bij hoge variantie het aantal herhalingen per configuratie of gebruik een op de mediaan gebaseerde selectie.

Praktijkprobleem: Use-Case Scenario

Scenario: FinRetailer voert duizenden 30-daagse vraagvoorspellingen per SKU uit in SageMaker; ze slaan jaren aan dagelijkse CSV’s op in S3 en vereisen een hoge nauwkeurigheid voor ’tail-demand’-artikelen, terwijl de inferentielatentie acceptabel moet blijven in batch-scoring taken.

Uitdaging: Voorspel duizenden tijdreeksen met lange historieken en een ongebalanceerd belang (voorraadtekorten kosten meer dan overbevoorrading), minimaliseer de rekenkosten en behoud tegelijkertijd de nauwkeurigheid bij zeldzame gebeurtenissen met een hoge vraag.

Aanbevolen Aanpak:

  1. Gebruik de ingebouwde DeepAR van SageMaker of een aangepast temporeel PyTorch-model (op Transformer-basis) verpakt in een Script Mode Estimator; sla trainingsdata op als ‘sharded’ RecordIO/TFRecord-bestanden en gebruik de ‘File mode’ met FSx for Lustre voor high-throughput training op meerdere instances.
  2. Begin met gedistribueerde training op kleinere instances (smddp of Horovod) om de modelarchitectuur en hyperparameters te tunen, met behulp van HyperparameterTuner met ‘Bayesian search’ en ’early stopping’; definieer de ‘objective’ als een gewogen ‘quantile loss’ die een te lage voorspelling zwaarder bestraft.
  3. Activeer ‘managed spot training’ met een checkpoint_s3_uri en frequente, op stappen gebaseerde checkpoints; stel max_wait > max_run in om onderbrekingen te tolereren en te hervatten vanaf het laatste S3-checkpoint.
  4. Voor productie-inferentie, voer batch-scoring uit met ‘multi-model endpoints’ of asynchrone ‘batch transform jobs’ op voor rekenkracht geoptimaliseerde instances; pas ‘post-processing’ bedrijfsregels toe en een gekalibreerde drempelwaarde die rekening houdt met de kosten van voorraadtekorten.

Redenering: Het gebruik van DeepAR/Transformer-architecturen verwerkt efficiënt vele tijdreeksen; ‘sharded’ binaire formaten en FSx verminderen I/O-knelpunten voor gedistribueerde training, Bayesiaanse HPO met een op maat gemaakte ‘objective’ richt de zoekopdrachten op operationele kostenmetrieken, en ‘spot training’ met checkpointing verlaagt de kosten zonder voortgang op te offeren.


Tijdreeksen · Alle domeinen · Deployment

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product