Amazon MLS-C01: Deployment, Inference & Serving (ML-implementatie & -operaties) — Studiegids

Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Deploymentpatronen en serving-opties

De keuze voor model serving is een balans tussen latentie, kosten, doorvoer en operationele complexiteit. Real-time SageMaker-endpoints (geprovisioneerd of serverless) bieden latenties van sub-100 ms tot enkele seconden, geschikt voor interactieve API’s; kies instance-families zoals ml.c5/m5 voor CPU-modellen, ml.g4dn of ml.p3 voor GPU-modellen, of ml.inf1 voor goedkope, high-throughput Inferentia-inference. Asynchronous Inference en Batch Transform zijn geschikt voor use cases met grote batches of variabele latentie: Batch Transform is ideaal voor grote offline taken (splits grote S3-objecten op in shards en gebruik ml.m5/c5 of GPU-instances naar behoefte), terwijl SageMaker Asynchronous Inference grotere payloads ondersteunt met wachtrijbeheer voor near-real-time batchverwerking. Multi-model endpoints hosten vele modellen achter één container, wat de opslagoverhead vermindert door modellen on-demand te laden; ze werken het best wanneer modellen klein zijn, bescheiden cold-start-kosten hebben en de toegangspatronen sporadisch zijn. Kies SageMaker Serverless Inference voor onvoorspelbare workloads met lage doorvoer om instance-beheer te vermijden; wees je bewust van cold starts en de beperkte runtime. Belangrijke beslissingscriteria zijn onder meer latentie-SLO’s, kosten per aanroep, concurrency-patroon, modelgrootte en cold-start-tolerantie. Een veelvoorkomende valkuil is het gebruik van real-time endpoints voor batch-workloads met een zeer hoog volume — dit is duur; gebruik in plaats daarvan Batch Transform, Async Inference, of roep endpoints aan via batching en concurrente workers.

Schalen, traffic shaping en kostenoptimalisatie

Autoscaling, traffic shifting en kostenbeheersing moeten samen met de deployment-topologie worden ontworpen. Gebruik Application Auto Scaling om SageMaker-endpoint-varianten te schalen met target-tracking-beleid op basis van aanroepstatistieken of aangepaste CloudWatch-metrics; definieer verstandige minimale/maximale capaciteiten en cooldowns om ’thrashing’ te voorkomen. Voor blue/green deployments en canary rollouts, gebruik multi-variant endpoints of EndpointConfig-updates met percentages voor traffic-splitting en geleidelijke verhogingen; integreer met AWS CodeDeploy om het verplaatsen van verkeer te automatiseren. Kostenoptimalisaties omvatten model pruning, kwantisatie (FP16 of int8), compileren met SageMaker Neo of AWS Neuron voor Inf1, en het verplaatsen van workloads die niet gevoelig zijn voor latentie naar Batch Transform of serverless inference. Spot instances verlagen de trainingskosten maar zijn niet van toepassing op real-time endpoints; kies in plaats daarvan de juiste grootte van instance-types (cpu vs gpu vs inferentia) en consolideer modellen met multi-model endpoints waar dit gepast is. Pas op voor valkuilen zoals overprovisioning bij het gebruik van target-tracking zonder de doorvoer per instance te begrijpen, of aannemen dat multi-model endpoints geheugenlimieten elimineren — het laden van modellen vereist nog steeds geheugen en kan de latentie verhogen. Comprimeer ook modelartefacten (ONNX, TF SavedModel met gz) en gebruik lazy-loading-strategieën om opslag- en cold-start-tijden te verkorten.

Edge, low-latency inference en plaatsing van pre/post-processing

Voor omgevingen met ultra-lage latentie of zonder verbinding, deploy modellen naar AWS IoT Greengrass (v2) of gebruik SageMaker Edge Manager om modellen op edge-apparaten te verpakken en te monitoren; compileer met SageMaker Neo of AWS IoT Greengrass-componenten en gebruik kwantisatie om te voldoen aan geheugen/CPU-beperkingen. Plaats preprocessing en feature-extractie daar waar het de end-to-end latentie en kosten minimaliseert: eenvoudige filters kunnen in de firmware van het apparaat of in een Greengrass Lambda draaien, terwijl batching en zware transformaties thuishoren op een edge-gateway of in de cloud. Voor streaming event-vensters (bijv. glijdende vensters van 10 minuten), ingest met Amazon Kinesis Data Streams of Amazon MSK, gebruik Kinesis Data Analytics of Flink/Apache Spark voor windowing en aggregatie, en stuur samengevatte features door naar een SageMaker-endpoint of een lichtgewicht on-edge model — dit vermindert netwerk-egress en de frequentie van modelaanroepen. Pas op voor valkuilen zoals het negeren van modelversiebeheer op edge-apparaten, of het niet provisioneren van voldoende opslag op het apparaat voor modelartefacten. Voor server-side microservices, co-loceer preprocessing (API Gateway + Lambda of ALB + Fargate) om cold-call-overhead te vermijden en de payload-groottes die naar het model worden gestuurd te verkleinen.

Monitoring, auditing, governance en dataverwerking

Operationele ML vereist continue monitoring van de modelgezondheid en datagovernance. Gebruik SageMaker Model Monitor om een baseline te maken van trainingsdata met een DataQualityJob en configureer continue monitoring om datadrift, regressies in modelkwaliteit, ontbrekende waarden en aangepaste beperkingen te detecteren; activeer DataCaptureConfig op endpoints om input/output vast te leggen in S3 en Model Monitor-jobs te triggeren. Voor lineage en auditing op feature-niveau, gebruik Amazon SageMaker Feature Store (online en offline stores) in combinatie met AWS Glue Data Catalog en CloudTrail om toegang tot en transformaties van datasets te volgen; Amazon Macie en Glue/SageMaker Processing-jobs kunnen PII ontdekken en redigeren vóór de training. Valkuilen bij encryptie zijn onder meer SSE-KMS: wanneer S3-objecten zijn versleuteld met een door de klant beheerde CMK, zorg er dan voor dat de SageMaker execution role de permissies kms:Decrypt en kms:GenerateDataKey heeft en dat het CMK-beleid toegang verleent; zorg er ook voor dat S3-bucketbeleid en VPC-endpoints de toegang niet blokkeren. Voor grote dagelijkse S3-objecten (bijv. 100 GB), vermijd de inname van één enkel bestand—partitioneer in veel kleinere objecten, sla op in Parquet en comprimeer, en gebruik Athena/Glue voor schemadetectie. Veelvoorkomende valkuilen zijn onder meer onvoldoende monitoringschema’s, het niet genereren van een correcte baseline voor Model Monitor, en het vergeten om KMS-toegang te verlenen aan alle service principals (SageMaker, Glue, Lambda) die decryptie nodig hebben.

Praktijkprobleem: Gebruiksscenario

Scenario: Streamlytic Media beheert een podcast-analyseplatform op AWS. Ze gebruiken Kinesis Data Streams om gebruikersgebeurtenissen in te nemen, geaggregeerde features op te slaan in S3, en modellen te hosten in SageMaker voor real-time voorspelling van engagement. De data bevat af en toe PII en is versleuteld met een door de klant beheerde SSE-KMS-sleutel.

Uitdaging: Lever voorspellingen met lage latentie op een doorlopend gebeurtenisvenster van 10 minuten, redigeer PII vóór de modeltraining, zorg ervoor dat SageMaker versleutelde S3-data kan lezen, en implementeer continue monitoring voor feature-drift.

Aanbevolen Aanpak:

  1. Creëer een Kinesis Data Stream om gebeurtenissen in te nemen, voer Kinesis Data Analytics (Flink) uit om doorlopende vensters van 10 minuten te onderhouden en geaggregeerde features uit te stoten naar S3 in Parquet met uurlijkse partities.
  2. Detecteer en redigeer PII met behulp van Amazon Macie voor ontdekking en een SageMaker Processing-job (of AWS Glue-job) om deterministische redactie/tokenisatie toe te passen; sla de resultaten op in een Feature Store offline store voor training.
  3. Verleen de SageMaker execution role de permissies kms:Decrypt en kms:GenerateDataKey op de CMK, voeg de rol toe aan het CMK-sleutelbeleid, en zorg ervoor dat het S3-bucketbeleid of het VPC-endpoint toegang toestaat voor SageMaker.
  4. Implementeer het model als een SageMaker real-time endpoint op ml.inf1-instances, activeer DataCaptureConfig, creëer een Model Monitor-baseline op basis van trainingsdata, en configureer continue monitoring met alerts naar CloudWatch.

Redenatie: Streaming aggregatie met Kinesis + Flink minimaliseert het gebeurtenisvolume en de latentie; redactie tijdens de verwerking waarborgt privacy en compliance; expliciete KMS-permissies voorkomen toegangsfouten; door Inferentia ondersteunde endpoints en Model Monitor balanceren lage inferentiekosten met operationele observeerbaarheid.


Training · Alle domeinen · Beveiliging

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product