Amazon AIF-C01: ML Data Engineering — Studiegids

Onderdeel van de AWS AI Practitioner AIF-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Dataverzameling, labeling, versiebeheer en governance

Het verzamelen van representatieve, auditeerbare datasets is de fundamentele stap voor alle ML. Gebruik Amazon S3 als de centrale, duurzame opslaglocatie met S3 Versioning en object lock ingeschakeld om ruwe input te bewaren en de herkomst (provenance) vast te leggen. Voor gestructureerde opname en catalogisering, registreer datasets in de AWS Glue Data Catalog en pas fijnmazige toegangscontrole toe met Lake Formation. Wanneer menselijke labeling vereist is, biedt Amazon SageMaker Ground Truth ingebouwde workflows, een annotatie-UI en ‘active learning’-loops die de labelkosten verlagen en tegelijkertijd metadata creëren voor de overeenstemming en het betrouwbaarheidsniveau van de labelaars. Veelvoorkomende valkuilen zijn het verzamelen van bevooroordeelde of niet-representatieve samples, het niet vastleggen van de herkomst (lineage) en labelregels, en onvoldoende kwaliteitscontroles van labels; beperk deze risico’s door label-audits op te slaan, subsets blind opnieuw te labelen en heuristieken voor labelconsolidatie te gebruiken. Beslissingen over privacy en compliance sturen de architectuur: gebruik S3 server-side encryptie met door KMS beheerde CMK’s, beperk de toegang met IAM-policies en VPC-eindpunten (AWS PrivateLink), en voer PII-detectie en -redactie uit met Amazon Comprehend voordat data wordt gedeeld voor modeltraining. Voor langlopende programma’s, maak snapshots van datasets, tag ze met dataset-ID’s en volg experimenten met Amazon SageMaker Experiments of een externe tool zoals DVC om reproduceerbare training en rapportage voor regelgeving mogelijk te maken.

Preprocessing, feature engineering en EDA

Transformaties en features bepalen het vermogen van een model om te generaliseren. Gebruik AWS Glue of Amazon SageMaker Data Wrangler om data te profileren, op te schonen en te normaliseren, en voer iteratieve verkennende data-analyse (EDA) uit met Amazon QuickSight of Jupyter-notebooks die gehost worden in Amazon SageMaker Studio. Voor feature management in productie, gebruik Amazon SageMaker Feature Store om consistente offline en online feature-berekeningen te garanderen en train/serve skew te voorkomen; sla ruwe en afgeleide features apart op en leg de logica voor het creëren van features vast. Voor tijdreeksen en streaming pipelines, maak gebruik van Amazon Kinesis of AWS Glue streaming ETL voor het verversen van features met een lage latentie. Typische valkuilen zijn datalekken (data leakage) — waarbij toekomstige informatie in de trainingsdata terechtkomt — onjuiste verwerking van ontbrekende waarden, en een mismatch tussen offline trainingsfeatures en online serving-features. Beslissingscriteria bij het ontwerpen van pipelines hangen af van de afweging tussen actualiteit (freshness) en kosten: kies batch ETL voor zware historische herberekeningen, streaming voor near-real-time personalisatie, en hybride architecturen wanneer online features met een lage latentie vereist zijn. Automatiseer validatiecontroles en schema-handhaving in Glue of als onderdeel van SageMaker Processing jobs om ‘schema drift’ vroegtijdig te detecteren.

Embeddings, augmentatie, synthetische data en datasets voor foundation models

Embeddings zetten tekst, afbeeldingen of multimodale input om in dense vectoren die semantische relaties vastleggen; ze zijn de drijvende kracht achter semantisch zoeken, retrieval-augmented generation en clustering. Bouw een retrieval-augmented generation (RAG) patroon waarbij je embeddings genereert met Amazon Bedrock of in SageMaker gehoste encoders, de vectoren opslaat in Amazon OpenSearch Service (k-NN), Amazon Kendra of een beheerde vector store, en context ophaalt om het foundation model te conditioneren. Data-augmentatie en het genereren van synthetische data zijn praktisch wanneer echte voorbeelden schaars zijn: gebruik generatieve modellen in SageMaker om parafrases, beeldtransformaties (via Albumentations of SageMaker Processing) of privacy-beschermende synthetische records te creëren. Pas op voor overmatig vertrouwen op synthetische data — een lage getrouwheid (fidelity) kan een ‘distribution shift’ introduceren en modellen overfitten op artefacten. Voor trainingsdatasets van FM’s, cureer exemplaren van hoge kwaliteit, standaardiseer formaten met prompt-templates en beheer versies van elke dataset-snapshot in S3. Voor privédata die wordt gebruikt met FM’s van derden, geef de voorkeur aan een privé fine-tuning traject (breng de compute naar een VPC) of implementeer ‘retrieval-only’ pipelines die alleen niet-gevoelige context naar de FM sturen, terwijl de brondocumenten in een beveiligde vector store blijven; pas redactie en ’token-level masking’ toe om datalekken te voorkomen. Prompt engineering en instructie-templates (system prompts) zijn cruciaal om de reacties van het model vorm te geven; pas de temperature, top_k of top_p aan op basis van de vereiste determinisme en creativiteit.

Evaluatie, implementatie, monitoring en lifecycle management

Evaluatie moet expliciet zijn, met behulp van metrics die zijn afgestemd op bedrijfsdoelstellingen: regressietaken gebruiken RMSE of MAE, binaire classificatie evalueert precision/recall/F1 en ROC AUC, en samenvattingstaken gebruiken ROUGE-varianten. Voer validatie en cross-validatie uit tijdens de evaluatiefase en houd een ‘blind test set’ achter de hand voor de uiteindelijke acceptatie. Implementeer met Amazon SageMaker-endpoints (real-time of serverless inference) of Amazon Bedrock voor beheerde FM-serving; optimaliseer voor latency door kleinere, ‘distilled’ modellen te selecteren, multi-model endpoints in te schakelen of SageMaker Serverless Inference te gebruiken voor onvoorspelbaar verkeer. Monitor de prestaties en ‘data drift’ in productie met Amazon SageMaker Model Monitor en stel waarschuwingen in voor verslechtering van metrics; gebruik canary- of blue/green-implementaties om risico’s te beperken. Toegangscontrole voor modelgebruik wordt afgedwongen met IAM-rolbeleid, permissies op resourceniveau en netwerkisolatie. Valkuilen voor practitioners zijn onder meer het kiezen van de verkeerde metric (nauwkeurigheid voor ongebalanceerde klassen), het negeren van ‘concept drift’ en het niet instrumenteren van trainingsdata en inference-logs voor auditeerbaarheid. Gebruik CI/CD voor ML met SageMaker Pipelines om de frequentie van hertrainen te standaardiseren, de versiebeheer van datasets en modellen consistent te houden en een verdedigbaar audittraject voor compliance te onderhouden.

Praktijkprobleem: Use-Case Scenario

Scenario: BrightCart, een online supermarktketen, moderniseert zijn on-prem voorraadsysteem naar AWS en wil een generatieve AI-chatbot die klantvragen beantwoordt en live voorraadlocaties teruggeeft, terwijl klant- en voorraadgegevens worden beschermd in overeenstemming met complianceregels. Hun AWS AI-omgeving omvat S3 voor datasets, Amazon RDS voor transactionele voorraad, SageMaker Studio voor ontwikkeling, toegang tot Bedrock voor foundation models en VPC-networking.

Uitdaging: Bouw een private, low-latency RAG-chatbot die de huidige voorraad ophaalt en het blootstellen van gevoelige gegevens of het veroorzaken van hallucinaties vermijdt.

Aanbevolen aanpak:

  1. Provisioneer een private VPC en configureer AWS PrivateLink-endpoints voor Bedrock en SageMaker; sla canonieke productdocumenten en voorraad-snapshots op in S3 met server-side encryptie (KMS) en schakel S3-versiebeheer in.
  2. Bereken continu embeddings van productdocumenten met een Bedrock-encoder of een SageMaker-model in een private subnet, en sla vectoren op in Amazon OpenSearch Service met k-NN voor snelle ’nearest-neighbor’-retrieval; bewaar de live voorraad in Amazon RDS en zorg voor een veilige runtime-connector voor het ophalen van gegevens.
  3. Implementeer een retrieval-augmented pipeline waarbij de applicatie eerst OpenSearch bevraagt voor context, en vervolgens Bedrock aanroept met een systeemprompt-template dat de opgehaalde context en expliciete veiligheidsinstructies bevat; zuiver gebruikersinvoer op via inputvalidatie en gebruik Amazon Comprehend om PII te detecteren en te redigeren vóór de retrieval.
  4. Implementeer de chatbot achter een Application Load Balancer, serveer het FM via Bedrock met een API Gateway in de VPC, schakel logging naar CloudWatch in met beperkte toegang, en monitor modelreacties en drift met SageMaker Model Monitor en periodieke menselijke audits.

Rationale: Deze aanpak gebruikt een RAG-patroon om de blootstelling van gevoelige gegevens te minimaliseren, maakt gebruik van private networking en KMS voor compliance, scheidt live voorraad van modelcontext voor nauwkeurigheid, en past monitoring en ‘human-in-the-loop’-controles toe om hallucinaties te beheersen en doorlopende betrouwbaarheid te garanderen.


AI Beveiliging en Privacy · Alle domeinen · Modeltraining

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product