Amazon AIF-C01: ML Data Engineering — Lernleitfaden
Teil des AWS AI Practitioner AIF-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.
Datenerfassung, Labeling, Versionierung und Governance
Die Erfassung repräsentativer, auditierbarer Datensätze ist der grundlegende Schritt für das gesamte maschinelle Lernen (ML). Nutzen Sie Amazon S3 als zentralen, langlebigen Speicher (durable store) mit aktivierter S3-Versionierung und Objektsperre (Object Lock), um Rohdaten zu erhalten und die Herkunft (Provenance) zu erfassen. Für die strukturierte Aufnahme (Ingestion) und Katalogisierung registrieren Sie Datensätze im AWS Glue Data Catalog und wenden Sie eine feingranulare Zugriffskontrolle mit Lake Formation an. Wenn manuelles Labeling erforderlich ist, bietet Amazon SageMaker Ground Truth integrierte Workflows, eine Annotations-Benutzeroberfläche (UI) und Schleifen für aktives Lernen (Active Learning), die die Kosten für das Labeling reduzieren und gleichzeitig Metadaten zur Übereinstimmung (Agreement) und Konfidenz der Labeler erstellen. Häufige Fallstricke sind die Erfassung verzerrter (biased) oder nicht repräsentativer Stichproben, die fehlende Aufzeichnung der Datenherkunft (Lineage) und der Labeling-Regeln sowie unzureichende Qualitätsprüfungen der Labels. Mildern Sie diese Risiken, indem Sie Labeling-Audits speichern, Teilmengen blind neu labeln (Blind-Relabeling) und Heuristiken zur Label-Konsolidierung verwenden. Entscheidungen zu Datenschutz und Compliance bestimmen die Architektur: Verwenden Sie serverseitige S3-Verschlüsselung mit von KMS verwalteten CMKs, beschränken Sie den Zugriff mit IAM-Richtlinien und VPC-Endpunkten (AWS PrivateLink) und führen Sie vor der Datenfreigabe für das Modelltraining eine Erkennung und Schwärzung von personenbezogenen Daten (PII) mit Amazon Comprehend durch. Erfassen Sie bei langlebigen Programmen Datensatz-Snapshots, versehen Sie diese mit Datensatz-IDs und verfolgen Sie Experimente mit Amazon SageMaker Experiments oder einem externen Tool wie DVC, um reproduzierbares Training und regulatorisches Reporting zu ermöglichen.
Vorverarbeitung, Feature Engineering und EDA
Transformationen und Features bestimmen die Fähigkeit eines Modells zur Generalisierung. Nutzen Sie AWS Glue oder Amazon SageMaker Data Wrangler, um Daten zu profilieren, zu bereinigen und zu normalisieren, und führen Sie iterative explorative Datenanalysen (EDA) mit Amazon QuickSight oder in Amazon SageMaker Studio gehosteten Jupyter-Notebooks durch. Für das Feature-Management in der Produktion verwenden Sie den Amazon SageMaker Feature Store, um eine konsistente Offline- und Online-Berechnung von Features sicherzustellen und einen Train/Serve Skew zu vermeiden. Speichern Sie Roh-Features und abgeleitete Features getrennt und zeichnen Sie die Logik zur Feature-Erstellung auf. Zeitreihen- und Streaming-Pipelines sollten Amazon Kinesis oder AWS Glue Streaming ETL für eine Aktualisierung der Features mit geringer Latenz nutzen. Typische Fallstricke sind Data Leakage – bei dem zukünftige Informationen in die Trainingsdaten gelangen –, der unsachgemäße Umgang mit fehlenden Werten und die Nichtübereinstimmung (Mismatch) zwischen Offline-Trainings-Features und Online-Serving-Features. Entscheidungskriterien beim Entwurf von Pipelines hängen vom Verhältnis zwischen Aktualität (Freshness) und Kosten ab: Wählen Sie Batch-ETL für aufwendige historische Neuberechnungen, Streaming für Personalisierung in Nahezu-Echtzeit und hybride Architekturen, wenn Online-Features mit geringer Latenz erforderlich sind. Automatisieren Sie Validierungsprüfungen und die Schema-Durchsetzung (Schema Enforcement) in Glue oder als Teil von SageMaker Processing-Jobs, um Schema-Drift frühzeitig zu erkennen.
Embeddings, Augmentierung, synthetische Daten und Datensätze für Foundation Models
Embeddings wandeln Text, Bilder oder multimodale Eingaben in dichte Vektoren um, die semantische Beziehungen erfassen. Sie sind die Grundlage für semantische Suche, Retrieval-Augmented Generation (RAG) und Clustering. Implementieren Sie ein Retrieval-Augmented Generation (RAG)-Muster, bei dem Sie Embeddings mit Amazon Bedrock oder in SageMaker gehosteten Encodern generieren, die Vektoren in Amazon OpenSearch Service (k-NN), Amazon Kendra oder einem verwalteten Vektorspeicher (Vector Store) speichern und Kontext abrufen, um das Foundation Model zu konditionieren. Datenaugmentierung und die Generierung synthetischer Daten sind sinnvoll, wenn echte Beispiele rar sind: Nutzen Sie generative Modelle in SageMaker, um Paraphrasen, Bildtransformationen (über Albumentations oder SageMaker Processing) oder datenschutzkonforme synthetische Datensätze zu erstellen. Hüten Sie sich vor einer übermäßigen Abhängigkeit von synthetischen Daten – eine geringe Wiedergabetreue (Fidelity) kann zu einer Verteilungsverschiebung (Distribution Shift) führen und Modelle auf Artefakte überanpassen (Overfitting). Für Trainingsdatensätze von FMs kuratieren Sie hochwertige Beispiele (Exemplars), kanonisieren Sie Formate mit Prompt-Templates und versionieren Sie jeden Datensatz-Snapshot in S3. Bevorzugen Sie für private Daten, die mit FMs von Drittanbietern verwendet werden, einen privaten Fine-Tuning-Pfad (indem Sie die Rechenleistung in eine VPC verlagern) oder stellen Sie reine Retrieval-Pipelines bereit, die nur nicht-sensiblen Kontext an das FM senden, während die Quelldokumente in einem sicheren Vektorspeicher verbleiben. Wenden Sie Schwärzung und Maskierung auf Token-Ebene an, um Datenlecks zu verhindern. Prompt Engineering und Anweisungsvorlagen (System Prompts) sind entscheidend, um die Antworten des Modells zu formen. Passen Sie die Parameter Temperature, top_k oder top_p entsprechend der erforderlichen Deterministik und Kreativität an.
Evaluierung, Bereitstellung, Überwachung und Lebenszyklusmanagement
Die Evaluierung muss explizit sein und Metriken verwenden, die auf die Geschäftsziele abgestimmt sind: Regressionsaufgaben verwenden RMSE oder MAE, binäre Klassifizierungen bewerten Precision/Recall/F1 und ROC AUC, und Zusammenfassungen nutzen ROUGE-Varianten. Führen Sie während der Evaluierungsphase Validierungen und Kreuzvalidierungen durch und halten Sie einen blinden Testsatz für die endgültige Abnahme zurück. Stellen Sie die Bereitstellung über Amazon SageMaker-Endpunkte (Echtzeit- oder serverlose Inferenz) oder Amazon Bedrock für das verwaltete Servieren von FMs bereit. Optimieren Sie die Latenz durch die Auswahl kleinerer, destillierter Modelle, die Aktivierung von Multi-Model-Endpunkten oder die Verwendung von SageMaker Serverless Inference für unvorhersehbaren Datenverkehr. Überwachen Sie die Leistung und den Datendrift in der Produktion mit Amazon SageMaker Model Monitor und richten Sie Warnungen für die Verschlechterung von Metriken ein. Setzen Sie Canary- oder Blue/Green-Deployments ein, um das Risiko zu begrenzen. Die Zugriffskontrolle für die Modellnutzung wird mithilfe von IAM-Rollenrichtlinien, Berechtigungen auf Ressourcenebene und Netzwerkisolierung durchgesetzt. Zu den Fallen für Praktiker gehören die Wahl der falschen Metrik (Genauigkeit bei unausgeglichenen Klassen), das Ignorieren von Konzeptdrift und das Versäumnis, Trainingsdaten und Inferenzprotokolle für die Auditierbarkeit zu instrumentieren. Verwenden Sie CI/CD für ML mit SageMaker Pipelines, um die Kadenz für das erneute Training zu standardisieren, die Versionierung von Datensätzen und Modellen konsistent zu halten und einen nachvollziehbaren Audit-Trail für die Compliance zu pflegen.
Praktisches Problem: Anwendungsfallszenario
Szenario: BrightCart, eine Online-Lebensmittelkette, modernisiert ihr On-Premises-Inventarsystem auf AWS und möchte einen generativen KI-Chatbot, der Kundenfragen beantwortet und Live-Inventarstandorte zurückgibt, während Kunden- und Inventardaten gemäß den Compliance-Vorschriften geschützt werden. Ihre AWS-KI-Umgebung umfasst S3 für Datensätze, Amazon RDS für das transaktionale Inventar, SageMaker Studio für die Entwicklung, Bedrock-Zugriff für Foundation Models und VPC-Networking.
Herausforderung: Erstellen Sie einen privaten, latenzarmen, RAG-fähigen Chatbot, der den aktuellen Lagerbestand abruft und die Offenlegung sensibler Daten oder das Auslösen von Halluzinationen vermeidet.
Empfohlener Ansatz:
- Stellen Sie eine private VPC bereit und konfigurieren Sie AWS PrivateLink-Endpunkte für Bedrock und SageMaker. Speichern Sie kanonische Produktdokumente und Inventar-Snapshots in S3 mit serverseitiger Verschlüsselung (KMS) und aktivieren Sie die S3-Versionierung.
- Berechnen Sie kontinuierlich Embeddings aus Produktdokumenten mit einem Bedrock-Encoder oder einem SageMaker-Modell in einem privaten Subnetz und speichern Sie die Vektoren in Amazon OpenSearch Service mit k-NN für eine schnelle Nächste-Nachbarn-Suche. Halten Sie das Live-Inventar in Amazon RDS und stellen Sie einen sicheren Laufzeit-Konnektor für den Abruf bereit.
- Implementieren Sie eine Retrieval-Augmented-Pipeline, bei der die Anwendung zuerst OpenSearch nach Kontext abfragt und dann Bedrock mit einer System-Prompt-Vorlage aufruft, die den abgerufenen Kontext und explizite Sicherheitsanweisungen enthält. Bereinigen Sie Benutzereingaben durch Eingabevalidierung und verwenden Sie Amazon Comprehend, um PII zu erkennen und vor dem Abruf zu schwärzen.
- Stellen Sie den Chatbot hinter einem Application Load Balancer bereit, servieren Sie das FM über Bedrock mit einem API-Gateway in der VPC, aktivieren Sie die Protokollierung in CloudWatch mit eingeschränktem Zugriff und überwachen Sie die Modellantworten und den Drift mit SageMaker Model Monitor sowie durch regelmäßige menschliche Audits.
Begründung: Dieser Ansatz verwendet ein RAG-Muster, um die Offenlegung sensibler Daten zu minimieren, nutzt privates Networking und KMS für die Compliance, trennt das Live-Inventar vom Modellkontext für mehr Genauigkeit und wendet Überwachung sowie Human-in-the-Loop-Prüfungen an, um Halluzinationen zu kontrollieren und die fortlaufende Zuverlässigkeit sicherzustellen.
← KI-Sicherheit · Alle Domänen · Modelltraining →
Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Bestehe deine Prüfung →