Amazon MLS-C01: Data Engineering & Feature Engineering — Lernleitfaden
Teil des AWS Machine Learning Specialty MLS-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.
Dateningestion, Speicherung und Dateiformate
Das Design eines ML-fähigen Data Lakes beginnt mit der Auswahl des richtigen Ingestionsmusters und persistenten Formats. Für Echtzeit-Telemetrie verwenden Sie Kinesis Data Streams (Verarbeitung mit geringer Latenz) oder Kinesis Data Firehose (verwaltete Bereitstellung). Firehose kann direkt in Amazon S3 bereitstellen und eine serverseitige Konvertierung des Datensatzformats in Parquet/ORC durchführen, wenn es mit der AWS Glue Schema Registry und einer Lambda-Transformation kombiniert wird. Wählen Sie Data Streams + Kinesis Data Analytics oder Lambda, wenn Sie eine benutzerdefinierte Anreicherung oder Antworten im Subsekundenbereich benötigen. Für die Massenmigration verwenden Sie AWS DataSync, den Database Migration Service (DMS) für RDS/OLTP-Quellen oder Snowball für Offline-Transfers im Terabyte-Bereich. Speichern Sie auf S3 spaltenbasiertes Parquet für analytische Workloads (Predicate Pushdown, Komprimierung wie Snappy, auf Abfragemuster abgestimmte Partitionierungsschlüssel) und TFRecord zur Versorgung von TensorFlow-Pipelines für sequenzielle Lesevorgänge mit hohem Durchsatz. Achten Sie auf das Problem vieler kleiner Dateien (Small-File-Problem): Puffern Sie Schreibvorgänge (Firehose-Pufferung, Glue-Batching), um S3-Objekte zu erzeugen, deren Größe für Big-Data-Frameworks geeignet ist (zehn bis hunderte MB). Schema-Evolution ist üblich: Verwenden Sie den Glue Catalog und die Schema Registry, um Schemata zu versionieren. Nutzen Sie Partitionierung und Namenskonventionen, um teure Full-Table-Scans zu vermeiden. Eine häufige Falle ist die Verwendung des File-Modus in der nachgelagerten Verarbeitung, bei dem ganze Datensätze auf Rechenknoten kopiert werden. Bevorzugen Sie Streaming (SageMaker Pipe-Modus), Redshift Spectrum oder Athena gegenüber dem vollständigen Kopieren, wenn Datensätze Millionen von Einträgen umfassen.
Serverless- und Cluster-ETL: Glue, EMR, Redshift und SageMaker
Die Wahl der ETL-Lösung hängt von Skalierung, Anpassbarkeit, Kostenprofil und Bibliotheksanforderungen ab. AWS Glue bietet serverloses Spark-ETL mit Katalogisierung, Crawlern und integrierter Job-Orchestrierung – hervorragend für häufige, ereignisgesteuerte Transformationen, bei denen eine verwaltete Skalierung gewünscht ist. EMR ist vorzuziehen, wenn Sie benutzerdefinierte Spark/Hadoop-Ökosysteme, langlebige Cluster oder spezialisierte Bibliotheken (GraphX, benutzerdefinierte MLlib-Builds) benötigen und S3 als zugrunde liegenden Data Lake verwenden können. Für Analysen ohne Ingestion verwenden Sie Redshift Spectrum oder Athena, um Parquet/ORC direkt in S3 abzufragen. Redshift eignet sich besser für komplexe Joins und BI-Workloads. Für die Vorbereitung von Modelldaten bieten SageMaker Processing-Jobs verwaltete Container zur Ausführung von skalierbarem Spark- oder Python-Preprocessing. Dies stellt sicher, dass der Vorverarbeitungscode in räumlicher Nähe zum Training ausgeführt und zusammen mit dem Trainingsjob versioniert werden kann. Wenn Sie ein SageMaker-Training mit integrierten Algorithmen starten, geben Sie mindestens das Trainings-Image, die IAM-Rolle, instance_type/count und den S3-URI für die Trainingsdaten an. Erwägen Sie den Pipe-Modus, um Datensätze zu streamen und bei Datensätzen mit mehreren Millionen Einträgen das Kopieren auf EBS zu vermeiden. Häufige Fallen: die Wahl von Glue für Transformationen mit extrem niedriger Latenz (verwenden Sie stattdessen Lambda/Kinesis) oder das unnötige Kopieren von S3-Daten nach HDFS/EBS, wenn Redshift Spectrum/Athena ausreichen würden.
Feature Engineering, Transformations-Pipelines und -Selektion
Feature Engineering sollte reproduzierbar und von Leakage isoliert sein. Implementieren Sie das Preprocessing als produktionsreife Pipelines (scikit-learn Pipeline, Spark ML-Pipelines oder SageMaker Processing + Feature Store), sodass identische Transformationen beim Training und bei der Inferenz angewendet werden. Behandeln Sie fehlende Werte durch eine Strategieauswahl: einfache Imputation (Mittelwert/Median/Modus) für kleine Lücken; modellbasierte Methoden (KNN, iterative MICE), wenn andere Features die fehlenden Werte vorhersagen können. Skalieren Sie numerische Features mit StandardScaler oder MinMax für gradientenbasierte Modelle; wenden Sie eine robuste Skalierung an, wenn Ausreißer dominieren. Für kategoriale Variablen wählen Sie One-Hot-Encoding für niedrige Kardinalität, Target Encoding oder gelernte Embeddings für Kategorien mit hoher Kardinalität (verwenden Sie Embeddings in Deep-Learning-Modellen oder Feature Hashing zur Kontrolle der Dimensionalität). Für Textdaten führen Sie eine konsistente Normalisierung durch (Kleinschreibung, Interpunktion, Tokenisierung); verwenden Sie Word2Vec/BlazingText für Embeddings oder TF-IDF/Sparse-Pipelines für lineare Modelle. BlazingText in SageMaker unterstützt Skip-Gram/CBoW und ist bei großer Skalierung effizient. Für die Feature-Selektion verwenden Sie L1-Regularisierung, baumbasierte Wichtigkeit (XGBoost/RandomForest), Mutual Information oder rekursive Merkmalseliminierung und führen Sie die Feature-Selektion immer innerhalb der Cross-Validation-Folds durch, um eine Selektionsverzerrung (Selection Bias) zu vermeiden. Die größte praktische Falle ist Leakage: Leiten Sie niemals Features aus zukünftigen Zielinformationen ab und wenden Sie das Preprocessing nicht auf den gesamten Datensatz vor der Aufteilung (Splitting) an.
Sicherheit, Zugriffskontrolle, Governance und Betriebsüberwachung
Sicheres und prüfbares Data Engineering ist zwingend erforderlich. Verschlüsseln Sie Daten im Ruhezustand (at-rest) mit SSE-KMS für S3- und EBS-Volumes und verwenden Sie clientseitige Verschlüsselung für zusätzliche Kontrolle; verwalten Sie Schlüssel mit AWS KMS CMKs und nutzen Sie Schlüsselrichtlinien (Key Policies) und Grants für das Prinzip der geringsten Rechte (Least Privilege). Beschränken Sie den Zugriff auf S3-Datensätze auf eine VPC, indem Sie einen S3-VPC-Endpunkt und präzise Bucket-Richtlinien oder S3 Access Points verwenden, die auf den VPC-Principal beschränkt sind; kombinieren Sie dies mit IAM-Rollen, die an SageMaker, Glue, EMR oder Lambda angehängt sind, um das Prinzip der geringsten Rechte durchzusetzen. Für sensible personenbezogene Daten (PII) verwenden Sie Tokenisierung oder Verschlüsselung auf Feldebene (Field-Level Encryption) und stellen Sie sicher, dass KMS die Schlüssel gemäß der Richtlinie rotiert. Im Betrieb aktivieren Sie CloudTrail für die Protokollierung von SageMaker- und Glue-API-Aktivitäten und CloudWatch für Job-Metriken; verwenden Sie den SageMaker Model Monitor zur Drift-Erkennung und richten Sie Alarme ein, um Modelle neu zu trainieren oder auf Bias zu überprüfen. Data Governance erfordert den Glue Data Catalog oder einen unternehmensweiten Metadatenspeicher, Data Lineage und Tagging für Lebenszyklusrichtlinien; implementieren Sie S3-Lebenszyklusregeln (Übergang zu Glacier) für kalte Daten. Häufige Missverständnisse sind die Annahme, dass Sicherheitsgruppen allein ausreichen (Sie benötigen auch IAM, Bucket-Richtlinien und VPC-Endpunkte), oder das Vergessen, die Verschlüsselung für Volumes von Trainingsinstanzen zu aktivieren – schließen Sie die EBS-Verschlüsselung immer in die Definitionen von Trainingsjobs ein und validieren Sie den Zugriff mit Rollen, die dem Prinzip der geringsten Rechte folgen.
Praktisches Problem: Anwendungsfallszenario
Szenario: MetroRetail betreibt eine AWS-ML-Umgebung, in der Kunden-Clickstreams über Kinesis Data Streams erfasst, in S3 gespeichert und Modelle in SageMaker trainiert werden. Der Data Lake nutzt den Glue Catalog und Athena für Analysten.
Herausforderung: Streaming-CSV-Klickereignisse in Parquet in S3 mit Schema-Evolution konvertieren, zuverlässige Feature-Vektoren für ein Empfehlungsmodell erstellen und sicherstellen, dass die Pipeline skaliert, ohne mehrere Gigabyte große Datensätze auf Trainingsinstanzen zu kopieren.
Empfohlener Ansatz:
- Verwenden Sie Kinesis Data Streams für die Erfassung (Ingestion), hängen Sie einen Lambda-Consumer an, um eine einfache Validierung durchzuführen und die Datensätze an einen Kinesis Data Firehose Delivery Stream weiterzuleiten. Konfigurieren Sie diesen mit der Glue Schema Registry, um JSON/CSV in Parquet zu konvertieren und partitionierte Parquet-Dateien in S3 zu schreiben (Buffer Hints auf ~64–128 MB optimiert).
- Katalogisieren Sie die Parquet-Daten in AWS Glue; verwenden Sie Glue-ETL-Jobs (serverless Spark) oder SageMaker Processing (Spark-Container), um reproduzierbare Feature-Pipelines zu erstellen. Wenden Sie dabei Imputation (Median für schiefverteilte numerische Werte), StandardScaler und kategoriale Embeddings für die
item_idmit hoher Kardinalität an. - Speichern Sie Online-Feature-Vektoren im SageMaker Feature Store (Online-Speicher für Abfragen mit geringer Latenz) und Offline-Features in S3 (Offline-Speicher des Feature Stores über Parquet). Trainieren Sie in SageMaker im Pipe-Modus, der auf S3-Parquet-Manifeste verweist, um Daten zu streamen und vollständige Kopiervorgänge zu vermeiden.
- Sichern Sie S3 mit SSE-KMS, beschränken Sie den Zugriff über einen S3-VPC-Endpunkt und strikte Bucket-Richtlinien für die VPC und aktivieren Sie CloudTrail + SageMaker Model Monitor für die Aktivitätsprotokollierung und Drift-Alarme.
Begründung: Dieser Ansatz nutzt die verwaltete Konvertierung von Streaming-Daten zu Parquet und serverloses ETL zur Skalierung, verwendet den Feature Store für Konsistenz zwischen Training und Inferenz, vermeidet kostspielige Datenverschiebungen durch den Pipe-Modus und erzwingt Verschlüsselung sowie den Zugriff nach dem Prinzip der geringsten Rechte für die Produktionsreife.
Alle Domänen · Explorative Datenanalyse →
Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Bestehe deine Prüfung →