Amazon MLS-C01: Data Engineering & Feature Engineering — Studiegids
Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.
Data-ingestie, opslag en bestandsformaten
Het ontwerpen van een ML-gereed data lake begint met het kiezen van het juiste ingestiepatroon en persistent formaat. Gebruik voor real-time telemetrie Kinesis Data Streams (verwerking met lage latentie) of Kinesis Data Firehose (beheerde levering). Firehose kan rechtstreeks aan Amazon S3 leveren en server-side conversie van recordformaat naar Parquet/ORC uitvoeren in combinatie met AWS Glue Schema Registry en een Lambda-transformatie; kies Data Streams + Kinesis Data Analytics of Lambda als u aangepaste verrijking of reacties binnen een seconde nodig heeft. Gebruik voor bulkmigratie AWS DataSync, Database Migration Service (DMS) voor RDS/OLTP-bronnen, of Snowball voor offline overdrachten op terabyteschaal. Sla op S3 kolomgeoriënteerde Parquet op voor analytische workloads (predicate pushdown, compressie zoals Snappy, partitiesleutels afgestemd op querypatronen) en TFRecord voor het voeden van TensorFlow-pipelines voor sequentiële reads met hoge doorvoersnelheid. Pas op voor een explosie van kleine bestanden: buffer schrijfacties (Firehose-buffering, Glue-batching) om S3-objecten te produceren met een grootte die geschikt is voor big-data frameworks (tientallen tot honderden MB). Schema-evolutie komt vaak voor: gebruik Glue Catalog en Schema Registry om schema’s te versioneren; gebruik partitionering en naamgevingsconventies om dure volledige tabelscans te vermijden. Een veelvoorkomende valkuil is het gebruik van de File-modus in downstream verwerking, die hele datasets naar compute nodes kopieert; geef de voorkeur aan streaming (SageMaker Pipe-modus), Redshift Spectrum of Athena boven het volledig kopiëren wanneer datasets miljoenen records bevatten.
Serverless en cluster ETL: Glue, EMR, Redshift en SageMaker
ETL-keuzes hangen af van schaal, aanpasbaarheid, kostenprofiel en bibliotheekvereisten. AWS Glue biedt serverless Spark ETL met catalogiseren, crawlers en ingebouwde taakorkestratie—uitstekend voor frequente, event-driven transformaties waar u beheerde schaling wenst. EMR heeft de voorkeur wanneer u aangepaste Spark/Hadoop-ecosystemen, langlopende clusters of gespecialiseerde bibliotheken (GraphX, aangepaste MLlib-builds) nodig heeft en u S3 als het onderliggende data lake kunt gebruiken. Gebruik voor analyses zonder ingestie Redshift Spectrum of Athena om Parquet/ORC rechtstreeks in S3 te bevragen; Redshift is beter voor complexe joins en BI-workloads. Voor de voorbereiding van modeldata bieden SageMaker Processing-taken beheerde containers om schaalbare Spark- of Python-preprocessing uit te voeren, wat ervoor zorgt dat de preprocessing-code dicht bij de training draait en samen met de trainingstaak kan worden geversioneerd. Wanneer u een SageMaker-training start met ingebouwde algoritmes, geef dan minimaal de training image, IAM-rol, instance_type/count en de S3 URI voor de trainingsdata op; overweeg de Pipe-modus om records te streamen en het kopiëren naar EBS te vermijden bij datasets van miljoenen records. Veelvoorkomende valkuilen: Glue kiezen voor transformaties met extreem lage latentie (gebruik in plaats daarvan Lambda/Kinesis) of onnodig S3-data kopiëren naar HDFS/EBS wanneer Redshift Spectrum/Athena zou volstaan.
Feature engineering, transformatiepipelines en selectie
Feature engineering moet reproduceerbaar zijn en geïsoleerd van leakage. Implementeer preprocessing als productie-waardige pipelines (scikit-learn Pipeline, Spark ML-pipelines of SageMaker Processing + Feature Store) zodat identieke transformaties worden toegepast bij training en inferentie. Behandel ontbrekende waarden met een strategiekeuze: eenvoudige imputatie (gemiddelde/mediaan/modus) voor kleine hiaten; modelgebaseerde methoden (KNN, iteratieve MICE) wanneer andere features de ontbrekende waarden voorspellen. Schaal numerieke features met StandardScaler of MinMax voor gradiënt-gebaseerde modellen; pas robuuste schaling toe als uitschieters domineren. Kies voor categorische variabelen one-hot encoding voor lage cardinaliteit, en target encoding of geleerde embeddings voor categorieën met hoge cardinaliteit (gebruik Embeddings in deep models of feature hashing voor dimensionaliteitscontrole). Voer voor tekst een consistente normalisatie uit (kleine letters, interpunctie, tokenisatie); gebruik Word2Vec/BlazingText voor embeddings of TF-IDF/sparse pipelines voor lineaire modellen; BlazingText in SageMaker ondersteunt skip-gram/CBoW en is efficiënt op schaal. Gebruik voor featureselectie L1-regularisatie, op bomen gebaseerde belangrijkheid (XGBoost/RandomForest), wederzijdse informatie of recursieve feature-eliminatie, en voer featureselectie altijd uit binnen de cross-validation folds om selectiebias te vermijden. De grootste praktische valkuil is leakage: leid nooit features af met behulp van toekomstige target-informatie en pas preprocessing nooit toe op de volledige dataset vóór het splitsen.
Beveiliging, toegangscontrole, governance en operationele monitoring
Veilige en auditeerbare data engineering is verplicht. Versleutel data-at-rest met SSE-KMS voor S3- en EBS-volumes en gebruik client-side encryptie voor extra controle; beheer sleutels met AWS KMS CMK’s en gebruik key policies en grants voor least privilege. Beperk de toegang tot S3-datasets tot een VPC met een S3 VPC-endpoint en nauwkeurige bucket policies of S3 Access Points die gescoped zijn op de VPC-principal; combineer dit met IAM-rollen die gekoppeld zijn aan SageMaker, Glue, EMR of Lambda om least privilege af te dwingen. Gebruik voor gevoelige PII tokenization of field-level encryptie en zorg ervoor dat KMS de sleutels roteert volgens het beleid. Schakel operationeel CloudTrail in voor het loggen van SageMaker- en Glue-API-activiteit en CloudWatch voor job-metrics; gebruik SageMaker Model Monitor voor drift-detectie en stel alerts in om modellen opnieuw te trainen of op bias te controleren. Data governance vereist de Glue Data Catalog of een enterprise metadata store, data lineage en tagging voor lifecycle policies; implementeer S3 lifecycle rules (transitie naar Glacier) voor koude data. Veelvoorkomende misvattingen zijn de aanname dat security groups alleen voldoende zijn (je hebt ook IAM, bucket policies en VPC-endpoints nodig), of vergeten om encryptie in te schakelen op de volumes van training instances — neem EBS-encryptie altijd op in de definities van training jobs en valideer de toegang met least-privilege rollen.
Praktijkprobleem: Use-Case Scenario
Scenario: MetroRetail beheert een AWS ML-omgeving waarin de clickstream van klanten wordt opgenomen via Kinesis Data Streams, opgeslagen in S3, en modellen worden getraind in SageMaker. Het data lake gebruikt de Glue Catalog en Athena voor analisten.
Uitdaging: Converteer streaming CSV-clickevents naar Parquet in S3 met schema-evolutie, produceer betrouwbare feature vectors voor een aanbevelingsmodel en zorg ervoor dat de pipeline schaalt zonder multi-gigabyte datasets naar training instances te kopiëren.
Aanbevolen Aanpak:
- Gebruik Kinesis Data Streams voor opname (ingestion), koppel een Lambda-consumer om lichtgewicht validatie uit te voeren en records door te sturen naar een Kinesis Data Firehose delivery stream die is geconfigureerd met de Glue Schema Registry om JSON/CSV naar Parquet te converteren en gepartitioneerde Parquet-bestanden naar S3 te schrijven (buffer hints afgestemd op ~64–128 MB).
- Catalogiseer Parquet in AWS Glue; gebruik Glue ETL-jobs (serverless Spark) of SageMaker Processing (Spark-container) om reproduceerbare feature pipelines te bouwen, waarbij imputatie (mediaan voor scheve numerieke waarden), StandardScaler en categorical embeddings voor item_id met hoge cardinaliteit worden toegepast.
- Sla online feature vectors op in de SageMaker Feature Store (online store voor lookups met lage latentie) en offline features in S3 (de offline store van de feature store via Parquet). Train in SageMaker met Pipe mode die verwijst naar S3 Parquet-manifesten om data te streamen en volledige kopieën te vermijden.
- Beveilig S3 met SSE-KMS, beperk de toegang met een S3 VPC-endpoint en strikte bucket policies voor de VPC, en schakel CloudTrail + SageMaker Model Monitor in voor het loggen van activiteiten en drift-alerts.
Rationale: Deze aanpak maakt gebruik van beheerde streaming-naar-Parquet-conversie en serverless ETL om te schalen, gebruikt de Feature Store voor consistentie tussen training en inference, vermijdt kostbare dataverplaatsing met Pipe mode, en dwingt encryptie en least-privilege toegang af om klaar te zijn voor productie.
Alle domeinen · Verkennende data-analyse →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →