Amazon MLS-C01: Natural Language Processing & Spraak — Studiegids

Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Tekstvoorverwerking, tokenisatie en opschoning

Robuuste tekstvoorverwerking is de basis voor betrouwbare NLP-pipelines. Begin met het normaliseren van Unicode, het verwijderen van HTML en het weghalen van stuurtekens; gebruik AWS Glue of een SageMaker Processing job (ml.m5.xlarge) om schaalbare opschoningsstappen in Python of PySpark uit te voeren. De keuze voor tokenisatie is een beslispunt: woord-tokenizers zijn eenvoudig maar hebben last van out-of-vocabulary (OOV) tokens; subword-tokenizers zoals Byte-Pair Encoding of WordPiece (gebruikt door BERT) verminderen het OOV-risico en hebben de voorkeur voor meertalige corpora of corpora met veel productnamen. Schoon door gebruikers gegenereerde content op door PII te verwijderen, datums en getallen te normaliseren, en emoji’s/hashtags te mappen naar canonieke vormen wanneer ze sentiment overbrengen. Pas op voor veelvoorkomende valkuilen: het agressief verwijderen van stopwoorden kan topic models en sequence models schaden, en het omzetten naar kleine letters verwijdert hoofletterinformatie die nuttig is voor named-entity recognition. Implementeer voor productie deterministische voorverwerking in een SageMaker Processing- of Lambda-laag en leg de code en artefactversies van de voorverwerking vast in SageMaker Model Registry, zodat Model Monitor data-drift kan berekenen ten opzichte van dezelfde pipeline. Wanneer je met miljoenen korte reacties werkt, comprimeer de getokeniseerde output naar Parquet op S3 en gebruik SageMaker Batch Transform voor downstream feature extraction om de tokenisatielatency per request te vermijden.

Embeddings en semantische representaties

Kies embeddings op basis van de complexiteit van de taak en het compute-budget. Voor snelle, schaalbare embeddings, train of gebruik een vooraf getrainde Word2Vec via BlazingText in SageMaker (gebruik de supervised- of skip-gram-modus op ml.c5.4xlarge) om dense vectoren voor woorden te verkrijgen; aggregeer deze naar zinsvectoren met IDF-gewogen middeling voor het tellen van topics. Voor semantische retrieval en contextuele taken, fine-tune transformer-modellen (BERT, DistilBERT of Sentence-BERT) met het Hugging Face-framework op SageMaker Training met GPU-instances (ml.p3.2xlarge of ml.p4d.24xlarge afhankelijk van de schaal) en gebruik geoptimaliseerde inference op ml.g4dn of ml.p3 voor latency-gevoelige endpoints. Produceer en sla embeddings op in S3 of SageMaker Feature Store; gebruik voor approximate nearest-neighbor search Faiss op een dedicated inference cluster of Amazon Kendra voor enterprise search. Let op valkuilen: het gebruik van statische embeddings voor polyseme woorden leidt tot contextverlies; een te hoge dimensionaliteit verhoogt de opslag en vertraagt nearest-neighbor lookups—pas PCA/UMAP of kwantisatie toe. Wanneer downstream-modellen gevoelig zijn voor embedding-drift, implementeer dan Model Monitor om verschuivingen in de distributie van embeddings te volgen en de embeddings periodiek opnieuw te genereren met een consistente tokenizer en model-checkpoint.

Sequentiemodellen, intent/slot-verwerking en entiteitsextractie

Sequence modeling varieert van klassieke LSTMs/GRU’s tot transformer encoder-decoders voor seq2seq-taken. Voor intentiedetectie en slot filling in conversationele systemen, maak gebruik van Amazon Lex om intents, slot types en fulfillment hooks te beheren; integreer Lambda voor complexe slotvalidatie of contextverrijking. Voor op maat gemaakte modellen, train token-level NER met conditional random fields bovenop BERT of gebruik Hugging Face token-classification fine-tuning op SageMaker (GPU-training met ml.p3.2xlarge). Sequence-to-sequence use cases zoals samenvatting of vertaling geven de voorkeur aan encoder-decoder transformers (T5, BART) en vereisen grotere GPU-instances voor training; gebruik mixed precision (AMP) en gradient accumulation om lange sequenties te kunnen verwerken. Voor entity extraction kan Amazon Comprehend worden gebruikt voor out-of-the-box named entities, maar voor domeinspecifieke entiteiten (product-SKU’s, chemische namen) kies je Comprehend Custom Entities of fine-tune je je eigen NER-model. Een veelvoorkomende valkuil is het verwarren van intentieclassificatie met slotvalidatie—een hoge nauwkeurigheid van de intentie garandeert geen correcte slotwaarden; voeg schemavalidatie, betrouwbaarheidsdrempels en fallback intents toe. Stel voor productie modellen beschikbaar via SageMaker endpoints, gebruik multi-model endpoints voor kostenefficiëntie, en zet asynchronous inference of Batch Transform in voor offline taken met een hoge doorvoersnelheid.

Spraak: transcriptie, synthese en end-to-end spraakoplossingen

Spraakpipelines vereisen overwegingen voor zowel akoestische als taalmodellen. Voor transcriptie behandelt Amazon Transcribe veelvoorkomende use-cases met functies zoals aangepaste vocabulaires en vocabulaire-filtering om de herkenning van merk- of productnamen te verbeteren; activeer aangepaste vocabulaires en vocabulaire-filtering in de Transcribe-taakinstellingen, en gebruik kanaalidentificatie of spreker-diarisatie wanneer er voicemails of logs met meerdere sprekers zijn. Voor ultrakorte audio met strikte latency, geef de voorkeur aan real-time Transcribe Streaming met WebSocket-verbindingen met lage latentie en overweeg het aangepaste taalmodel van Transcribe voor gespecialiseerd jargon. Voor tekst-naar-spraak biedt Amazon Polly neurale stemmen en SSML-ondersteuning; gebruik lexicons en SSML-tags om uitspraak, prosodie en pauzes te beheersen voor een natuurlijke klantervaring. Integreer Lex met Transcribe en Polly om voice-bots te bouwen, en verbind met Amazon Connect voor telefonie. Een veelvoorkomende valkuil is om uitsluitend te vertrouwen op standaard taalmodellen voor domeinspecifieke namen—voeg altijd aangepaste vocabulaires toe of fine-tune de modellen. Voor offline of on-premises behoeften, verpak lichtgewicht modellen met SageMaker Neo of implementeer kleinere akoestische modellen op edge-apparaten, terwijl zware taalmodel-updates in de cloud worden gecentraliseerd en geversioneerd in SageMaker Model Registry.

Praktijkprobleem: Use-Case Scenario

Scenario: GlobalNews Analytics draait op AWS met datapijplijnen in S3 en voorbewerking in SageMaker Processing. Ze verwerken dagelijks miljoenen Engelse gebruikerscommentaren en onderhouden een SageMaker-eindpunt voor onderwerpanalyse.

Uitdaging: Identificeer de meest besproken onderwerpen uit rumoerige, vaak korte commentaren, terwijl slang, emoji’s en duizenden eigennamen (product-/plaatsnamen) worden verwerkt.

Aanbevolen Aanpak:

  1. Gebruik een SageMaker Processing-taak (ml.m5.4xlarge) om deterministische sanering uit te voeren: HTML strippen, Unicode-normalisatie, emoji’s mappen naar tokens, waar nodig naar kleine letters converteren, en de opgeschoonde tekst opslaan als parquet op S3.
  2. Genereer contextuele zins-embeddings door een Sentence-BERT-model te fine-tunen met Hugging Face op SageMaker Training met ml.p3.2xlarge; sla de embeddings op in S3 en optioneel in Feature Store.
  3. Cluster de embeddings met Faiss (CPU-cluster of door GPU ondersteunde nodes) om onderwerpgroepen te ontdekken en voer een SageMaker Processing-taak uit om de top n-grammen en representatieve zinnen per cluster te berekenen; verfijn de clusters optioneel met UMAP voor dimensionaliteitsreductie.
  4. Breng naar productie door een lichtgewicht inferentie-eindpunt (ml.g4dn.xlarge) beschikbaar te stellen voor het embedden van nieuwe commentaren, gebruik Batch Transform voor nachtelijke her-clustering, en activeer SageMaker Model Monitor om embedding-drift te detecteren en hertraining te activeren wanneer de distributieverschuiving de drempels overschrijdt.

Redenering: Deze aanpak balanceert schaalbare voorbewerking, contextuele embeddings voor korte/rumoerige tekst, en efficiënte, op gelijkenis gebaseerde onderwerpsontdekking, terwijl SageMaker wordt gebruikt voor training, inferentie en monitoring om reproduceerbaarheid en operationele gereedheid te garanderen.


Deep Learning · Alle domeinen · Tijdreeksen

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product