Amazon MLS-C01: Natural Language Processing & Sprache — Lernleitfaden
Teil des AWS Machine Learning Specialty MLS-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.
Textvorverarbeitung, Tokenisierung und Bereinigung
Eine robuste Textvorverarbeitung ist die Grundlage für zuverlässige NLP-Pipelines. Beginnen Sie mit der Normalisierung von Unicode, dem Entfernen von HTML und der Beseitigung von Steuerzeichen; verwenden Sie AWS Glue oder einen SageMaker Processing-Job (ml.m5.xlarge), um skalierbare Bereinigungsschritte in Python oder PySpark auszuführen. Die Wahl der Tokenisierung ist ein entscheidender Punkt: Wort-Tokenisierer sind einfach, haben aber Probleme mit Out-of-Vocabulary (OOV)-Token; Subword-Tokenisierer wie Byte-Pair Encoding oder WordPiece (verwendet von BERT) reduzieren das OOV-Risiko und sind für mehrsprachige oder produktnamenintensive Korpora vorzuziehen. Bereinigen Sie nutzergenerierte Inhalte, indem Sie persönlich identifizierbare Informationen (PII) entfernen, Datums- und Zahlenangaben normalisieren und Emojis/Hashtags kanonischen Formen zuordnen, wenn sie eine Stimmung vermitteln. Achten Sie auf häufige Fallstricke: Eine aggressive Entfernung von Stoppwörtern kann Themen- und Sequenzmodellen schaden, und die Umwandlung in Kleinbuchstaben entfernt Groß-/Kleinschreibungssignale, die für die Named-Entity Recognition nützlich sind. Implementieren Sie für die Produktion eine deterministische Vorverarbeitung in einem SageMaker Processing- oder Lambda-Layer und zeichnen Sie die Versionen des Vorverarbeitungscodes und der Artefakte in der SageMaker Model Registry auf, damit Model Monitor den Data-Drift anhand derselben Pipeline berechnen kann. Wenn Sie mit Millionen von kurzen Kommentaren arbeiten, komprimieren Sie die tokenisierte Ausgabe nach Parquet auf S3 und verwenden Sie SageMaker Batch Transform für die nachgelagerte Merkmalsextraktion, um die Latenz der Tokenisierung pro Anfrage zu vermeiden.
Embeddings und semantische Repräsentationen
Wählen Sie Embeddings basierend auf der Aufgabenkomplexität und dem Rechenbudget. Für schnelle, skalierbare Embeddings trainieren oder verwenden Sie vortrainiertes Word2Vec über BlazingText in SageMaker (nutzen Sie den Supervised- oder Skip-Gram-Modus auf ml.c5.4xlarge), um dichte Vektoren für Wörter zu erhalten; aggregieren Sie diese zu Satzvektoren mittels IDF-gewichteter Mittelwertbildung für Themenzählungen. Für semantische Suche und kontextbezogene Aufgaben stimmen Sie Transformermodelle (BERT, DistilBERT oder Sentence-BERT) mit dem Hugging Face Framework auf SageMaker Training mit GPU-Instanzen (ml.p3.2xlarge oder ml.p4d.24xlarge je nach Skalierung) fein ab und nutzen Sie optimierte Inferenz auf ml.g4dn oder ml.p3 für latenzempfindliche Endpunkte. Erstellen und speichern Sie Embeddings in S3 oder im SageMaker Feature Store; für die Approximate Nearest-Neighbor-Suche verwenden Sie Faiss auf einem dedizierten Inferenz-Cluster oder Amazon Kendra für die Unternehmenssuche. Achten Sie auf Fallstricke: Die Verwendung statischer Embeddings für mehrdeutige Wörter führt zum Verlust von Kontext; eine übermäßige Dimensionalität erhöht den Speicherbedarf und verlangsamt die Nearest-Neighbor-Suche – wenden Sie PCA/UMAP oder Quantisierung an. Wenn nachgelagerte Modelle empfindlich auf Embedding-Drift reagieren, implementieren Sie Model Monitor, um Verschiebungen in der Embedding-Verteilung zu verfolgen und die Daten periodisch mit einem konsistenten Tokenisierer und Modell-Checkpoint neu einzubetten.
Sequenzmodelle, Intent-/Slot-Verarbeitung und Entitätsextraktion
Die Sequenzmodellierung reicht von klassischen LSTMs/GRUs bis hin zu Transformer-Encoder-Decodern für Seq2Seq-Aufgaben. Für die Intent-Erkennung und das Slot-Filling in Konversationssystemen nutzen Sie Amazon Lex zur Verwaltung von Intents, Slot-Typen und Fulfillment-Hooks; integrieren Sie Lambda für komplexe Slot-Validierung oder Kontextanreicherung. Für maßgeschneiderte Modelle trainieren Sie NER auf Token-Ebene mithilfe von Conditional Random Fields auf Basis von BERT oder verwenden Sie das Hugging Face Token-Classification Fine-Tuning auf SageMaker (GPU-Training mit ml.p3.2xlarge). Sequence-to-Sequence-Anwendungsfälle wie Zusammenfassung oder Übersetzung bevorzugen Encoder-Decoder-Transformer (T5, BART) und erfordern größere GPU-Instanzen für das Training; verwenden Sie Mixed Precision (AMP) und Gradient Accumulation, um lange Sequenzen zu verarbeiten. Für die Entitätsextraktion kann Amazon Comprehend für sofort einsatzbereite Named Entities verwendet werden, aber für domänenspezifische Entitäten (Produkt-SKUs, chemische Bezeichnungen) wählen Sie Comprehend Custom Entities oder stimmen Sie Ihr eigenes NER-Modell fein ab. Ein häufiger Fallstrick ist die Vermischung von Intent-Klassifizierung und Slot-Validierung – eine hohe Intent-Genauigkeit garantiert keine korrekten Slot-Werte; fügen Sie Schema-Validierung, Konfidenzschwellenwerte und Fallback-Intents hinzu. Stellen Sie Modelle für die Produktion über SageMaker-Endpunkte bereit, wobei Sie für Kosteneffizienz Multi-Model-Endpunkte verwenden, und nutzen Sie asynchrone Inferenz oder Batch Transform für Offline-Aufgaben mit hohem Durchsatz.
Sprache: Transkription, Synthese und End-to-End-Sprachlösungen
Sprach-Pipelines erfordern die Berücksichtigung sowohl von akustischen als auch von Sprachmodellen. Für die Transkription deckt Amazon Transcribe gängige Anwendungsfälle mit Funktionen wie benutzerdefinierten Vokabularen und Vokabularfiltern ab, um die Erkennung von Marken- oder Produktnamen zu verbessern; aktivieren Sie benutzerdefinierte Vokabulare und Vokabularfilter in den Transcribe-Jobeinstellungen und verwenden Sie Kanalidentifikation oder Sprecher-Diarisierung, wenn Voicemails oder Protokolle mit mehreren Sprechern vorhanden sind. Für ultrakurze Audioaufnahmen mit strengen Latenzanforderungen bevorzugen Sie Echtzeit-Transcribe-Streaming mit WebSocket-Verbindungen mit geringer Latenz und ziehen Sie das benutzerdefinierte Sprachmodell von Transcribe für Fachjargon in Betracht. Für die Text-zu-Sprache-Umwandlung (Text-to-Speech) bietet Amazon Polly neuronale Stimmen und SSML-Unterstützung; verwenden Sie Lexika und SSML-Tags, um Aussprache, Prosodie und Pausen für ein natürliches Kundenerlebnis zu steuern. Integrieren Sie Lex mit Transcribe und Polly, um Voice-Bots zu erstellen, und verbinden Sie diese mit Amazon Connect für die Telefonie. Eine häufige Falle ist es, sich bei domänenspezifischen Namen ausschließlich auf Standard-Sprachmodelle zu verlassen – fügen Sie immer benutzerdefinierte Vokabulare hinzu oder führen Sie ein Fine-Tuning der Modelle durch. Für Offline- oder On-Premises-Anforderungen packen Sie leichtgewichtige Modelle mit SageMaker Neo oder stellen Sie kleinere akustische Modelle auf Edge-Geräten bereit, während Sie aufwendige Sprachmodell-Updates in der Cloud zentralisieren und in der SageMaker Model Registry versionieren.
Praktisches Problem: Anwendungsfallszenario
Szenario: GlobalNews Analytics läuft auf AWS mit Daten-Pipelines in S3 und Vorverarbeitung in SageMaker Processing. Sie erfassen täglich Millionen von englischen Benutzerkommentaren und betreiben einen SageMaker-Endpunkt für die Themenanalyse.
Herausforderung: Identifizieren der meistdiskutierten Themen aus verrauschten, oft kurzen Kommentaren unter Berücksichtigung von Slang, Emojis und Tausenden von Eigennamen (Produkt-/Ortsnamen).
Empfohlener Ansatz:
- Verwenden Sie einen SageMaker Processing-Job (ml.m5.4xlarge) zur deterministischen Bereinigung: Entfernen von HTML, Unicode-Normalisierung, Zuordnung von Emojis zu Tokens, Umwandlung in Kleinbuchstaben wo angebracht, und Speichern des bereinigten Texts als Parquet in S3.
- Generieren Sie kontextbezogene Satz-Embeddings durch Fine-Tuning eines Sentence-BERT-Modells mit Hugging Face auf SageMaker Training mit ml.p3.2xlarge; persistieren Sie die Embeddings in S3 und optional im Feature Store.
- Clustern Sie die Embeddings mit Faiss (CPU-Cluster oder GPU-gestützte Knoten), um Themengruppen zu entdecken, und führen Sie einen SageMaker Processing-Job aus, um die Top-N-Gramme und repräsentative Sätze pro Cluster zu berechnen; verfeinern Sie optional die Cluster mit UMAP zur Dimensionsreduktion.
- Überführen Sie das Modell in die Produktion, indem Sie einen leichtgewichtigen Inferenz-Endpunkt (ml.g4dn.xlarge) für das Embedding neuer Kommentare bereitstellen, Batch Transform für nächtliches Re-Clustering verwenden und SageMaker Model Monitor aktivieren, um Embedding-Drift zu erkennen und ein erneutes Training auszulösen, wenn die Verteilungsverschiebung Schwellenwerte überschreitet.
Begründung: Dieser Ansatz schafft eine Balance zwischen skalierbarer Vorverarbeitung, kontextbezogenen Embeddings für kurze/verrauschte Texte und effizienter, auf Ähnlichkeit basierender Themenfindung. Gleichzeitig wird SageMaker für Training, Inferenz und Überwachung genutzt, um Reproduzierbarkeit und Betriebsbereitschaft sicherzustellen.
← Deep Learning · Alle Domänen · Zeitreihen →
Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Bestehe deine Prüfung →