Amazon MLS-C01: Przetwarzanie języka naturalnego i mowa — Przewodnik do nauki

Część AWS Machine Learning Specialty MLS-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Przetwarzanie wstępne tekstu, tokenizacja i sanityzacja

Solidne przetwarzanie wstępne tekstu jest podstawą niezawodnych potoków NLP. Zacznij od normalizacji Unicode, usuwania znaczników HTML i znaków kontrolnych; użyj AWS Glue lub zadania SageMaker Processing (ml.m5.xlarge) do uruchomienia skalowalnych kroków czyszczenia w Pythonie lub PySpark. Wybór tokenizacji to kluczowy moment decyzyjny: tokenizatory słowne są proste, ale cierpią z powodu tokenów spoza słownika (out-of-vocabulary, OOV); tokenizatory podsłowne, takie jak Byte-Pair Encoding czy WordPiece (używany przez BERT), zmniejszają ryzyko OOV i są preferowane dla korpusów wielojęzycznych lub zawierających wiele nazw produktów. Oczyść treści generowane przez użytkowników, usuwając dane osobowe (PII), normalizując daty i liczby oraz mapując emoji/hashtagi na formy kanoniczne, gdy niosą ze sobą ładunek sentymentalny. Uważaj na częste pułapki: agresywne usuwanie stop-wordów może zaszkodzić modelom tematycznym i sekwencyjnym, a zmiana liter na małe usuwa sygnały o wielkości liter, przydatne w rozpoznawaniu jednostek nazwanych (named-entity recognition). W środowisku produkcyjnym zaimplementuj deterministyczne przetwarzanie wstępne w warstwie SageMaker Processing lub Lambda i rejestruj wersje kodu oraz artefaktów przetwarzania w SageMaker Model Registry, aby Model Monitor mógł obliczać dryf danych (data-drift) w odniesieniu do tego samego potoku. Pracując z milionami krótkich komentarzy, skompresuj tokenizowane dane wyjściowe do formatu parquet na S3 i użyj SageMaker Batch Transform do dalszej ekstrakcji cech, aby uniknąć opóźnień związanych z tokenizacją dla każdego żądania.

Embeddingi i reprezentacje semantyczne

Wybierz embeddingi w oparciu o złożoność zadania i budżet obliczeniowy. Aby uzyskać szybkie i skalowalne embeddingi, wytrenuj lub użyj wstępnie wytrenowanego modelu Word2Vec za pomocą BlazingText w SageMaker (użyj trybu nadzorowanego lub skip-gram na instancjach ml.c5.4xlarge), aby otrzymać gęste wektory dla słów; agreguj je do wektorów zdań za pomocą średniej ważonej IDF dla zliczania tematów. W przypadku zadań związanych z wyszukiwaniem semantycznym i kontekstowym, dostrajaj (fine-tune) modele transformer (BERT, DistilBERT lub Sentence-BERT) przy użyciu frameworka Hugging Face w SageMaker Training na instancjach z GPU (ml.p3.2xlarge lub ml.p4d.24xlarge w zależności od skali) i używaj zoptymalizowanej inferencji na ml.g4dn lub ml.p3 dla endpointów wrażliwych na opóźnienia. Generuj i przechowuj embeddingi w S3 lub SageMaker Feature Store; do wyszukiwania przybliżonych najbliższych sąsiadów (approximate nearest-neighbor search) użyj Faiss na dedykowanym klastrze inferencyjnym lub Amazon Kendra do wyszukiwania w skali przedsiębiorstwa. Uważaj na pułapki: używanie statycznych embeddingów dla słów wieloznacznych (polisemicznych) prowadzi do utraty kontekstu; nadmierna wymiarowość zwiększa zapotrzebowanie na pamięć masową i spowalnia wyszukiwanie najbliższych sąsiadów — zastosuj PCA/UMAP lub kwantyzację. Gdy modele w dalszej części potoku są wrażliwe na dryf embeddingów, zaimplementuj Model Monitor do śledzenia zmian w dystrybucji embeddingów i okresowo generuj je na nowo przy użyciu spójnego tokenizatora i punktu kontrolnego (checkpoint) modelu.

Modele sekwencyjne, obsługa intencji/slotów i ekstrakcja jednostek

Modelowanie sekwencji obejmuje zarówno klasyczne modele LSTM/GRU, jak i transformery typu enkoder-dekoder do zadań seq2seq. Do wykrywania intencji i wypełniania slotów w systemach konwersacyjnych wykorzystaj Amazon Lex do zarządzania intencjami, typami slotów i hakami realizacyjnymi (fulfillment hooks); zintegruj funkcje Lambda do złożonej walidacji slotów lub wzbogacania kontekstu. W przypadku modeli niestandardowych (bespoke), trenuj NER na poziomie tokenów, używając warunkowych pól losowych (conditional random fields) nałożonych na BERT, lub skorzystaj z dostrajania (fine-tuning) klasyfikacji tokenów z Hugging Face na SageMaker (trening na GPU z ml.p3.2xlarge). Przypadki użycia typu sequence-to-sequence, takie jak streszczanie lub tłumaczenie, faworyzują transformery enkoder-dekoder (T5, BART) i wymagają do treningu większych instancji GPU; użyj mieszanej precyzji (AMP) i akumulacji gradientu, aby zmieścić długie sekwencje. Do ekstrakcji jednostek można użyć Amazon Comprehend dla gotowych jednostek nazwanych (out-of-the-box), ale dla jednostek specyficznych dla domeny (numery SKU produktów, nazwy chemiczne) wybierz Comprehend Custom Entities lub dostrój własny model NER. Częstą pułapką jest mylenie klasyfikacji intencji z walidacją slotów — wysoka dokładność intencji nie gwarantuje poprawnych wartości slotów; dodaj walidację schematu, progi pewności (confidence thresholds) i intencje zapasowe (fallback intents). W środowisku produkcyjnym udostępniaj modele za pośrednictwem endpointów SageMaker, używając endpointów wielomodelowych (multi-model endpoints) w celu optymalizacji kosztów, a do zadań offline o wysokiej przepustowości wykorzystaj inferencję asynchroniczną lub Batch Transform.

Mowa: transkrypcja, synteza i kompleksowe rozwiązania głosowe

Potoki przetwarzania mowy wymagają uwzględnienia zarówno modeli akustycznych, jak i językowych. Do transkrypcji, usługa Amazon Transcribe obsługuje typowe przypadki użycia dzięki funkcjom takim jak niestandardowe słowniki (custom vocabularies) i filtrowanie słownictwa (vocabulary filtering), aby poprawić rozpoznawanie nazw marek lub produktów; włącz niestandardowe słowniki i filtrowanie słownictwa w ustawieniach zadania Transcribe, a także używaj identyfikacji kanału (channel identification) lub diaryzacji mówcy (speaker diarization) w przypadku poczty głosowej lub nagrań z wieloma mówcami. W przypadku bardzo krótkich nagrań audio o niskiej latencji, preferuj działającą w czasie rzeczywistym usługę Transcribe Streaming z połączeniami WebSocket o niskim opóźnieniu i rozważ użycie niestandardowego modelu językowego (custom language model) Transcribe dla specjalistycznego żargonu. Do zamiany tekstu na mowę (text-to-speech), Amazon Polly oferuje głosy neuronowe i wsparcie dla SSML; używaj leksykonów i tagów SSML do kontrolowania wymowy, prozodii i pauz, aby zapewnić naturalne doświadczenie klienta. Zintegruj Lex z Transcribe i Polly, aby tworzyć boty głosowe, i połącz z Amazon Connect w celu obsługi telefonii. Częstą pułapką jest poleganie wyłącznie na domyślnych modelach językowych dla nazw specyficznych dla danej dziedziny — zawsze dodawaj niestandardowe słowniki lub dostrajaj modele. W przypadku potrzeb offline lub on-premises, spakuj lekkie modele za pomocą SageMaker Neo lub wdróż mniejsze modele akustyczne na urządzeniach brzegowych, jednocześnie centralizując aktualizacje ciężkich modeli językowych w chmurze i wersjonując je w SageMaker Model Registry.

Praktyczny problem: Scenariusz użycia

Scenariusz: Firma GlobalNews Analytics działa na AWS, z potokami danych w S3 i przetwarzaniem wstępnym w SageMaker Processing. Codziennie pozyskuje miliony angielskich komentarzy użytkowników i utrzymuje punkt końcowy SageMaker do analizy tematów.

Wyzwanie: Identyfikacja najczęściej dyskutowanych tematów z zaszumionych, często krótkich komentarzy, przy jednoczesnym radzeniu sobie ze slangiem, emoji i tysiącami nazw własnych (nazwy produktów/miejsc).

Zalecane podejście:

  1. Użyj zadania SageMaker Processing (ml.m5.4xlarge) do przeprowadzenia deterministycznej sanityzacji: usuwanie HTML, normalizacja Unicode, mapowanie emoji na tokeny, zmiana wielkości liter na małe w odpowiednich miejscach i przechowywanie oczyszczonego tekstu w formacie Parquet na S3.
  2. Wygeneruj kontekstowe osadzenia zdań (sentence embeddings) poprzez dostrojenie modelu Sentence-BERT z użyciem Hugging Face na SageMaker Training z instancją ml.p3.2xlarge; utrwalaj osadzenia na S3 i opcjonalnie w Feature Store.
  3. Klastruj osadzenia za pomocą Faiss (klaster CPU lub węzły z GPU), aby odkryć grupy tematyczne, i uruchom zadanie SageMaker Processing w celu obliczenia najpopularniejszych n-gramów i reprezentatywnych zdań dla każdego klastra; opcjonalnie dopracuj klastry za pomocą UMAP w celu redukcji wymiarowości.
  4. Uruchom produkcyjnie, udostępniając lekki punkt końcowy do inferencji (ml.g4dn.xlarge) w celu tworzenia osadzeń dla nowych komentarzy, użyj Batch Transform do nocnego ponownego klastrowania i włącz SageMaker Model Monitor do wykrywania dryfu osadzeń (embedding drift) i uruchamiania ponownego trenowania, gdy zmiana dystrybucji przekroczy progi.

Uzasadnienie: To podejście równoważy skalowalne przetwarzanie wstępne, kontekstowe osadzenia dla krótkich/zaszumionych tekstów oraz wydajne odkrywanie tematów oparte na podobieństwie, jednocześnie wykorzystując SageMaker do trenowania, inferencji i monitorowania, aby zapewnić powtarzalność i gotowość operacyjną.


Uczenie głębokie i widzenie komputerowe · Wszystkie domeny · Szeregi czasowe i prognozowanie

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt