Amazon MLS-C01: MLOps, monitorowanie, etykietowanie i zarządzanie modelami — Przewodnik do nauki

Część AWS Machine Learning Specialty MLS-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Potoki, CI/CD i Automatyzacja

Produkcyjne systemy ML wymagają kompleksowej automatyzacji, która łączy pozyskiwanie danych, walidację, trenowanie, strojenie, pakowanie modelu i wdrażanie w powtarzalne potoki (pipelines). Użyj Amazon SageMaker Pipelines do definiowania kroków dla zadań przetwarzania (Processing jobs) (Data Wrangler lub ScriptProcessor), trenowania (zarządzane trenowanie z Distributed Data Parallel lub XGBoost/BlazingText), strojenia hiperparametrów (HyperparameterTuningJob z metryką celu i warunkiem zatrzymania zadania trenowania - StoppingCondition) oraz rejestrowania modeli w SageMaker Model Registry. Zintegruj Pipelines z AWS CodePipeline i CodeBuild w celu przeprowadzania kontroli CI na poziomie kodu i testów jednostkowych oraz użyj CloudFormation lub CDK do provisioningu spójnych środowisk. Skonfiguruj buforowanie (caching) na krokach, aby unikać ponownego uruchamiania niezmienionych zadań, oraz sparametryzuj dane wejściowe potoku (prefiksy S3, typy instancji). W przypadku HPO nie polegaj wyłącznie na MaxNumberOfTrainingJobs; ustaw również warunek zatrzymania (StoppingCondition) dla każdego zadania trenowania (MaxRuntimeInSeconds) i włącz zautomatyzowane wczesne zatrzymywanie (early stopping), jeśli jest dostępne, aby uniknąć niekontrolowanych kosztów. Częste pułapki to używanie trybu File dla stale rosnących zbiorów danych (przełącz się na tryb Pipe lub trenowanie rozproszone dla dużych zbiorów danych), brak wersjonowania zbiorów danych i cech oraz pomijanie bramek walidacji danych (SageMaker Processing + Deequ lub kontrole Data Wrangler) przed ponownym trenowaniem. Kryteria wyboru między modelami wewnątrz bazy danych (Redshift ML) a SageMaker opierają się na złożoności modelu, opóźnieniach (latency) i kontroli operacyjnej: Redshift ML jest wygodny dla prostych modeli XGBoost wewnątrz SQL, podczas gdy SageMaker jest wymagany dla głębokich sieci neuronowych, niestandardowych architektur i skalowalnych punktów końcowych (endpoints).

Monitorowanie, Wykrywanie Dryftu i Jakość Modelu

Ciągły monitoring musi obejmować zarówno wydajność modelu, jak i jakość danych. Włącz przechwytywanie danych (data capture) dla punktów końcowych modelu SageMaker, aby przechowywać żądania i odpowiedzi w S3, a następnie utwórz bazowy profil rozkładu danych treningowych za pomocą zadania bazowego SageMaker Model Monitor. Użyj wbudowanych kontroli Model Monitor do wykrywania naruszeń schematu i metryk dryftu jednowymiarowego (univariate drift); w przypadku zmian rozkładu (distribution shifts) oblicz dywergencję KL, wskaźnik stabilności populacji (PSI) lub testy KS i ustaw alarmy CloudWatch na progach dryftu. Śledź metryki modelu — klasyfikacja: precyzja/czułość (precision/recall), ROC AUC, macierz pomyłek oraz specyficzne dla klas FPR/FNR; regresja: RMSE, MAE i MAPE. Clarify może uruchamiać kontrole obciążenia (bias) i wyjaśnialności (explainability) przed i po trenowaniu oraz generować atrybucje cech oparte na SHAP; użyj Clarify do wykrywania różnic w wydajności dla podgrup (atrybuty wrażliwe). Częste pułapki operacyjne to nieprzechwytywanie kontekstu wnioskowania (mapowanie cech, wersja modelu, ID żądania), ignorowanie opóźnień w pozyskiwaniu etykiet (opóźnione etykiety uniemożliwiają terminową ocenę) oraz mylenie dryftu populacji (population shift) z dryftem koncepcji (concept drift) — należy je obsługiwać w różny sposób (ponowne trenowanie vs. zbieranie etykiet i ponowna ocena cech). W celu alertowania przesyłaj zagregowane metryki i wskaźniki dryftu do CloudWatch oraz zautomatyzuj wycofywanie zmian (rollback) lub ponowne trenowanie za pomocą SageMaker Pipelines po przekroczeniu progów.

Etykietowanie, Przygotowanie Danych i Inżynieria Cech

Wysokiej jakości etykiety i spójne potoki przetwarzania cech są fundamentalne. Użyj Amazon SageMaker Ground Truth do tworzenia przepływów pracy etykietowania (labeling workflows) z automatycznym wstępnym etykietowaniem (etykietowanie wspomagane modelem), aktywnym uczeniem (active learning) i konsolidacją adnotacji; wybierz typy pracowników (zespół prywatny, dostawca lub publiczny) i skonfiguruj weryfikację etykiet oraz metryki zgodności między adnotatorami (inter-annotator agreement). Do eksploracyjnej analizy danych (EDA) i transformacji, załaduj zbiory danych do SageMaker Data Wrangler, aby profilować rozkłady, uzupełniać brakujące wartości (imputacja) i eksportować skrypty przetwarzania do zadań SageMaker Processing. Utrwalaj cechy online i offline w Amazon SageMaker Feature Store w celu zapewnienia spójnego pobierania w czasie rzeczywistym i prostego uzupełniania danych historycznych (backfills). Decyzje dotyczące kodowania zależą od skali i liczności (cardinality): zmienne kategoryczne o niskiej liczności można zakodować metodą one-hot encoding; elementy o wysokiej liczności (np. 100 kodów SKU produktów) wykorzystują kodowanie docelowe (target encoding) lub osadzenia (embeddings) (warstwy embedding w TensorFlow/PyTorch lub wbudowane algorytmy SageMaker), a odpowiedzi wielokrotnego wyboru w ankietach mapuje się na wektory multi-hot. Uważaj na częste pułapki, takie jak wyciek etykiet (label leakage) podczas dołączania codziennych metadanych (uwzględnij okna czasowe dla inżynierii cech i testy na wyciek), używanie trybu File dla bardzo dużych zbiorów danych w S3 (tryb Pipe strumieniuje rekordy i wspiera trenowanie rozproszone na wielu instancjach) oraz brak wersjonowania transformacji — eksportuj transformacje z Data Wrangler do reużywalnych kroków Processing/Training, aby zapewnić zgodność między trenowaniem a wnioskowaniem.


Bezpieczeństwo · Wszystkie domeny

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt