Amazon AIF-C01: Podstawy AI i ML — Przewodnik do nauki
Część AWS AI Practitioner AIF-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.
Podstawowe pojęcia i typy modeli
Zrozumienie podstawowej terminologii jest fundamentem solidnej architektury i podejmowania decyzji dotyczących kompromisów. Uczenie nadzorowane (supervised learning) mapuje dane wejściowe na etykietowane dane wyjściowe i dzieli się na regresję dla celów ciągłych oraz klasyfikację dla klas dyskretnych; klasyfikacja wieloklasowa (20 klas genów) w porównaniu z decyzjami binarnymi wpływa na wybór modelu i funkcji straty (loss functions). Uczenie nienadzorowane (unsupervised learning) odnajduje strukturę w nieetykietowanych danych poprzez klastrowanie i redukcję wymiarowości w celu segmentacji i wykrywania anomalii. Popularne rodziny algorytmów obejmują modele liniowe i zespoły drzew (interpretable, szybkie dla danych tabelarycznych), metody kernelowe (SVM) oraz sieci neuronowe (elastyczne, o dużej pojemności dla obrazów, dźwięku i tekstu). W zadaniach związanych z obrazami dominują sieci konwolucyjne (convolutional networks) lub wstępnie wytrenowane wizyjne modele fundamentalne (vision foundation models) (za pośrednictwem Amazon SageMaker JumpStart lub Amazon Rekognition Custom Labels); dla tekstu, architektury typu transformer zasilają duże modele językowe i sekwencyjne. Wymagania dotyczące interpretabilności skłaniają praktyków do korzystania z prostszych modeli lub narzędzi do wyjaśniania, takich jak SageMaker Clarify. Wybór modelu równoważy wydajność predykcyjną, interpretabilność, opóźnienie wnioskowania (inference latency) i koszt: model oparty na drzewach może wystarczyć do klasyfikacji genów, jeśli wymagana jest przejrzystość, podczas gdy modele głębokie pasują do zadań o wysokiej wymiarowości, takich jak przetwarzanie obrazów lub języka. Znajomość tych rodzin algorytmów oraz wiedza, kiedy ponownie wykorzystać wstępnie wytrenowane modele, a kiedy trenować je od zera, prowadzi do tworzenia wydajnych i zgodnych z wymogami (compliant) rozwiązań.
Cykl życia ML, zarządzanie danymi i cechami
Cykl życia uczenia maszynowego rozpoczyna się od sformułowania problemu, zbierania danych, etykietowania, inżynierii cech (feature engineering), trenowania, walidacji, wdrażania, monitorowania i iteracji. W środowiskach AWS, SageMaker orkiestruje wiele etapów cyklu życia: SageMaker Processing do transformacji danych, SageMaker Feature Store do scentralizowanego przechowywania cech i ich serwowania w trybie online/offline oraz SageMaker Pipelines do CI/CD dla przepływów pracy modeli. Jakość etykiet i zbalansowanie klas są częstymi wąskimi gardłami; warto zainwestować w solidne potoki adnotacji lub użyć SageMaker Ground Truth, aby zredukować zaszumione etykiety, oraz aktywnego uczenia (active learning), aby skupić wysiłek ludzki. Pochodzenie cech (feature lineage) i kontrola dostępu mają znaczenie dla odtwarzalności i ładu korporacyjnego (governance); rejestruj cechy i modele w SageMaker Model Registry oraz wersjonuj zbiory danych w Amazon S3 za pomocą polityk cyklu życia (lifecycle policies). W środowisku produkcyjnym należy uwzględnić zautomatyzowane monitorowanie modelu za pomocą SageMaker Model Monitor w celu wykrywania dryftu danych (data drift), dryftu koncepcji (concept drift) i spadku dokładności, a także zintegrować alerty za pośrednictwem Amazon CloudWatch i AWS Lambda. Projektuj potoki z uwzględnieniem idempotentności i odzyskiwania po awarii: używaj wzorców sterowanych zdarzeniami (zdarzenia S3, Step Functions) i projektuj zasoby obliczeniowe oraz pamięć masową pod kątem skalowalności — trenowanie na instancjach EC2/GPU lub Trainium, wnioskowanie na instancjach Inf1/Neptune/Graviton — w oparciu o wymagania dotyczące opóźnień i przepustowości.
Ewaluacja, algorytmy i typowe pułapki
Wybór metryk ewaluacyjnych i modeli bazowych (baselines) jest kluczową praktyką. Dla problemów klasyfikacyjnych należy wziąć pod uwagę precyzję (precision), czułość (recall), F1-score oraz pole pod krzywą ROC (AUC); dla klasyfikacji wieloklasowej użyj czułości dla każdej z klas oraz średnich makro/mikro. Ewaluacja regresji wykorzystuje RMSE, MAE i R-kwadrat (R-squared). W przypadku serwowania produkcyjnego, wydajność wykonania jest mierzona przez opóźnienie końcowe (tail latency, P95/P99) i przepustowość (żądania na sekundę) oraz koszt pojedynczego wnioskowania. Typowe pułapki obejmują wybór dokładności (accuracy) w niezbalansowanych zbiorach danych, nadmierne dopasowanie (overfitting) poprzez przesadną optymalizację hiperparametrów na danych testowych oraz pomijanie kalibracji, gdy prawdopodobieństwa są wykorzystywane do podejmowania decyzji biznesowych. Stosuj walidację krzyżową (cross-validation) i walidację na zbiorze odłożonym (holdout validation) oraz wdrażaj modele bazowe (proste heurystyki), aby upewnić się, że ML wnosi wartość dodaną. Gdy etykietowanych danych jest mało, użyj uczenia transferowego (transfer learning), augmentacji danych dla obrazów lub podejść częściowo nadzorowanych (semi-supervised). Dla zapewnienia wyjaśnialności i zgodności, łącz nieprzejrzyste modele (opaque models) z wyjaśnieniami post-hoc (SHAP, zintegrowane gradienty) i integruj SageMaker Clarify. Popularne wybory algorytmów w AWS: XGBoost dla danych tabelarycznych z szybkim trenowaniem w SageMaker, CNN dla obrazów za pomocą Torch/TensorFlow na instancjach GPU oraz transformery dla tekstu przy użyciu Hugging Face na SageMaker lub modeli fundamentalnych Bedrock do generowania wspomaganego wyszukiwaniem (retrieval-augmented generation).
Modele fundamentalne, wzorce wdrożeniowe i bezpieczeństwo
Modele fundamentalne (foundation models) przyspieszają rozwój, ale wprowadzają odrębne wybory architektoniczne i kwestie bezpieczeństwa. Usługa Amazon Bedrock zapewnia zarządzany dostęp do wielu modeli bazowych i obsługuje dostrajanie (fine‑tuning), przepływy pracy oparte na rozszerzonym generowaniu z odzyskiwaniem informacji (RAG) oraz integrację z bazami wektorowymi, takimi jak Amazon OpenSearch Service (k-NN) lub Amazon Kendra do wyszukiwania semantycznego. Wybieraj między dostrajaniem (fine‑tuning), dostrajaniem instruktażowym (instruction‑tuning) a lekkimi adapterami w zależności od rozmiaru danych i potrzeb w zakresie bezpieczeństwa. Aby uzyskać wnioskowanie o niskim opóźnieniu i wysokiej przepustowości, rozważ wdrożenie zoptymalizowanych modeli na instancjach Amazon EC2 Inf1 (Inferentia) lub użycie SageMaker Neo/Edge Manager do kompilacji i hostowania modeli na urządzeniach brzegowych. Absolutnie najniższe opóźnienie podczas wnioskowania na urządzeniu wymaga kwantyzacji modelu, przycinania (pruning) i lokalnego środowiska uruchomieniowego za pośrednictwem SageMaker Edge Manager lub AWS IoT Greengrass, co odbywa się kosztem rozmiaru i dokładności modelu. Wzorce bezpieczeństwa obejmują punkty końcowe VPC, AWS PrivateLink dla Bedrock, rygorystyczne role IAM, szyfrowanie danych wrażliwych w S3 przy użyciu KMS oraz rejestrowanie zdarzeń audytowych. Aby ograniczyć halucynacje i ataki na prompty, zaimplementuj mechanizmy ochronne (guardrails): sanityzację danych wejściowych, szablony promptów, filtry odpowiedzi oraz weryfikację za pomocą RLHF lub przetwarzania końcowego. Monitoruj użycie i nietypowe wywołania API za pomocą CloudTrail oraz wdróż limity zapytań (rate limits) i wykrywanie anomalii, aby chronić dostęp do modelu i prywatność danych.
Problem praktyczny: Scenariusz użycia
Scenariusz: Firma GreenGene Labs używa środowiska AI w AWS, wykorzystując Amazon S3 do przechowywania surowych danych, SageMaker do tworzenia modeli oraz Amazon Bedrock do eksperymentowania z modelami fundamentalnymi. Przechowują oni wrażliwe metadane genomowe i kliniczne pod ścisłą kontrolą dostępu i potrzebują skalowalnego wnioskowania dla pulpitów badawczych.
Wyzwanie: Sklasyfikować próbki ludzkich genów do 20 kategorii z przejrzystą logiką decyzyjną, zapewnić ponowne wykorzystanie cech (features) w różnych zespołach oraz wdrożyć monitorowane API o niskim opóźnieniu dla badaczy.
Zalecane podejście:
- Użyj SageMaker Processing i Ground Truth do przygotowania i etykietowania danych, przechowując przetworzone cechy (features) w SageMaker Feature Store.
- Wytrenuj interpretowalne modele (XGBoost, drzewa decyzyjne) za pomocą SageMaker Training; zarejestruj modele w SageMaker Model Registry i zapisz ich pochodzenie (lineage).
- Wdróż najlepszy model na punkcie końcowym SageMaker za Application Load Balancer z automatycznym skalowaniem; włącz SageMaker Model Monitor do wykrywania dryftu (drift) i alerty CloudWatch.
- Do eksperymentów z większymi reprezentacjami użyj modeli z Bedrock lub Hugging Face do tworzenia osadzeń (embeddings) i dodaj indeks wektorowy OpenSearch do wyszukiwania podobieństw; połącz z modelem interpretowalnym w celu ostatecznej klasyfikacji.
Uzasadnienie: Scentralizowane zarządzanie cechami i powtarzalne potoki (pipelines) ograniczają wyciek danych i przyspieszają współpracę, podczas gdy priorytetyzacja modeli interpretowalnych spełnia wymogi przejrzystości, a osadzenia (embeddings) z Bedrock umożliwiają bogatszą reprezentację bez poświęcania ładu korporacyjnego (governance).
Wszystkie domeny · Koncepcje generatywnej AI →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →