Amazon AIF-C01: Inżynieria danych ML — Przewodnik do nauki
Część AWS AI Practitioner AIF-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.
Gromadzenie, etykietowanie, wersjonowanie i zarządzanie danymi
Gromadzenie reprezentatywnych, audytowalnych zbiorów danych jest fundamentalnym krokiem w każdym projekcie ML. Użyj Amazon S3 jako centralnego, trwałego magazynu z włączonymi S3 Versioning i blokadą obiektów (object lock), aby zachować surowe dane wejściowe i śledzić ich pochodzenie (provenance). Do ustrukturyzowanego pozyskiwania i katalogowania danych, rejestruj zbiory danych w AWS Glue Data Catalog i stosuj szczegółową kontrolę dostępu za pomocą Lake Formation. Gdy wymagane jest etykietowanie przez człowieka, Amazon SageMaker Ground Truth dostarcza wbudowane przepływy pracy, interfejs użytkownika do adnotacji oraz pętle aktywnego uczenia (active learning), które redukują koszty etykietowania, tworząc jednocześnie metadane dotyczące zgodności i pewności etykietujących. Częste pułapki to gromadzenie obciążonych (biased) lub niereprezentatywnych próbek, brak rejestrowania pochodzenia danych (lineage) i zasad etykietowania oraz niewystarczająca kontrola jakości etykiet. Można je ograniczyć, przechowując audyty etykietowania, ponownie etykietując „na ślepo” podzbiory danych (blind-relabel) i stosując heurystyki konsolidacji etykiet. Decyzje dotyczące prywatności i zgodności z przepisami (compliance) wpływają na architekturę: używaj szyfrowania po stronie serwera (server-side encryption) w S3 z kluczami CMK zarządzanymi przez KMS, ograniczaj dostęp za pomocą polityk IAM i punktów końcowych VPC (AWS PrivateLink) oraz wykrywaj i anonimizuj dane osobowe (PII) za pomocą Amazon Comprehend przed udostępnieniem danych do trenowania modelu. W przypadku długotrwałych programów, twórz migawki (snapshots) zbiorów danych, oznaczaj je identyfikatorami zbiorów i śledź eksperymenty za pomocą Amazon SageMaker Experiments lub zewnętrznego narzędzia, takiego jak DVC, aby umożliwić powtarzalne trenowanie i raportowanie na potrzeby regulacyjne.
Przetwarzanie wstępne, inżynieria cech i EDA
Transformacje i cechy (features) determinują zdolność modelu do generalizacji. Użyj AWS Glue lub Amazon SageMaker Data Wrangler do profilowania, czyszczenia i normalizacji danych oraz przeprowadzaj iteracyjną eksploracyjną analizę danych (EDA) za pomocą Amazon QuickSight lub notatników Jupyter hostowanych w Amazon SageMaker Studio. Do zarządzania cechami w środowisku produkcyjnym, wdróż Amazon SageMaker Feature Store, aby zapewnić spójne obliczanie cech w trybie offline i online oraz unikać rozbieżności między trenowaniem a serwowaniem (train/serve skew). Przechowuj surowe i pochodne cechy oddzielnie oraz zapisuj logikę ich tworzenia. Potoki przetwarzania danych szeregów czasowych i strumieniowych powinny wykorzystywać Amazon Kinesis lub strumieniowy ETL w AWS Glue (streaming ETL) do odświeżania cech z niskim opóźnieniem. Typowe pułapki to wyciek danych (data leakage) — gdzie przyszłe informacje przenikają do danych treningowych — nieprawidłowe obsługiwanie brakujących wartości oraz niedopasowanie między cechami używanymi do trenowania offline a cechami serwowanymi online. Kryteria decyzyjne przy projektowaniu potoków zależą od kompromisu między aktualnością danych a kosztem: wybierz wsadowy ETL (batch ETL) do ciężkich, historycznych przeliczeń, przetwarzanie strumieniowe do personalizacji w czasie niemal rzeczywistym oraz architektury hybrydowe, gdy wymagane są cechy online o niskim opóźnieniu. Automatyzuj kontrole poprawności i egzekwowanie schematu (schema enforcement) w Glue lub jako część zadań SageMaker Processing, aby wcześnie wykrywać dryf schematu (schema drift).
Embeddingi, augmentacja, dane syntetyczne i zbiory danych dla modeli fundamentalnych
Embeddingi (osadzenia) konwertują tekst, obrazy lub dane multimodalne na gęste wektory, które przechwytują relacje semantyczne; napędzają one wyszukiwanie semantyczne, generowanie wspomagane wyszukiwaniem (retrieval-augmented generation) i klastrowanie. Zbuduj wzorzec generowania wspomaganego wyszukiwaniem (RAG), w którym generujesz embeddingi za pomocą Amazon Bedrock lub enkoderów hostowanych w SageMaker, przechowujesz wektory w Amazon OpenSearch Service (k-NN), Amazon Kendra lub zarządzanej bazie wektorowej, a następnie pobierasz kontekst, aby ukierunkować model fundamentalny. Augmentacja danych i generowanie danych syntetycznych są praktyczne, gdy brakuje prawdziwych przykładów: użyj modeli generatywnych w SageMaker do tworzenia parafraz, transformacji obrazów (za pomocą Albumentations lub SageMaker Processing) lub syntetycznych rekordów z zachowaniem prywatności. Uważaj na nadmierne poleganie na danych syntetycznych — niska wierność może wprowadzić przesunięcie rozkładu (distribution shift) i doprowadzić do nadmiernego dopasowania (overfitting) modeli do artefaktów. Dla zbiorów danych do trenowania modeli fundamentalnych (FM), dobieraj wysokiej jakości przykłady (exemplars), kanonizuj formaty za pomocą szablonów promptów i wersjonuj każdą migawkę zbioru danych w S3. W przypadku prywatnych danych używanych z modelami FM firm trzecich, preferuj ścieżkę prywatnego dostrajania (fine-tuning) (przenosząc zasoby obliczeniowe do VPC) lub wdrażaj potoki oparte wyłącznie na wyszukiwaniu (retrieval-only), które wysyłają do modelu FM tylko niewrażliwy kontekst, przechowując dokumenty źródłowe w bezpiecznej bazie wektorowej. Stosuj anonimizację (redaction) i maskowanie na poziomie tokenów, aby zapobiec wyciekom. Inżynieria promptów (prompt engineering) i szablony instrukcji (system prompts) są kluczowe do kształtowania odpowiedzi modelu; dostosuj parametry temperature, top_k lub top_p w zależności od wymaganego determinizmu i kreatywności.
Ewaluacja, wdrażanie, monitorowanie i zarządzanie cyklem życia
Ewaluacja musi być jawna i wykorzystywać metryki dostosowane do celów biznesowych: zadania regresji używają RMSE lub MAE, klasyfikacja binarna ocenia precyzję/czułość/F1 i ROC AUC, a streszczanie wykorzystuje warianty ROUGE. Podczas fazy ewaluacji należy przeprowadzić walidację i walidację krzyżową, a do ostatecznej akceptacji zachować ślepy zbiór testowy. Wdrażaj za pomocą punktów końcowych Amazon SageMaker (wnioskowanie w czasie rzeczywistym lub bezserwerowe) lub Amazon Bedrock do zarządzanego serwowania modeli FM; optymalizuj pod kątem opóźnień, wybierając mniejsze, destylowane modele, włączając punkty końcowe dla wielu modeli lub używając SageMaker Serverless Inference dla nieprzewidywalnego ruchu. Monitoruj wydajność i dryf danych w środowisku produkcyjnym za pomocą Amazon SageMaker Model Monitor i skonfiguruj alerty dotyczące pogorszenia metryk; stosuj wdrożenia typu canary lub blue/green, aby ograniczyć ryzyko. Kontrola dostępu do użytkowania modelu jest egzekwowana za pomocą polityk ról IAM, uprawnień na poziomie zasobów i izolacji sieciowej. Pułapki dla praktyków obejmują wybór niewłaściwej metryki (dokładność dla niezbalansowanych klas), ignorowanie dryfu koncepcji oraz brak instrumentacji danych treningowych i logów wnioskowania w celu zapewnienia audytowalności. Używaj CI/CD dla ML z SageMaker Pipelines, aby standaryzować cykl ponownego trenowania, utrzymywać spójne wersjonowanie zbiorów danych i modeli oraz zachować możliwą do obrony ścieżkę audytu na potrzeby zgodności z przepisami.
Problem praktyczny: Scenariusz użycia
Scenariusz: BrightCart, internetowa sieć spożywcza, modernizuje swój lokalny system zarządzania zapasami, przenosząc go do AWS. Chce stworzyć chatbota opartego na generatywnej AI, który odpowiada na pytania klientów i podaje aktualne lokalizacje zapasów, jednocześnie chroniąc dane klientów i zapasów zgodnie z obowiązującymi przepisami. Ich środowisko AI w AWS obejmuje S3 na zbiory danych, Amazon RDS na transakcyjne dane o zapasach, SageMaker Studio do developmentu, dostęp do Bedrock dla modeli podstawowych oraz sieć VPC.
Wyzwanie: Zbuduj prywatnego chatbota o niskim opóźnieniu, wykorzystującego RAG, który pobiera aktualne stany magazynowe i unika ujawniania danych wrażliwych oraz wywoływania halucynacji.
Zalecane podejście:
- Utwórz prywatną sieć VPC i skonfiguruj punkty końcowe AWS PrivateLink dla Bedrock i SageMaker; przechowuj kanoniczne dokumenty produktów i migawki zapasów w S3 z szyfrowaniem po stronie serwera (KMS) i włącz wersjonowanie S3.
- Ciągle obliczaj osadzenia (embeddings) z dokumentów produktowych za pomocą enkodera Bedrock lub modelu SageMaker w prywatnej podsieci i przechowuj wektory w Amazon OpenSearch Service z k-NN w celu szybkiego wyszukiwania najbliższych sąsiadów; przechowuj aktualne stany magazynowe w Amazon RDS i zapewnij bezpieczny konektor wykonawczy do ich pobierania.
- Zaimplementuj potok rozszerzony o wyszukiwanie (retrieval-augmented), w którym aplikacja najpierw odpytuje OpenSearch o kontekst, a następnie wywołuje Bedrock z szablonem promptu systemowego, który zawiera pobrany kontekst i jawne instrukcje bezpieczeństwa; oczyszczaj dane wejściowe od użytkownika poprzez walidację i użyj Amazon Comprehend do wykrywania danych PII i ich redagowania przed wyszukiwaniem.
- Wdróż chatbota za Application Load Balancer, serwuj model FM przez Bedrock z bramką API w VPC, włącz logowanie do CloudWatch z ograniczonym dostępem i monitoruj odpowiedzi modelu oraz dryf za pomocą SageMaker Model Monitor i okresowych audytów przeprowadzanych przez ludzi.
Uzasadnienie: To podejście wykorzystuje wzorzec RAG, aby zminimalizować ekspozycję danych wrażliwych, korzysta z prywatnej sieci i KMS w celu zapewnienia zgodności z przepisami, oddziela aktualne stany magazynowe od kontekstu modelu dla zachowania dokładności oraz stosuje monitorowanie i weryfikację przez człowieka (human-in-the-loop) w celu kontrolowania halucynacji i zapewnienia ciągłej niezawodności.
← Bezpieczeństwo i prywatność AI · Wszystkie domeny · Trenowanie →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →