Amazon AIF-C01: Bezpieczeństwo i prywatność AI — Przewodnik do nauki
Część AWS AI Practitioner AIF-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.
Ochrona danych i kontrola dostępu
Ochrona danych treningowych i danych do wnioskowania zaczyna się od dostępu opartego na zasadzie najmniejszych uprawnień. Używaj ról IAM dla Amazon SageMaker, AWS Lambda i Amazon Bedrock z precyzyjnymi politykami i ograniczeniami na poziomie zasobów; przechowuj poświadczenia w AWS Secrets Manager i unikaj osadzania sekretów w kodzie. Klasyfikuj dane za pomocą Amazon Macie i AWS Glue Data Catalog, aby do potoków treningowych trafiały tylko zatwierdzone zbiory danych (i ich zatwierdzone podzbiory). Dla wrażliwych atrybutów zastosuj wykrywanie i redakcję lub tokenizację PII za pomocą Comprehend przed zapisem lub indeksowaniem; rozważ zastąpienie PII odwracalnymi tokenami, gdy powiązanie jest wymagane w dalszych przepływach pracy. Wymuszaj stosowanie polityk bucketów S3, blokuj dostęp publiczny i wymagaj szyfrowania SSE-KMS dla obiektów zawierających materiały wrażliwe. Używaj polityk kluczy KMS i rotacji kluczy, aby kontrolować, kto może deszyfrować artefakty treningowe lub punkty kontrolne modelu. Częste pułapki, w które wpadają praktycy, to nadawanie zbyt szerokich ról wykonawczych SageMaker, zapominanie o ograniczeniu dostępu do prefiksów S3 oraz brak rotacji kluczy KMS lub poświadczeń IAM. Kryteria decyzyjne powinny uwzględniać wrażliwość danych, zdolność do redagowania lub syntezowania danych wejściowych oraz to, czy bezpośredni dostęp modelu do surowych danych PII jest absolutnie konieczny. Gdy dane PII muszą być zachowane dla użyteczności modelu, preferuj izolowane przetwarzanie z kontrolowanymi ścieżkami audytu zamiast otwartego przechowywania.
Prywatna łączność, szyfrowanie i zarządzanie kluczami
Izolacja sieciowa i kontrole kryptograficzne są fundamentalne dla produkcyjnych systemów ML. Wdrażaj trening i hosting SageMaker wewnątrz VPC, używając punktów końcowych VPC i AWS PrivateLink, aby dane nigdy nie przechodziły przez publiczny internet. Skonfiguruj interfejsowe punkty końcowe VPC dla S3, Secrets Manager i Bedrock (tam, gdzie jest to wspierane) i zastosuj polityki punktów końcowych, aby ograniczyć ruch do zatwierdzonych podmiotów (principals) i prefiksów. Szyfruj wszystkie dane w tranzycie za pomocą TLS i w spoczynku za pomocą SSE-KMS (S3) oraz szyfrowania EBS dla instancji treningowych. Używaj AWS KMS do scentralizowanego zarządzania kluczami; rozważ klucze wieloregionowe (multi‑Region) na potrzeby odtwarzania po awarii i operacji międzyregionalnych, a także ograniczaj uprawnienia Decrypt za pomocą polityk kluczy KMS. W przypadku obciążeń o wysokich wymaganiach regulacyjnych, używaj AWS Nitro Enclaves do izolowania operacji kryptograficznych i atestacji artefaktów modelu bez ujawniania pamięci hosta. Częste pułapki to zapominanie o blokowaniu publicznego dostępu do S3 podczas korzystania z polityk punktów końcowych, pozostawianie zbyt liberalnych uprawnień do metadanych EC2 lub używanie kluczy KMS klienta bez jawnych kontroli dostępu. Wybierz szyfrowanie po stronie klienta (client-side encryption), jeśli musisz uniemożliwić deszyfrowanie po stronie AWS, i preferuj SSE-KMS, gdy potrzebujesz szczegółowej audytowalności dostępu oraz integracji z usługami AWS.
Logowanie, audyt, ład i wyjaśnialność
Utrzymuj kompleksową obserwowalność (end‑to‑end): włącz CloudTrail do audytowania na poziomie API w usługach SageMaker, Bedrock, KMS i S3; przesyłaj strumieniowo logi do CloudWatch oraz do scentralizowanego, niezmiennego archiwum w celach retencji i zgodności z przepisami. Używaj AWS Config do rejestrowania konfiguracji zasobów i wykrywania dryfu konfiguracyjnego. Dla specyficznego dla ML śledzenia pochodzenia i ładu (governance), używaj SageMaker Model Registry i SageMaker Experiments do przechwytywania metadanych modelu, wersjonowania, historii pochodzenia (provenance) i historii wdrożeń; zintegruj SageMaker Model Monitor, aby wykrywać dryf koncepcji (concept drift), przesunięcie rozkładu danych (data skew) i pogorszenie jakości predykcji. Do wykrywania stronniczości (bias) i zapewnienia wyjaśnialności (explainability), instrumentuj potoki za pomocą SageMaker Clarify w celu uzyskania metryk stronniczości zbioru danych, użyj SHAP lub zintegrowanych gradientów do atrybucji cech (feature attribution) i twórz karty modelu (model cards) dokumentujące dane treningowe, metryki oceny i znane ograniczenia. Pułapki, w które wpadają praktycy, to logowanie danych PII otwartym tekstem do CloudWatch, brak korelacji wersji modelu z metrykami wnioskowania lub brak zautomatyzowanych alertów dotyczących dryfu. Kryteria decyzyjne powinny równoważyć okresy retencji z kosztami i wymagać, aby wyniki wyjaśnialności były czytelne dla człowieka i przechowywane wraz z metadanymi modelu w celu zapewnienia audytowalności oraz, w stosownych przypadkach, przeglądu przez klinicystów/regulatorów.
Szkolenie z zachowaniem prywatności, RAG, embeddingi i kwestie bezpieczeństwa w Bedrock
Gdy modele wchodzą w interakcję z wrażliwymi korpusami danych lub dostarczają treści specyficzne dla użytkownika, należy stosować techniki zachowujące prywatność. Mechanizmy różnicowej prywatności (DP) podczas szkolenia mogą ograniczyć wkład pojedynczych osób; wzorce uczenia federacyjnego pozwalają przechowywać surowe dane lokalnie (on-premises), udostępniając jedynie aktualizacje modelu. W przypadku Retrieval-Augmented Generation (RAG) unikaj indeksowania surowych danych PII w bazach wektorowych; przetwarzaj je wstępnie z redakcją PII lub przechowuj wskaźniki i stosuj redakcję w locie podczas pobierania danych. Embeddingi mogą prowadzić do wycieku wrażliwych informacji — traktuj bazy wektorowe jak każdą inną bazę danych: szyfruj dane w spoczynku (at rest) (S3/EBS), ograniczaj dostęp za pomocą IAM i VPC oraz rozważ tokenizację kluczy lub użycie filtrów w czasie zapytania. Bedrock dostarcza mechanizmy guardrails i narzędzia do moderacji w celu wykrywania i blokowania szkodliwych danych wejściowych/wyjściowych oraz integruje się z kontrolkami IAM i VPC; egzekwuj guardrails jako warstwę obrony w głąb (defense-in-depth), ale nie polegaj na nich jako jedynym zabezpieczeniu. Częste pułapki to m.in. udostępnianie bazy wektorowej przez otwarte punkty końcowe, brak odświeżania indeksów RAG prowadzący do nieaktualnych lub stronniczych wyników oraz zakładanie, że dostrajanie promptów eliminuje halucynacje. Wybieraj między synchronicznym dostrajaniem (fine-tuning) w Bedrock a inżynierią promptów w czasie rzeczywistym (runtime) w oparciu o wymagania dotyczące opóźnień, rezydencji danych i zarządzania modelem.
Problem praktyczny: Scenariusz użycia
Scenariusz: Horizon Media, dostawca usług streamingowych, używa potoku AI opartego na SageMaker oraz Amazon Bedrock do obsługi funkcji asystenta. Dzienniki oglądalności i dane personalizacyjne znajdują się w zaszyfrowanych bucketach S3 w regionie eu‑west‑1, a codzienne metadane treści są indeksowane w bazie wektorowej OpenSearch na potrzeby RAG.
Wyzwanie: Firma musi dostarczać spersonalizowane rekomendacje i asystenta konwersacyjnego opartego na Bedrock, jednocześnie zapobiegając wyciekowi PII do embeddingów, zapewniając przetwarzanie danych w obrębie określonego regionu oraz dostarczając audytowalną historię modelu (lineage) i alerty o dryfie.
Zalecane podejście:
- Skonfiguruj szkolenie w SageMaker i dostęp do Bedrock wewnątrz VPC, używając AWS PrivateLink i interfejsowych punktów końcowych VPC; wymuś polityki punktów końcowych S3, aby ograniczyć dostęp do określonych prefiksów bucketów.
- Użyj Amazon Macie i Comprehend PII do wykrywania i redagowania PII przed utworzeniem embeddingów; przechowuj w bazie wektorowej tylko zredagowany tekst lub odwracalne tokeny, zaszyfrowane za pomocą SSE-KMS.
- Rejestruj modele i artefakty w SageMaker Model Registry i śledź eksperymenty za pomocą SageMaker Experiments; włącz Model Monitor do wykrywania dryfu danych i predykcji oraz CloudTrail/CloudWatch do zbierania logów audytowych.
- Zastosuj mechanizmy guardrails w Bedrock do moderacji treści, egzekwuj polityki kluczy IAM i KMS w celu zapewnienia rezydencji danych w regionie i rozważ zastosowanie prywatności różnicowej lub danych syntetycznych do szkolenia na wysoce wrażliwych próbkach.
Uzasadnienie: Izolacja sieciowa, scentralizowana kontrola kluczy, redakcja PII przed tworzeniem embeddingów oraz kompleksowa historia modelu (lineage) i monitorowanie są zgodne z najlepszymi praktykami, aby minimalizować wycieki danych, spełniać wymagania dotyczące rezydencji danych i utrzymywać audytowalne zarządzanie w produkcyjnych systemach ML.
← Odpowiedzialna AI i zarządzanie · Wszystkie domeny · Inżynieria danych ML →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →