Amazon AIF-C01: AI 安全與隱私 — 學習指南
屬於 AWS AI Practitioner AIF-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.
資料保護與存取控制
保護訓練與推論資料的第一步,是採用最低權限存取。為 Amazon SageMaker、AWS Lambda 和 Amazon Bedrock 使用具備精細化政策與資源層級限制的 IAM 角色;將憑證儲存在 AWS Secrets Manager 中,並避免將機密資訊寫死在程式碼裡。使用 Amazon Macie 和 AWS Glue Data Catalog 對資料進行分類,確保只有經核准的資料集(及其經核准的子集)能進入訓練管道。對於敏感屬性,在儲存或索引前,應使用 Comprehend PII 偵測功能進行編輯或權杖化;當下游工作流程需要連結性時,可考慮將 PII 替換為可逆的權杖。強制執行 S3 儲存貯體政策、封鎖公開存取,並要求包含敏感資料的物件使用 SSE-KMS 加密。使用 KMS 金鑰政策與金鑰輪替來控制誰可以解密訓練產物或模型檢查點。從業人員的常見陷阱包括:授予過於寬鬆的 SageMaker 執行角色、忘記限制 S3 前綴的存取權限,以及未能輪替 KMS 金鑰或 IAM 憑證。決策標準應權衡資料的敏感性、編輯或合成輸入資料的能力,以及模型是否絕對有必要直接存取原始 PII。當為了模型的實用性而必須保留 PII 時,應優先選擇具備受控稽核軌跡的隔離式處理,而非開放式儲存。
私有連線、加密與金鑰管理
網路隔離與加密控制是生產環境 ML 的基礎。使用 VPC 端點和 AWS PrivateLink 將 SageMaker 訓練與託管部署在 VPC 內部,如此資料便永遠不會經過公用網際網路。為 S3、Secrets Manager 和 Bedrock(在支援的情況下)設定 VPC 介面端點,並套用端點政策,將流量限制在經核准的主體與前綴。使用 TLS 加密所有傳輸中的資料,並使用 SSE-KMS (S3) 和 EBS 加密來保護訓練執行個體的靜態資料。使用 AWS KMS 進行集中式金鑰管理;考慮使用多區域金鑰以進行災難復原與跨區域操作,並使用 KMS 金鑰政策限制解密 (Decrypt) 權限。對於高度管制的工作負載,可使用 AWS Nitro Enclaves 來隔離加密操作與模型產物的證明,而無需暴露主機記憶體。常見的陷阱包括:在使用端點政策時忘記封鎖 S3 的公開存取、讓 EC2 中繼資料的權限過於寬鬆,或使用客戶 KMS 金鑰卻未設定明確的存取控制。如果您必須防止 AWS 端進行解密,請選擇用戶端加密;當您需要精細的存取稽核能力以及與 AWS 服務的整合時,則應優先選用 SSE-KMS。
日誌記錄、稽核、治裡與可解釋性
維持端到端的可觀測性:啟用 CloudTrail 以對 SageMaker、Bedrock、KMS 和 S3 進行 API 層級的稽核;將日誌串流至 CloudWatch 以及一個集中且不可變的封存庫,以滿足保留與合規性要求。使用 AWS Config 來記錄資源組態並偵測組態漂移。針對 ML 特有的譜系與治裡,使用 SageMaker Model Registry 和 SageMaker Experiments 來擷取模型中繼資料、版本控制、來源與部署歷史;整合 SageMaker Model Monitor 以偵測概念漂移、資料偏移與預測品質下降。為了偵測偏見與提高可解釋性,應使用 SageMaker Clarify 來檢測管線,以取得資料集偏見指標;使用 SHAP 或整合梯度法進行特徵歸因;並產出模型卡,記錄訓練資料、評估指標與已知限制。從業人員的陷阱包括:將 PII 明文記錄到 CloudWatch、未將模型版本與推論指標建立關聯,或缺乏對漂移的自動化警示。決策標準應在保留期限與成本之間取得平衡,並要求可解釋性的輸出結果是人類可讀的,且與模型中繼資料一同儲存,以便在適用時進行稽核以及供臨床醫生/監管機構審查。
隱私保護訓練、RAG、嵌入與 Bedrock 安全考量
當模型與敏感語料庫互動或提供使用者特定內容時,應採用隱私保護技術。訓練期間的差分隱私 (DP) 機制可以限制個別貢獻;聯邦學習模式可以將原始記錄保留在地端,同時共享模型更新。對於檢索增強生成 (Retrieval-Augmented Generation),應避免將原始 PII 索引到向量儲存中;透過 PII 修訂進行預處理,或儲存指標並在檢索時應用即時修訂。嵌入可能洩漏敏感資訊——應將向量儲存視為任何資料庫:進行靜態加密 (S3/EBS)、透過 IAM 和 VPC 限制存取,並考慮將金鑰權杖化或使用查詢時篩選器。Bedrock 提供防護機制和審核工具來偵測和阻擋有害的輸入/輸出,並與 IAM 和 VPC 控制整合;應強制執行防護機制作為深度防禦層,但不要將其作為唯一的控制措施。常見的陷阱包括透過開放端點暴露向量資料庫、未能刷新 RAG 索引導致輸出過時或有偏見,以及假設提示調整能完全消除幻覺。根據延遲、資料落地和模型治理的需求,在 Bedrock 上的同步微調和執行期提示工程之間做出選擇。
實務問題:使用案例情境
情境:串流媒體供應商 Horizon Media 執行一個基於 SageMaker 的 AI 管線,並結合 Amazon Bedrock 來提供助理功能。觀看紀錄和個人化資料存放在 eu‑west‑1 中加密的 S3 儲存貯體,每日的內容中繼資料則被索引到一個 OpenSearch 向量儲存中以供 RAG 使用。
挑戰:他們需要在提供個人化推薦和一個由 Bedrock 支援的對話式助理時,防止 PII 洩漏到嵌入中,確保資料處理限制在特定區域內,並提供可稽核的模型血緣和偏移警示。
建議方法:
- 在 VPC 內使用 AWS PrivateLink 和 VPC 介面端點來設定 SageMaker 訓練和 Bedrock 存取;強制執行 S3 端點政策以限制儲存貯體前綴。
- 在嵌入前,使用 Amazon Macie 和 Comprehend PII 來偵測和修訂 PII;在向量儲存中僅儲存修訂後的文本或可逆權杖,並使用 SSE-KMS 加密。
- 在 SageMaker Model Registry 中註冊模型和成品,並使用 SageMaker Experiments 追蹤實驗;啟用 Model Monitor 以監控資料和預測偏移,並使用 CloudTrail/CloudWatch 記錄稽核日誌。
- 應用 Bedrock 防護機制進行內容審核,強制執行 IAM 和 KMS 金鑰政策以確保區域駐留,並考慮對高度敏感的樣本使用差分隱私或合成資料進行訓練。
理由:網路隔離、集中式金鑰控制、嵌入前的 PII 修訂,以及全面的血緣加上監控,這些都符合從業人員的最佳實務,以在生產環境的機器學習系統中,最大限度地減少洩漏、滿足資料落地要求,並維持可稽核的治理。
← 負責任的 AI 與治理 · 所有領域 · ML 資料工程 →
練習這些題目 → · 在 ExamRoll.io 上限時練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通過考試 →