Amazon AIF-C01: AI 安全与隐私 — 学习指南
属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
数据保护与访问控制
保护训练和推理数据始于最小权限访问。为 Amazon SageMaker、AWS Lambda 和 Amazon Bedrock 使用具有精细化策略和资源级限制的 IAM 角色;将凭证存储在 AWS Secrets Manager 中,避免在代码中嵌入机密信息。使用 Amazon Macie 和 AWS Glue Data Catalog 对数据进行分类,以确保只有经批准的数据集(及其经批准的子集)才能进入训练管道。对于敏感属性,在存储或索引之前,应用 Comprehend PII 检测与脱敏或令牌化;当需要为下游工作流保留关联性时,可考虑使用可逆令牌替换 PII。强制执行 S3 存储桶策略,阻止公有访问,并要求对包含敏感材料的对象使用 SSE-KMS 加密。使用 KMS 密钥策略和密钥轮换来控制谁可以解密训练产物或模型检查点。从业者常见的陷阱包括:授予过于宽泛的 SageMaker 执行角色、忘记限制 S3 前缀访问,以及未能轮换 KMS 密钥或 IAM 凭证。决策标准应权衡数据的敏感性、对输入进行脱敏或合成的能力,以及模型是否绝对有必要直接访问原始 PII。当为了模型效用必须保留 PII 时,应优先选择带有受控审计追踪的隔离处理,而不是开放式存储。
私有连接、加密与密钥管理
网络隔离和加密控制是生产环境机器学习的基础。使用 VPC 终端节点和 AWS PrivateLink 将 SageMaker 训练和托管部署在 VPC 内部,这样数据就永远不会通过公网传输。为 S3、Secrets Manager 和 Bedrock(在支持的情况下)配置 VPC 接口终端节点,并应用终端节点策略,将流量限制在经批准的主体和前缀范围内。使用 TLS 加密所有传输中的数据,并使用 SSE-KMS (S3) 和 EBS 加密为训练实例加密静态数据。使用 AWS KMS 进行集中式密钥管理;考虑使用多区域密钥以支持灾难恢复和跨区域操作,并使用 KMS 密钥策略限制解密(Decrypt)权限。对于高度受监管的工作负载,使用 AWS Nitro Enclaves 来隔离加密操作和证明模型产物,而无需暴露主机内存。常见的陷阱包括:在使用终端节点策略时忘记阻止 S3 公有访问、EC2 元数据权限过于宽泛,或使用客户 KMS 密钥而未设置明确的访问控制。如果您必须防止 AWS 端的解密,请选择客户端加密;当您需要精细化的访问可审计性以及与 AWS 服务的集成时,应优先选择 SSE-KMS。
日志记录、审计、治理与可解释性
保持端到端的可观测性:启用 CloudTrail 对 SageMaker、Bedrock、KMS 和 S3 进行 API 级别的审计;将日志流式传输到 CloudWatch 以及一个集中化的、不可变的归档中,以满足保留和合规要求。使用 AWS Config 记录资源配置并检测配置漂移。对于机器学习特有的血缘和治理,使用 SageMaker Model Registry 和 SageMaker Experiments 来捕获模型元数据、版本控制、来源和部署历史;集成 SageMaker Model Monitor 来检测概念漂移、数据倾斜和预测质量下降。为了进行偏差检测和实现可解释性,在管道中集成 SageMaker Clarify 以获取数据集偏差指标,使用 SHAP 或积分梯度进行特征归因,并生成记录了训练数据、评估指标和已知局限性的模型卡片。从业者陷阱包括:将 PII 明文记录到 CloudWatch 日志中、未将模型版本与推理指标关联起来,或缺少针对漂移的自动警报。决策标准应在保留窗口期与成本之间取得平衡,并要求可解释性输出是人类可读的,且与模型元数据一同存储,以便在适用时进行审计以及供临床医生/监管机构审查。
隐私保护训练、RAG、嵌入和 Bedrock 安全注意事项
当模型与敏感语料库交互或提供用户特定内容时,应采用隐私保护技术。训练期间的差分隐私 (DP) 机制可以限制个体贡献;联邦学习模式可以将原始记录保留在本地,同时共享模型更新。对于检索增强生成 (RAG),避免将原始 PII 索引到向量存储中;应通过 PII 脱敏进行预处理,或存储指针并在检索时进行即时脱敏。嵌入 (Embeddings) 可能会泄露敏感信息——应像对待任何数据库一样对待向量存储:使用静态加密 (S3/EBS),通过 IAM 和 VPC 限制访问,并考虑对密钥进行令牌化或使用查询时过滤器。Bedrock 提供护栏 (guardrails) 和审核工具来检测和阻止有害的输入/输出,并与 IAM 和 VPC 控制集成;应将护栏作为纵深防御层来实施,但不要将其作为唯一的控制措施。常见的陷阱包括通过开放端点暴露向量数据库、未能刷新 RAG 索引导致输出过时或有偏见,以及假设提示调优可以消除幻觉。根据延迟、数据驻留和模型治理的需求,在 Bedrock 上的同步微调和运行时提示工程之间进行选择。
实际问题:用例场景
场景:流媒体提供商 Horizon Media 运行一个基于 SageMaker 的 AI 管道,并使用 Amazon Bedrock 实现助手功能。收视日志和个性化数据位于 eu‑west‑1 区域的加密 S3 存储桶中,每日内容元数据被索引到用于 RAG 的 OpenSearch 向量存储中。
挑战:他们需要提供个性化推荐和由 Bedrock 支持的对话式助手,同时防止 PII 泄露到嵌入中,确保数据处理在指定区域内进行,并提供可审计的模型血缘和漂移警报。
推荐方法:
- 使用 AWS PrivateLink 和 VPC 接口端点在 VPC 内配置 SageMaker 训练和 Bedrock 访问;强制执行 S3 端点策略以限制存储桶前缀。
- 在嵌入前,使用 Amazon Macie 和 Comprehend PII 检测并脱敏 PII;在向量存储中仅存储脱敏后的文本或可逆令牌,并使用 SSE-KMS 进行加密。
- 在 SageMaker Model Registry 中注册模型和工件,并使用 SageMaker Experiments 跟踪实验;启用 Model Monitor 以监控数据和预测漂移,并使用 CloudTrail/CloudWatch 获取审计日志。
- 应用 Bedrock 护栏进行内容审核,强制执行 IAM 和 KMS 密钥策略以满足区域驻留要求,并考虑对高度敏感的样本使用差分隐私或合成数据进行训练。
理由:网络隔离、集中式密钥控制、嵌入前的 PII 脱敏,以及全面的血缘和监控,这些都符合从业者的最佳实践,旨在最大限度地减少泄露、满足数据驻留要求,并在生产 ML 系统中保持可审计的治理。
← 负责任的 AI 与治理 · 所有领域 · ML 数据工程 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →