Amazon SAP-C02: 存储与数据管理 — 学习指南
属于 AWS Solutions Architect Professional SAP-C02 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
对象存储、生命周期和分层(Amazon S3 及相关服务)
Amazon S3 是持久、高可用的对象存储的基础,应被视为非结构化数据的权威性长期存储。设计决策围绕存储类别选择、生命周期规则、一致性语义和数据治理展开。对于频繁访问的对象,选择 S3 Standard;当访问模式未知时,选择 Intelligent-Tiering;对于不频繁访问的对象,选择 Standard-IA 或 One Zone-IA;对于需要长期保留但恢复延迟较高的场景,选择 Glacier/Deep Archive。基于标签或前缀实施生命周期策略,以自动转换对象并使旧版本过期;在启用生命周期或复制功能前,请先启用版本控制,以防对象被意外清除。使用跨区域复制 (CRR) 实现地理持久性和满足法规要求的数据安置,或使用同区域复制 (SRR) 实现合规性和职责分离。使用 S3 Object Lock 的治理模式或合规模式保护关键归档,并在适当情况下启用 MFA 删除功能。常见陷阱包括:过于激进的生命周期转换导致产生恢复费用和数分钟到数小时的延迟;未考虑 Glacier 的检索成本或时间;依赖公有终端节点而非 VPC 网关/接口终端节点(这可能将数据暴露于公网或产生 NAT 出口成本)。平衡成本与检索延迟和持久性:对冷数据采取积极的分层策略,但对热数据入口和需要低延迟访问的场景,应配置加速功能(CloudFront、S3 Transfer Acceleration、分段上传)。
共享文件系统和高性能存储 (EFS, FSx)
当应用程序需要 POSIX 语义、低延迟或 SMB 语义时,应选择共享文件系统。Amazon EFS 提供弹性的 NFS,具有多可用区持久性和 POSIX 一致性,适用于 Web 内容、主目录以及许多能容忍网络文件语义的 HPC 工作负载。EFS 有两种性能模式(突发吞吐量 vs 预置吞吐量)以及到 EFS Infrequent Access 的生命周期转换功能。Amazon FSx 提供专用的文件系统:用于 SMB/Active Directory 集成的 Windows File Server,以及为紧密耦合的 HPC 和媒体工作负载提供亚毫秒级延迟和高吞吐量的 FSx for Lustre;FSx Lustre 可以透明地链接到 S3,作为持久的数据存储库。当您需要 NTFS 语义、AD ACL、DFS 命名空间或仅限 Windows 的工具时,选择 FSx for Windows;对于需要高 IOPS 和吞吐量的渲染农场和机器学习训练,选择 FSx for Lustre。常见的操作失误包括:想当然地认为 EFS 会自动处理元数据密集型工作负载(您可能需要预置吞吐量)、在安全组中大范围地开放 NFS/SMB 端口,以及忽略挂载选项和客户端超时设置。评估权衡:FSx 成本更高,但性能更强,协议功能更丰富;EFS 扩展更简单,且具备多可用区持久性。将工作负载的 I/O 模式、并发性和吞吐量需求与所选系统相匹配,并在需要时单独调整吞吐量大小。
混合和离线传输模式(Storage Gateway、DataSync、Snow 系列)
混合架构通常需要低延迟的本地缓存、无缝的云备份或批量数据迁移。AWS Storage Gateway 提供三种模式:文件网关将 S3 暴露为 NFS/SMB,供本地应用程序写入 S3;卷网关暴露块存储卷用于灾难恢复 (DR);磁带网关替代物理磁带。AWS DataSync 可自动执行本地与 AWS(S3、EFS、FSx)之间的在线、增量和并行数据移动,并内置筛选、调度和带宽控制功能;在配置后,它会保留 POSIX 元数据。对于离线和超大规模传输,Snow 系列提供包含计算能力的边缘和传输设备:Snowcone 适用于小型远程站点,Snowball Edge 适用于数十到数百 TB 的数据量且设备上可运行 Lambda/EC2,Snowmobile 则用于 EB 级别的数据导入。当需要持续、自动化的传输时,使用 DataSync;当旧式应用程序必须在本地看到 NFS/SMB 挂载点,同时又希望将数据存储在 S3 中时,使用 Storage Gateway 文件网关。常见陷阱包括:使用错误的网关模式(缓存模式 vs 存储模式)、未规划网络吞吐量导致迁移时间过长、忽略用于安全传输的 IAM 角色和终端节点策略,以及低估 Snow 设备的接收/传出时间。对于频繁的增量同步,选择 DataSync;为实现本地协议兼容性,选择 Storage Gateway;对于网络带宽不足的批量或远程传输,选择 Snow 设备。
备份、复制、访问控制和运营治理
备份和复制方案的选择应由 RTO/RPO 目标、法规控制和成本驱动。使用 AWS Backup 集中管理 EBS、RDS、DynamoDB、EFS 和 FSx 的备份策略,并配置从温保管库到冷存储的生命周期转换以节省成本。对于数据库,首选原生机制(RDS 快照、只读副本,或用于异构迁移的 DMS),并结合跨区域快照复制和 KMS 密钥复制或独立的密钥策略。对于 S3,启用版本控制、CRR/SRR,并在需要近实时复制 SLA 时考虑使用复制时间控制 (RTC)。安全访问模式依赖于最小权限 IAM、存储桶策略、S3 阻止公有访问、带有端点策略的 VPC 网关/接口端点,以及通过精细化授权支持跨账户访问和快照复制的 KMS。使用 CloudTrail、S3 访问日志、CloudWatch 指标、AWS Config 规则进行监控,并使用 GuardDuty 和 Access Analyzer 进行威胁检测和 IAM 错误配置分析。典型的陷阱包括:未跨账户复制 KMS CMK 或授予其访问权限、快照未加密或可公开访问、以及未能通过 SCP 和标签策略强制执行标签或资源放置,这会使成本分摊和恢复变得复杂。根据弹性需求做出决策:多区域 active-active 模式可实现最低 RTO,pilot‑light/warm standby 模式可实现经济高效的 DR,当 RTO 必须最小时则采用完全故障转移。
实践问题:用例场景
场景:Atlas Media 运营着一个多账户的 AWS Organization,生产环境在 us‑east‑1,辅助区域在 eu‑west‑1。他们有一个 150 TB 的本地视频资产存档,分布在北美和欧洲的艺术家需要高性能的共享存储,并能安全、低延迟地访问当前项目。
挑战:将存档迁移到 AWS,为艺术家提供高吞吐量的渲染存储,最小化冷资产的持续存储成本,并确保安全的跨区域访问和稳健的备份。
推荐方法:
- 在 us‑east‑1 中预置一个 S3 存储桶作为权威存档,启用版本控制、使用 AWS KMS 的服务器端加密 (SSE‑KMS),并配置到 eu‑west‑1 的跨区域复制 (Cross‑Region Replication),同时开启删除标记的复制。
- 使用 AWS Snowball Edge 设备将最初的 150 TB 数据导入 S3(使用存储优化型 Snowball Edge),然后运行 AWS DataSync 对任何增量变更进行同步并验证完整性。
- 对于活跃的工作集,在每个区域部署 Amazon FSx for Lustre,并将文件系统链接到 S3 存储桶(数据存储库集成),以便艺术家获得高吞吐量和低延迟,同时写入操作会同步回 S3;考虑为项目突发需求使用短期存在的 FSx 实例。
- 通过用于 S3 和 FSx 的 VPC 接口端点强制执行安全访问,使用与 Organization 主体绑定的 IAM 角色和存储桶策略限制存储桶访问,通过 CloudFront 和签名 URL 为远程审阅者提供公共分发前端,并为 FSx 启用 AWS Backup,加上 S3 跨区域复制和生命周期规则,将冷资产转换到 Glacier Deep Archive。
理由:此方法将持久、低成本的归档存储 (S3 + Glacier) 与高性能的项目存储 (链接到 S3 的 FSx Lustre) 分离开来,使用 Snowball 和 DataSync 优化初始批量数据提取和增量同步,并在平衡成本、性能和恢复目标的同时,强制执行了强大的安全性和跨区域弹性。
← 计算与 Auto Scaling · 所有领域 · 数据库与分析 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →