Amazon DEA-C01: 數據儲存與資料湖架構 — 學習指南

屬於 Amazon Data Engineer Associate DEA-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.

這個領域涵蓋了 AWS 儲存服務和資料庫引擎如何在現代資料平台中支援大規模資料擷取、持久性封存、查詢效能和安全治理。資料工程師在將 S3、Lake Formation、Redshift 和 DynamoDB 等服務整合到管線中時,必須在成本、存取延遲、持久性以及精細的存取控制之間取得平衡。了解儲存類別的權衡取捨、生命週期自動化、受管儲存與本機儲存的差異,以及分割模式,可以避免在生產環境中出現效能和成本上的意外。

Amazon S3 儲存類別與生命週期原則

S3 提供多種儲存類別和生命週期控制,以優化成本和存取模式。您可以在上傳時設定儲存類別(透過主控台或 CLI:aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING),或使用儲存貯體生命週期規則(aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json)。Intelligent-Tiering 會自動在頻繁存取和不頻繁存取層之間移動物件,並收取小額的監控費用;針對未知或變動的存取模式,建議啟用此功能。使用生命週期規則可將物件轉換到 GLACIER 或 DEEP_ARCHIVE 以進行長期保留,並使舊版本過期/刪除。

決策標準與權衡取捨:

操作注意事項:

使用 S3 和 Lake Formation 設計資料湖

將 S3 作為中央物件儲存來設計資料湖,並使用 Lake Formation 進行集中式存取控制和目錄製作。將 S3 位置註冊為 Lake Formation 資源,設定一個 AWS Glue Data Catalog,並對資料庫/資料表使用 Lake Formation 授權(aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’)。Lake Formation 可以強制執行精細控制:欄層級、列層級(篩選表達式),以及使用應用於 Glue/Athena 查詢的 LF-tags 和資料篩選器來進行儲存格層級的遮罩。

關鍵設定與治理模式:

決策要點:

Amazon Redshift 架構與儲存

Redshift 在 RA3 節點上將運算和受管儲存分離,這與使用本機 SSD 支援的 DS2 節點不同。RA3 節點使用 Redshift Managed Storage (RMS),其中資料存放在由叢集管理的 Amazon S3 上;選擇 RA3 以獲得可擴展的儲存和一致的查詢效能,並能夠分開支付運算費用。DS2 節點將資料儲存在執行個體本機磁碟上,當資料增長時需要仔細規劃大小和調整大小。

設定與操作細節:

比較 (RA3 vs DS2):

DynamoDB 與針對特定用途的資料庫選擇

若要處理需要個位數毫秒延遲的高擴展性鍵值 (key-value) 與文件 (document) 工作負載,請選擇 DynamoDB。資料表的設計取決於分割區索引鍵 (partition key)(以及可選的排序索引鍵 (sort key))的選擇:使用高基數 (high-cardinality)、分佈均勻的索引鍵以避免熱分割區 (hot partition)。對於循序或基於時間戳的索引鍵,請實作隨機前綴(分片)或使用 UUID 來分散寫入。使用隨需容量 (on-demand capacity) 以避免佈建,但對於可預測的工作負載,可考慮使用具備自動擴展功能的預置容量 (provisioned capacity),並利用適應性容量 (adaptive capacity) 處理熱分割區。

實務設定注意事項:

引擎選擇的決策標準:

常見陷阱與決策標準

實務問題:使用案例情境

Acme Media 公司必須儲存 50 TB 的原始影片擷取資料,提供分析師查詢轉換後的中繼資料,並為不同業務單位強制執行資料列層級 (row-level) 和資料欄層級 (column-level) 的存取控制,同時將儲存成本降至最低。

  1. 使用分段上傳 (multipart upload) 將原始影片擷取到 S3,依擷取日期和資料集為物件加上標籤,並對初始存取模式未知的資料使用 Intelligent-Tiering。
  2. 設定生命週期規則,在可設定的保留期後將媒體轉換至 GLACIER 或 DEEP_ARCHIVE(若考慮使用 Standard-IA,需確保符合其 30 天以上的儲存要求)。
  3. 在 Lake Formation 中註冊 S3 位置,建立 Glue 爬蟲程式 (crawler) 來填充資料目錄 (Data Catalog),並授予各業務單位基於 LF-tag 的資料列和資料欄層級權限。
  4. 將整理過的中繼資料儲存在 Redshift RA3 中以供分析;將一個 IAM 角色附加到叢集以執行從 S3 的 COPY 操作,並在維護時段使用 VACUUM/ANALYZE 操作。
  5. 使用 DynamoDB 搭配雜湊 UUID 鍵作為高吞吐量的影片資訊清單查詢表,並啟用隨需容量以吸收流量高峰。

理由:此方法透過 Glacier 等級隔離了冷儲存成本,使用 Intelligent-Tiering 處理未知的存取模式,應用 Lake Formation 在各種分析引擎間實現安全、精細的存取控制,並選擇 RA3 作為可擴展的分析儲存,同時由 DynamoDB 處理低延遲的操作查詢。


數據攝取與收集 · 所有領域 · 數據編目與中繼資料管理

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Amazon →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品