Amazon DEA-C01: 數據查詢與分析 — 學習指南

屬於 Amazon Data Engineer Associate DEA-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.

此領域涵蓋設計、調校與操作支援大型資料集分析查詢及商業智慧 (BI) 的 AWS 服務。其重點在於跨 Athena、Redshift、OpenSearch 和 QuickSight 的符合成本效益、高效能的查詢模式,以及它們如何與 S3、Glue 和交易型儲存互通。要精通此領域,需要在儲存格式、資料分割、運算類型和資料放置之間取得平衡,以最小化掃描的位元組數和網路偏斜,同時提供低延遲的洞見。

Amazon Athena 查詢最佳化

Athena 的定價取決於掃描的位元組數,因此實體資料佈局和中繼資料是主要的調校手段。使用欄式格式 (Parquet 或 ORC) 搭配壓縮 (Parquet 使用 Snappy,ORC 使用 Zlib/ORC 選項) 來減少資料大小和 CPU 使用量。根據高基數、會用於查詢過濾的欄位 (如日期、區域) 來分割資料,並在 Glue 資料目錄中註冊分割區。典型的模式如下:

undefined

來強制執行欄式壓縮。

當查詢需要與交易型儲存進行聯結 (join) 時,可使用 Athena Federated Query (Lambda 連接器) 來執行與 RDS、DynamoDB 或 Redshift 的跨來源聯結。連接器會部署為 Lambda 函數,並在 Athena 中註冊為資料來源;主控台操作流程範例:Athena > Data sources > Connectors > New。決策標準:

Amazon Redshift 查詢調校與分佈

Redshift 的效能關鍵在於分佈樣式 (distribution style) 和排序鍵 (sort key),它們能最小化資料移動並啟用區域對應 (zone mapping)。根據以下決策點選擇 DIST 樣式:

在用於範圍過濾器 (range filters) 或 ORDER BY 的欄位上定義 SORTKEY,以啟用區域對應並減少磁碟讀取。常見的操作指令:

undefined

undefined

;監控 SVV_TABLE_INFOSTL_QUERY 以了解偏斜和分佈指標。 Redshift Spectrum 讓您能透過 Glue 資料目錄查詢 S3 的外部資料表。使用以下指令建立外部結構描述 (external schema):

undefined

Spectrum 與原生 Redshift 的決策標準:

Amazon OpenSearch Service 用於日誌分析

OpenSearch 針對擷取和快速、臨時的日誌分析進行了最佳化;其索引和叢集組態決定了吞吐量和成本。索引設計與生命週期:

QuickSight 用於 BI 與視覺化

QuickSight 提供快速的儀表板,主要有兩種擷取模式:SPICE (記憶體內) 和直接查詢。SPICE 為儀表板提供次秒級的效能,適合重複讀取;而直接 SQL 查詢 (到 Athena、Redshift、RDS) 則較適合非常大的資料集或頻繁變動的資料。關鍵組態與最佳實務:

常見陷阱與決策標準

實務問題:使用案例情境

Acme Retail 需要每日的 BI 報告,其中結合了 Amazon RDS 中的交易訂單、S3 中的點擊流事件 (clickstream events) 以及 DynamoDB 的使用者設定檔,同時有成本限制,且儀表板對於近期資料的重新整理需在分鐘內完成。

  1. 將 S3 中的點擊流資料轉換為以日期分割的 Parquet 格式,使用 Snappy 壓縮,並透過 crawler 在 AWS Glue 中註冊中繼資料 (metadata)。
  2. 使用 Athena 對 S3 進行 ad-hoc 查詢,並部署 Federated Query 連接器以對 RDS 和 DynamoDB 執行小型維度資料表的連接;如果查詢重複執行,則將頻繁的連接結果具體化 (materialize) 為 Parquet 格式。
  3. 佈建 Redshift 以進行繁重的分析型連接:將匯總的快照載入 Redshift,在高基數的 customer_id 上設定 DISTKEY,並在 order_date 上定義 SORTKEY;使用 Spectrum 處理 S3 中的冷歷史資料。
  4. 使用每日索引模式 (daily index patterns) 將應用程式日誌擷取到 OpenSearch;應用 ILM 將近期的索引保留在熱節點 (hot nodes) 上,並將較舊的索引移至 UltraWarm 以節省成本。
  5. 建立 QuickSight 儀表板:將近期的匯總資料匯入 SPICE,並透過排程的增量重新整理來達到分鐘級的感知回應速度,並對需要永遠保持最新的指標使用直接查詢。

理由:此方法透過分割與欄式格式將 Athena 的掃描成本降至最低,藉由適當的分配與排序鍵減少 Redshift 的網路資料交換 (network shuffle),使用 Spectrum 避免在 Redshift 中儲存冷資料,應用 OpenSearch ILM 來優化儲存成本,並利用 SPICE 提供反應快速的儀表板,同時透過直接查詢保持關鍵資料的即時性。


數據編排與工作流程管理 · 所有領域 · 數據安全、治理與合規

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Amazon →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品