AmazonAmazon Data Engineer Associate DEA-C01 Certification
·TW
·更新於 2 Aug 2026
一家遊戲公司使用 Amazon Kinesis Data Streams 收集點擊流事件,並使用 Kinesis Data Firehose 將 JSON 檔案傳送到 Amazon S3。資料科學家在 Amazon Athena 中查詢最新的資料。該公司希望在不重建現有資料管道的情況下降低 Athena 查詢成本。哪個選項可以在滿足要求的情況下,將管理工作量降到最低?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 設定 Firehose 輸出 Apache Parquet,設定自訂的 S3 物件前綴,例如 YYYYMMDD,並設定較大的緩衝區大小。對於歷史資料,執行 AWS Glue ETL 任務將小的 JSON 檔案合併成較大的 Parquet 檔案,並帶有 YYYYMMDD 前綴,然後執行 ALTER TABLE ADD PARTITION 來更新現有的 Athena 表格。.
為什麼這是答案
正確答案透過將 Firehose 輸出格式變更為 Parquet,顯著降低 Athena 查詢成本,因為 Parquet 是柱狀儲存格式,查詢效率更高且壓縮比更好。設定自訂的 S3 物件前綴(例如 YYYYMMDD)可實現資料分區,進一步優化 Athena 查詢。較大的緩衝區大小減少了 S3 中的小檔案數量,降低了 Athena 掃描開銷。對於現有的歷史資料,使用 AWS Glue ETL 合併小檔案並轉換為 Parquet,然後更新 Athena 表格分區,能以最低的管理工作量實現成本效益。
其他選項的缺點:
建立 Spark 任務需要管理 EMR 叢集,增加了操作複雜度和成本,且需要更改 Athena 表格位置,而非增量更新。
引入 Kinesis Data Streams 和 Managed Service for Apache Flink 增加了架構複雜性和成本,不符合「最低管理工作量」的要求。
將 Lambda 附加到 Firehose 雖然可行,但 Lambda 的轉換有大小和時間限制,對於大量資料可能效率不高,且仍需額外的 Glue ETL 處理歷史資料,整體管理負擔較高。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡