一家線上零售商將 ALB 存取日誌儲存在 S3 中,並使用 Amazon Athena 查詢這些日誌。工程師建立了一個未分區的 Athena 表格,但隨著資料量的增加,查詢回應時間也隨之增長。哪種方法能以最少的操作工作量來提高 Athena 查詢效能?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 建立一個 AWS Glue 爬蟲程式,使用分類器來判斷所有 ALB 存取日誌的結構描述,並將分區中繼資料寫入 AWS Glue Data Catalog。.
為什麼這是答案
正確答案是建立一個 AWS Glue 爬蟲程式,使用分類器來判斷所有 ALB 存取日誌的結構描述,並將分區中繼資料寫入 AWS Glue Data Catalog。這是因為 Glue 爬蟲程式能夠自動探索 S3 中的資料,推斷結構描述,並自動識別分區鍵,然後將這些中繼資料寫入 Glue Data Catalog。Athena 可以直接利用這些分區中繼資料來優化查詢,只掃描相關的分區,顯著減少掃描的資料量,從而提高查詢效能,且操作工作量最少。 其他選項的缺點: 建立 AWS Glue 任務來推斷結構描述並寫入分區中繼資料,雖然可行,但通常需要手動配置任務邏輯,不如爬蟲程式自動化程度高。 建立 Lambda 函數將日誌轉換為 Parquet 格式並新增分區,雖然 Parquet 格式和分區都能提高效能,但這涉及資料轉換和額外的儲存成本,且需要開發和維護 Lambda 函數,增加了操作複雜度和工作量。 使用 Apache Hive 建立分桶表並用 Lambda 轉換日誌,這是一個更複雜的解決方案,引入了 Hive 的管理負擔,且分桶通常比分區更複雜,不符合「最少操作工作量」的要求。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡