一位資料工程師設定了 AWS Glue crawler,用於編目 S3 儲存貯體中包含 .csv 和 .json 檔案的資料。該 crawler 設定為排除 .json 檔案,但在執行 Athena 查詢時,.json 檔案仍然被處理。工程師必須在不改變 .csv 檔案存取權限的情況下解決此問題,並希望查詢時間盡可能縮短。請問最佳解決方案是什麼?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將 .json 檔案重新放置到 S3 儲存貯體中的不同路徑。.
為什麼這是答案
正確答案是將 .json 檔案重新放置到 S3 儲存貯體中的不同路徑。AWS Glue crawler 雖然設定為排除 .json 檔案,但它只負責建立資料表的結構描述。Athena 查詢是直接針對 S3 儲存貯體中的資料執行,因此即使 crawler 忽略了 .json 檔案,Athena 仍然會讀取它們。將 .json 檔案移到 crawler 掃描路徑之外的不同路徑,可以確保 Athena 在查詢時不會讀取這些檔案,同時不影響 .csv 檔案的存取,並能有效縮短查詢時間。 調整 AWS Glue crawler 設定無法解決問題,因為 crawler 僅建立中繼資料,不影響 Athena 實際讀取 S3 資料。使用 Athena console 排除 .json 檔案需要手動過濾,效率低且容易出錯,不符合縮短查詢時間的要求。使用 S3 儲存貯體政策阻止存取會影響所有使用者,且可能導致 .json 檔案完全無法被存取,不符合不改變 .csv 檔案存取權限的要求。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡