某公司每天在固定時間執行 AWS Glue ETL 任務,以處理儲存在 Amazon S3 儲存貯體中的 XML 資料。新的資料每天都會新增到 S3 儲存貯體中。一位解決方案架構師注意到 AWS Glue 每次執行時都會重新處理所有資料。解決方案架構師應該怎麼做才能防止 AWS Glue 重新處理舊資料?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 編輯任務以使用 job bookmarks。.
為什麼這是答案
AWS Glue Job Bookmarks 追蹤先前處理的資料,確保每次執行任務時只處理新的或變更的資料,從而防止重新處理舊資料。這能顯著提高效率並降低成本。 編輯任務以在資料處理後刪除資料會導致資料遺失,不適用於需要保留歷史資料的場景。透過將 NumberOfWorkers 欄位設定為 1 會限制任務的平行處理能力,但不會解決重新處理舊資料的問題。使用 FindMatches 機器學習 (ML) 轉換是用於識別重複或不匹配記錄的工具,與防止重新處理資料無關。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡