某公司將 CSV 檔案上傳到 Amazon S3 儲存貯體。AWS Glue crawler 會為資料建立資料表和結構描述,而 AWS Glue job 會處理這些資料表並將結果寫入 Amazon Redshift 資料庫。該 Glue job 會處理欄位映射並視需要建立 Redshift 資料表。重新執行 Glue job 會導致 Redshift 資料表中出現重複的資料列。該公司需要一種方法來更新 Redshift 資料表,而不會引入重複的資料。哪種方法可以滿足此要求?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 修改 AWS Glue job,將資料列複製到預備 Redshift 資料表。新增 SQL 命令以使用預備 Redshift 資料表中的新值更新現有資料列。.
為什麼這是答案
正確答案是修改 AWS Glue job,將資料列複製到預備 Redshift 資料表,然後使用 SQL 命令更新現有資料列。這種方法稱為「upsert」,它能有效避免重複資料。首先將新資料載入一個臨時(預備)表,然後執行 SQL UPDATE 語句來更新 Redshift 目標表中匹配的現有記錄,最後使用 INSERT 語句將預備表中不匹配的記錄插入目標表。 其他選項不正確的原因: 將資料載入 MySQL 資料庫並執行 upsert 操作會增加不必要的複雜性和成本,且不符合在 Redshift 中直接處理的需求。 使用 Apache Spark 的 DataFrame dropDuplicates() API 只能移除重複的資料列,但無法處理現有資料的更新,這會導致資料不一致而非重複。 AWS Glue 的 ResolveChoice 轉換用於處理資料類型不一致的問題,而非解決資料更新或重複資料列的問題。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡