某公司使用 Amazon S3 作為資料湖,並使用多節點 Amazon Redshift 叢集作為資料倉儲。資料湖中的資料檔案依來源組織,公司目前針對每個檔案位置發出單獨的 COPY 命令,以載入到單一 Redshift 表格中,但速度很慢。公司需要在不增加成本的情況下加快資料擷取速度。他們應該怎麼做?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 建立一個包含資料檔案位置的 manifest 檔案。使用 COPY 命令將資料載入到 Amazon Redshift。.
為什麼這是答案
正確答案是建立一個包含資料檔案位置的 manifest 檔案,然後使用 COPY 命令將資料載入到 Amazon Redshift。Redshift 的 COPY 命令支援使用 manifest 檔案,該檔案列出了要載入的所有 S3 物件。這允許 Redshift 一次性載入多個檔案,並能利用其平行處理能力,顯著加快資料擷取速度,而無需額外成本。 其他選項的解釋: 使用預置型 Amazon EMR 叢集將所有資料檔案複製到一個資料夾中:這會增加額外成本,且將所有檔案合併到一個資料夾中並不能解決單獨 COPY 命令效率低下的問題。 將所有資料檔案平行載入到 Amazon Aurora:Aurora 是關聯式資料庫服務,不是資料倉儲,且此方案引入了額外的資料庫和 AWS Glue 任務,增加了複雜性和成本。 使用 AWS Glue 任務將所有資料檔案複製到一個資料夾中:雖然 AWS Glue 可以處理資料,但將所有檔案合併到一個資料夾中並不能最佳化 Redshift 的 COPY 命令,且會增加額外的處理步驟和成本。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡