某公司在大型 EC2 實例上執行以 Python 腳本實作的每日 ETL 管線,用於清理、轉換、豐富和壓縮儲存在 S3 中的數 TB 使用者互動資料。此程序耗時超過 20 小時,他們希望從 EC2 遷移到託管的無伺服器解決方案,且開發工作量最少。哪種方法符合這些要求?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 建立 AWS Glue 任務,將腳本轉換為 PySpark,執行 Glue 任務來處理資料,並將結果儲存在 S3 中。.
為什麼這是答案
正確答案是建立 AWS Glue 任務,將腳本轉換為 PySpark,執行 Glue 任務來處理資料,並將結果儲存在 S3 中。AWS Glue 是一種無伺服器 ETL 服務,支援 PySpark,非常適合處理數 TB 的資料,並能將現有的 Python 腳本轉換為 PySpark,最大限度地減少開發工作量。它能自動擴展,處理大型數據集,並將結果存儲在 S3 中。 將資料載入 Amazon Redshift 並使用 SQL 執行管線不符合「最少開發工作量」的要求,因為需要將現有 Python 腳本重寫為 SQL。將資料載入 Amazon DynamoDB 並使用 Lambda 函數處理,對於數 TB 的資料來說,DynamoDB 的成本和 Lambda 的執行時間限制可能不適用。將每個腳本實作為單獨的 AWS Lambda 函數並使用 Step Functions 編排,對於大型資料集而言,Lambda 的執行時間限制和記憶體限制仍是挑戰,且可能需要大量重構。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡