AmazonAmazon Machine Learning Specialty MLS-C01
·TW
·更新於 26 Jul 2026
一位資料科學家必須將地端 ETL 流程遷移到 AWS。目前的流程按排程執行,並使用 PySpark 合併和格式化多個大型資料來源,以產生一個整合輸出供下游任務使用。雲端解決方案的需求:合併多個來源、重複使用現有的 PySpark 程式碼、按現有排程執行,並將要管理的伺服器數量降到最低。哪種架構符合這些要求?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將原始資料儲存在 Amazon S3 中。建立以 PySpark 實作的 AWS Glue ETL 任務,以重複使用現有邏輯。設定 AWS Glue 觸發器以按目前排程執行,並讓任務將其處理後的輸出寫入 Amazon S3 中已處理的位置供下游使用。.
為什麼這是答案
此架構符合所有要求。AWS Glue 是一項無伺服器 ETL 服務,支援 PySpark,允許重複使用現有的 PySpark 程式碼,並將管理伺服器的數量降到最低。AWS Glue 觸發器可用於按現有排程執行任務。將原始資料和處理後的輸出儲存在 Amazon S3 中,提供可擴展且持久的儲存。
其他選項不符合所有要求:
使用持久性 Amazon EMR 叢集需要管理伺服器,這與將管理伺服器數量降到最低的要求相矛盾。
在 AWS Lambda 中重新實作現有的 PySpark 邏輯需要大量重寫,這與重複使用現有程式碼的要求不符。
Amazon Kinesis Data Analytics 適用於串流資料,而問題描述的是排程執行的批次 ETL 流程,且不支援直接重複使用 PySpark 程式碼。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡