某公司每天從 SAP HANA、SQL Server、MongoDB、Kafka 和 DynamoDB 等來源提取約 1 TB 的資料。其中一些來源的結構描述未定義或不斷演變。該解決方案必須在資料建立後的 15 分鐘內偵測結構描述、執行 ETL,並將資料載入 S3。哪種方法能以最少的營運負擔提供所需的功能?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 AWS Glue 偵測結構描述並將資料提取、轉換和載入 S3 儲存貯體。在 Apache Spark 中建立管線。.
為什麼這是答案
AWS Glue 是無伺服器 ETL 服務,能自動偵測資料來源的結構描述,並支援多種資料來源,包括非結構化或半結構化資料。它提供 AWS Glue Data Catalog 儲存中繼資料,並可使用 Apache Spark 建立 ETL 管線,將資料轉換並載入 S3,完全符合在 15 分鐘內處理 1 TB 資料並支援不斷演變結構描述的需求,且營運負擔最低。 Amazon EMR 雖然也能處理大量資料並使用 Spark,但它需要管理叢集,營運負擔較高。在 AWS Lambda 中執行 PySpark 程式不適合處理 1 TB 的資料量和複雜的 ETL 邏輯,因為 Lambda 有執行時間和記憶體限制。Amazon Redshift 主要用於資料倉儲,其預存程序不適合用於偵測多種來源的結構描述,且將所有資料載入 Redshift Spectrum 再從 S3 存取,會增加不必要的複雜性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡