某公司想對 S3 資料湖中的資料執行 ML 分析。他們有兩個轉換需求:(1) 對每天在固定時間送達的 300 GB 各種格式資料執行排程的每日轉換;以及 (2) 對資料湖中數 TB 的封存資料執行一次性轉換。Amazon MWAA DAG 將協調工作流程。DAG 應該排程哪兩個任務,才能最符合成本效益地滿足這些需求?(請選擇兩項)
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 針對每日傳入資料,使用 AWS Glue crawlers 掃描並識別結構描述。, 針對每日和封存資料,使用 Amazon EMR 執行資料轉換。.
為什麼這是答案
AWS Glue crawlers 能自動掃描 S3 資料湖中的多種格式資料,識別結構描述並更新 AWS Glue Data Catalog。這對於每日固定時間送達的 300 GB 多格式資料來說,是一種成本效益高且自動化的方法,無需手動管理結構描述,符合第一個需求。Amazon EMR 是一個彈性且可擴展的巨量資料處理服務,適合處理數 TB 的封存資料進行一次性轉換,也能有效處理每日資料轉換。其按需付費模式和多種處理框架(如 Spark、Hive)使其成為處理大量批次資料的成本效益選擇,符合第二個需求。 Amazon Athena 雖然可以掃描 S3 資料,但主要用於查詢而非自動識別多格式資料的結構描述。Amazon Redshift 適用於資料倉儲,不適合直接在 S3 資料湖中進行轉換。Amazon SageMaker 主要用於機器學習模型的訓練和部署,而非大規模資料轉換。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡