某公司即時傳輸 CSV 記錄,並希望將其以 Apache Parquet 格式儲存在 Amazon S3 上。哪種方案所需的開發工作量最少,可以在將傳入的 CSV 資料儲存到 S3 之前,將其轉換為 Parquet 格式?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 Amazon Kinesis Data Streams 和 Amazon Kinesis Data Firehose 將傳入的 CSV 轉換為 Parquet。.
為什麼這是答案
正確答案是使用 Amazon Kinesis Data Streams 和 Amazon Kinesis Data Firehose 將傳入的 CSV 轉換為 Parquet。Kinesis Data Firehose 支援直接從 Kinesis Data Streams 接收資料,並在將資料傳送到 S3 之前,自動將其轉換為 Apache Parquet 或 Apache ORC 等格式,這大大減少了開發工作量。 其他選項需要更多的開發和管理工作: 在 EC2 上設定 Apache Kafka Streams 和 Kafka Connect S3 需要管理 EC2 實例和 Kafka 叢集,增加了營運複雜性。 使用 AWS Glue 轉換資料雖然可行,但通常用於批次處理,而非即時轉換,且需要編寫 Glue ETL 腳本。 在 EMR 叢集上使用 Apache Spark Structured Streaming 擷取和轉換資料,雖然功能強大,但建立和管理 EMR 叢集會增加額外的工作量和成本。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡