一個 Cloud Dataflow job 對 Pub/Sub 串流資料使用 windowing 和轉換,但在串流插入時失敗。最可能的原因是什麼?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 未應用非全域 (sharded) windowing function,導致 job 在 pipeline 建立時失敗.
為什麼這是答案
在 Cloud Dataflow 中處理 Pub/Sub 串流資料時,如果沒有明確定義 windowing function,Dataflow 預設會使用全域 (global) window。全域 window 會將所有資料視為單一無限大的 window,這對於需要處理大量串流資料的轉換操作(例如聚合或分組)來說,會導致記憶體和資源耗盡,因為 Dataflow 無法有效地將資料分區或完成處理。因此,在 pipeline 建立時就會因為無法有效管理無限大的資料集而失敗。非全域 (sharded) windowing function(例如固定時間窗口或滑動窗口)是處理串流資料的關鍵,它允許 Dataflow 將資料分割成可管理的區塊進行處理。事件時間戳記的分配和觸發器的設定是處理延遲資料和確保正確結果的重要步驟,但它們通常不會導致 pipeline 在建立時就失敗,而是在資料處理過程中影響結果的準確性或及時性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡