您正在建構一個自動交易代理程式,它會推薦買賣資產的單位數量和價格,以最大化長期報酬。該代理程式將持續使用串流交易資料進行訓練。哪種類型的機器學習演算法適用於這種具有長期報酬最佳化的序列決策問題?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 強化學習.
為什麼這是答案
強化學習 (Reinforcement Learning, RL) 最適合此情境,因為它涉及代理程式透過與環境互動來學習最佳決策策略,以最大化長期累積獎勵。自動交易代理程式需要根據串流資料連續做出買賣決策,並以最大化長期報酬為目標,這與強化學習的序列決策和獎勵最大化框架完全吻合。 監督式學習不適用,因為它需要帶有正確答案的標記資料,而交易決策的「正確答案」在事前是未知的,且目標是長期報酬而非單一預測。非監督式學習主要用於發現資料中的模式或結構,而非做出序列決策以最大化獎勵。半監督式學習結合了少量標記資料和大量未標記資料,但仍不適用於這種需要透過試錯來學習最佳策略的動態決策問題。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡