某公司希望其客服聊天機器人能透過學習過去的互動和回饋來持續改進。哪種學習方法支援這種自我改進?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 獎勵客戶正面回饋的強化學習.
為什麼這是答案
強化學習 (Reinforcement Learning) 透過獎勵機制來訓練模型。在這個情境中,聊天機器人會因產生客戶滿意的回應而獲得「獎勵」,並從不滿意的回應中學習避免。這種方法讓機器人能夠透過與環境(客戶互動)的試錯來持續優化其行為策略,實現自我改進。 監督式學習 (Supervised Learning) 雖然也使用標記資料,但它主要用於從預先定義的輸入/輸出對中學習模式,而非透過即時互動和獎勵來迭代改進行為。非監督式學習 (Unsupervised Learning) 則專注於發現資料中的隱藏結構,不涉及獎勵或明確的自我改進機制。使用持續更新的常見問題資料庫進行監督式學習,雖然能提高準確性,但其改進是基於資料更新,而非機器人透過互動學習並調整其策略。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡