您正在构建一个自动化交易代理,该代理会推荐买入或卖出多少单位的资产以及以什么价格买卖,以实现长期回报最大化。该代理将根据流式交易数据持续进行训练。哪种类型的机器学习算法适用于这种需要优化长期回报的序列决策问题?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 强化学习.
为什么这是答案
强化学习 (Reinforcement Learning, RL) 适用于需要优化长期回报的序列决策问题。在自动化交易代理的场景中,代理(agent)根据环境(市场数据)采取行动(买入/卖出),并从这些行动中获得奖励(利润或亏损)。RL 算法通过不断试错和学习,找到能够最大化累积奖励(长期回报)的策略。 监督学习不适用,因为它需要带有明确标签的历史数据来预测下一个动作,但交易决策的“正确”标签是未知的,且需要考虑长期影响。无监督学习主要用于发现数据中的模式或结构,不直接解决决策优化问题。半监督学习结合了有标签和无标签数据,但同样不专注于序列决策和长期回报优化。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡