장기 수익을 극대화하기 위해 자산의 매수 또는 매도 수량과 가격을 추천하는 자동화된 트레이딩 에이전트를 구축하고 있습니다. 이 에이전트는 스트리밍 트랜잭션 데이터를 기반으로 지속적으로 학습될 것입니다. 장기적인 보상 최적화를 목표로 하는 이러한 순차적 의사 결정 문제에 적합한 머신러닝 알고리즘 유형은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 강화 학습.
이것이 정답인 이유
강화 학습은 에이전트가 환경과 상호작용하며 시행착오를 통해 최적의 행동 정책을 학습하는 데 적합합니다. 이 시나리오에서 트레이딩 에이전트는 환경(시장)에서 행동(매수/매도)을 취하고, 그 결과(수익)에 따라 보상을 받으며, 장기적인 보상을 최대화하는 전략을 학습합니다. 이는 순차적 의사 결정 문제에 가장 적합한 접근 방식입니다. 지도 학습은 레이블이 지정된 데이터에서 패턴을 학습하지만, 미래의 행동을 결정하는 데 필요한 장기적인 보상 최적화에는 적합하지 않습니다. 비지도 학습은 데이터의 숨겨진 구조를 찾지만, 의사 결정을 위한 명확한 보상 신호가 없습니다. 준지도 학습은 소량의 레이블 데이터와 대량의 비레이블 데이터를 사용하지만, 본질적으로 순차적 의사 결정 문제를 해결하는 데는 한계가 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음