Budujesz zautomatyzowanego agenta handlowego, który rekomenduje, ile jednostek aktywów kupić lub sprzedać i po jakiej cenie, aby zmaksymalizować długoterminowe zyski. Agent będzie stale trenowany na strumieniowych danych transakcyjnych. Jaki typ algorytmu uczenia maszynowego jest odpowiedni dla tego problemu sekwencyjnego podejmowania decyzji z optymalizacją nagrody długoterminowej?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uczenie ze wzmocnieniem.
Dlaczego to jest odpowiedź
Uczenie ze wzmocnieniem (Reinforcement Learning - RL) jest najodpowiedniejsze, ponieważ problem polega na sekwencyjnym podejmowaniu decyzji (kupno/sprzedaż aktywów) w celu maksymalizacji długoterminowej nagrody (zysków). Agent RL uczy się poprzez interakcję ze środowiskiem, otrzymując nagrody lub kary za swoje działania, co pozwala mu optymalizować strategię w czasie. Uczenie nadzorowane wymaga etykietowanych danych wejściowych i wyjściowych, co nie pasuje do dynamicznego środowiska handlowego, gdzie nagroda jest odroczona. Uczenie nienadzorowane skupia się na znajdowaniu wzorców w danych bez etykiet, a uczenie częściowo nadzorowane łączy oba podejścia, ale żadne z nich nie jest zaprojektowane do optymalizacji sekwencyjnych decyzji z odroczoną nagrodą.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana