QR kód

Subgoal-Based Reward Shaping to Improve Efficiency in Reinforcement Learning

Reinforcement learning, which acquires a policy maximizing long-term rewards, has been actively studied. Unfortunately, this learning type is too slow and difficult to use in practical situations because the state-action space becomes huge in real environments. Many studies have incorporated human k...

Celý popis

Uloženo v:
Podrobná bibliografie
Hlavní autoři: Takato Okudo, Seiji Yamada
Médium: Artigo
Jazyk:Inglês
Vydáno: IEEE 2021-01-01
Edice:IEEE Access
Témata:
On-line přístup:https://ieeexplore.ieee.org/document/9459751/
Tagy: Přidat tag
Žádné tagy, Buďte první, kdo vytvoří štítek k tomuto záznamu!