Hierarchical Reinforcement Learning for Multiple Reward Functions

  • Uchibe E
  • Doya K
N/ACitations
Citations of this article
5Readers
Mendeley users who have this article in their library.

Abstract

In reinforcement learning, it takes long time to learn purposive behaviors due to the nature of delayed reward. Multiple reward functions are often introduced in order to accelerate the learning speed of obtaining complicated behaviors. However, the methods of the weighted sum of reward functions often cause the undesirable side effects because the objective functions are different from the original one. In this paper, we propose a novel hierarchical rein forcement learning method for utilizing multiple reward functions. The value function of the upper layer is estimated using the reward for accomplishing the entire task and the supplementary reward calculated from the value functions of the lower layers. The proposed method was applied to a simplified arm movement problems, and outperformed conventional methods. 1.‚Í ‚ ¶ ‚ß ‚É ƒ• ƒ{ ƒb ƒg‚É•s "®‚ðŠl "¾‚³ ‚¹ ‚é Žè-@‚AE‚µ‚Ä‹-‰» Šw•K‚ª ‚ ‚é.‹-‰» Šw•K ‚AE‚Í,ŽŽ •s •ö OEë‚ð'Ê ‚µ‚Ċ‹« ‚É"K‰ž ‚· ‚é Šw•K• § OEä‚̘gOEä‚̘g 'g ‚Å‚ ‚è,•ó 'Ô‚É'Î ‚· ‚镳 ‰ð •s "®‚ð-¾Ž¦ "I ‚É-^ ‚¦ ‚鋳 Žt ‚ð •K-v ‚AE ‚µ‚È‚¢.‚» ‚Ì ‚©‚í ‚è‚É•ñ •V ‚AE OEÄ ‚Î ‚ê ‚é ƒXƒJ ƒ‰ •[ ‚Ì •] ‰¿ 'l ‚ð-^‚¦ ‚é ‚± ‚AE‚Å-Ú"I ‚Ì •s "®‚ðŠl "¾‚· ‚é ‚± ‚AE ‚ª ‚Å ‚«,ƒ• ƒ{ ƒb ƒg‚Ö‚Ì-l•X ‚ȉž-p-á[1][9][14][18]‚ª •ñ •• ‚³ ‚ê ‚Ä‚¢ ‚é.‚½ ‚¾ ‚µ,-Ú •W‚É"ž 'B ‚· ‚é ‚Ü‚Å‚É"ñ •í ‚É'· ‚¢ •s "®‚Ì OEn-ñ ‚ð•K-v‚AE ‚· ‚é ‚ae ‚¤ ‚È'å ‹K-Í ‚Å •¡ ŽG‚È-â'è ‚É‹-‰» Šw•K ‚ð"K-p ‚· ‚é ‚AE,•ñ •V‚Ì 'x ‚ê ‚ª "ñ•í ‚É-â'è ‚É‚È ‚è,"K •؂ȕs "®‚ðŠl "¾‚· ‚é ‚½‚ß ‚É•K-v‚ÈŠw•KŽžŠÔ‚ª ‹} OEƒ‚É '• ‰Á ‚µ‚Ä ‚µ‚Ü‚¤ ‚AE ‚¢ ‚¤-â'è ‚ª ‚ ‚é.-á ‚¦ ‚Î ƒ• ƒ{ ƒb ƒgƒTƒbƒJ•[[18] ‚Ì •ê • ‡,ƒQ •[ ƒ€ ‚É•Ÿ ‚Á‚½‚AE‚« ‚É•³ ‚Ì •ñ •V‚ð-^ ‚¦ ‚é ‚¾‚¯ ‚Å"K•Ø‚È •s "®‚ðŠl "¾‚Å‚« ‚ê ‚Î-] ‚Ü‚µ‚¢ ‚ª,OE» ŽÀ"I ‚É‚Í "ñ•í ‚É•¢ "ï ‚Å‚ ‚é. ‚± ‚ê ‚É'Î ‚µ,-Ú •W‚AE‚· ‚é"Á'è ‚Ì •s "®‚É•Ú‹ß ‚Å‚« ‚é ‚ae ‚¤ ‚É•s "® ‚Ì-v 'f ‚ð 'I 'ð "I ‚É‹-‰»‚µ,•Å •I "I ‚É‹• ‚ß ‚Ä‚¢ ‚é •s "®‚Ì OE`•¬ ‚ð 'B •¬‚· ‚é•û-@ ‚ª ‚ ‚é.‚± ‚ê ‚Í ƒVƒF•[ ƒr ƒ"ƒO‚AE OEÄ ‚Î ‚ê ‚é •s "®-Ã-@‚Ì Žè-@‚̈ê@‚Ìˆê ‚Â‚Å,•s "®-Ã-@‚â ‹³ˆç‹³ˆç ‚É‚¨‚¯‚É‚¨‚¯ ‚é ƒv ƒ• ƒOƒ‰ ƒ€Šw•K ‚AE‚µ‚Ä-ð-§ ‚Ä ‚ç‚ê ‚Ä‚¨‚è‚Ä‚¨‚è,ƒ• ƒ{ ƒb ƒgŠw•K ‚É ‚à ‚± ‚Ì •l ‚¦ ‚ª ‚¢ ‚-‚‚©‰ž-p ‚³ ‚ê ‚Ä‚¢ ‚é.Asada‚ç[1]‚ÍˆÚ ‚͈Ú"®ƒ• ƒ{ ƒb ƒg‚Ƀ{•[ ƒ‹ ‚ð ƒS•[ ƒ‹ ‚É ƒVƒ… •[ ƒg‚³ ‚¹ ‚é ƒ^ƒXƒN‚É‚¨‚¢ƒ^ƒXƒN‚É‚¨‚¢ ‚Ä,ƒ• ƒ{ ƒb ƒg‚AEƒ{•[ ƒ‹,ƒS •[ ƒ‹ ‚Ì "z 'u ‚𠂤 ‚Ü‚-ƒXƒPƒW ƒ… •[ ƒŠƒ"ƒO‚µ‚ÄŠw•K‚ª •‚ '¬ ‰» ‚Å‚« ‚é ‚± ‚AE‚𠎦 ‚µ‚½.‚Ü ‚½,•¬-" ‚ç[11]‚͈â‚͈â "` "I ƒAƒ‹ ƒSƒŠƒYƒ€ ‚ð-p ‚¢ ‚ÄŽ© "] ŽÔ‚ð‰^ "] ‚· ‚é ƒRƒ" ƒgƒ• •[ ƒ‰ ‚ðŠl "¾‚· ‚é •Û,•‰ Šú•¢ 'ã ‚É‚¨‚¢‚É‚¨‚¢ ‚Ä‚Í Ž© "] ŽÔ‚É•‰ '¬ ‚ð-^ ‚¦ ‚é ‚± ‚AE‚É ‚ae‚Á‚ăVƒXƒeƒ€‚̈À‚ae‚Á‚ăVƒXƒeƒ€‚̈À'è •« ‚ð'• ‚· ‚± ‚AE‚É ‚ae ‚è‰ð ‚ª ‹• ‚ß ‚â ‚· ‚-‚È ‚é ‚± ‚AE‚ðŽ¦ ‚µ ‚½.‚± ‚ê ‚ç ‚Ì OE¤ ‹ † ‚Å‚Í ŠÂ‹« ‚Ì ƒ_ƒCƒi ƒ~ƒNƒX‚𠂤 ‚Ü‚-• § OEä‚· ‚é ‚± ‚AE‚É ‚ae‚Á‚Ä•¡ ŽG‚È•s "® ‚Ì Šw•K ‚ð‰Â "\ ‚É ‚µ‚Ä‚¢ ‚é.•d-v ‚È ƒAƒv ƒ• •[ ƒ` ‚̈ê‚Ìˆê ‚Â‚Å‚Í ‚ ‚é ‚ª,-â'è ‚² ‚AE‚É•Ý'è ‚ð•l-¶ ‚· ‚é•K-v ‚ª ‚ ‚é. •Ê‚Ì ƒAƒv ƒ••[ ƒ` ‚AE‚µ‚Ä,•¡ •" ‚Ì •ñ •VŠÖ•" ‚ð'g ‚Ý• ‡ ‚í ‚¹ ‚Ä•V ‚µ‚¢ •ñ •VŠÖ•" ‚ð•\ •¬ ‚· ‚é•û-@[8H18]‚ª •l ‚¦ ‚ç ‚ê ‚é.‚± ‚ê ‚Í,ƒV ƒ… •[ ƒg•s "® •E ƒp ƒX•s "® •E •Õ"ˉñ "ð•s "®‚È ‚Ç•" •ª ‰Û 'è ‚ð 'B •¬‚· ‚é ‚± ‚AE ‚ɕ⠕• "I ‚È•ñ •V ‚𠃕 ƒ{ ƒb ƒg‚É-^‚¦ ‚ÄŠw•K‚ð'£ •i ‚³ ‚¹ ‚é ‚± ‚AE‚É'Î ‰ž ‚· ‚é.‚µ ‚© ‚µ,•¡ •" ‚Ì •" •ª ‰Û 'è ‚É'Î ‚· ‚é•ñ •VŠÖ•" ‚ð 'P •ƒ ‚É'« ‚µ• ‡ ‚í ‚¹ ‚½‚à ‚Ì ‚ð-p ‚¢ ‚ÄŠw•K ‚µ‚½•ê • ‡,•K ‚¸‚µ‚¸‚µ ‚à-{-ˆ‚Ì •ñ •VŠÖ •" ‚ð•Å'å ‰» ‚· ‚é ‚± ‚AE‚É‚Í ‚È ‚ç ‚¸,Šl "¾‚³ ‚ê ‚é•s "®‚ªˆÓ®‚ªˆÓ•} ‚µ‚È ‚¢ ‚à‚Ì ‚É‚È ‚é ‰Â "\ •« ‚ª ‚ ‚é. ‚» ‚± ‚Å-{˜_ • ¶ ‚Å‚Í •Å•I "I ‚È-Ú•W‚͈êW‚Íˆê ‚Â‚Å‚ ‚é ‚ª,‚» ‚ê ‚ðŽÀOE» ‚· ‚é ‚½‚ß ‚Ì •" •ª-â'è ‚É'Î ‚· ‚é•ñ •V‚ª-^ ‚¦ ‚ç ‚ê ‚é •ê • ‡ ‚É,•â •• "I ‚È•ñ •V ‚ð-p ‚¢ ‚ÄŠw•K ‚µ ‚½OE‹‰Ê ‚ð •Å•I "I ‚È-Ú •W‚É'Î ‚· ‚é •ñ •V‚Ì •Å 'å ‰»‚AE •®• ‡ •« ‚ðŽ• ‚½‚¹ ‚éOE`‚Å-˜-p ‚· ‚éŽè-@‚ð'ñ ˆÄ‚· ‚é.Šw •KŽÒ ‚Í •¡ •" ‚Ì Šw•Kƒ‚ ƒW ƒ… •[ ƒ‹ ‚ð Ž• ‚¿,‚» ‚ê ‚ç‚Í ŠK'w•\ '¢ ‚ð OE`•¬ ‚µ‚Ä ‚¢ ‚é.‚Ü ‚½,Še Šw•Kƒ‚ ƒW ƒ… •[ ƒ‹ ‚É‚Í OE •Ê ‚É•ó 'Ô•Ï •",•s "®•Ï •", •ñ •VŠÖ•" ‚ª-^ ‚¦ ‚ç‚ê ‚Ä‚¢ ‚é.‰ºˆÊ‰ºˆÊ ‚Ì ƒ‚ ƒW ƒ… •[ ƒ‹ ‚Í Šî-{ "I ‚È•s "® ‚Ì Šw•K ‚ð'S "-‚µ,•Å •ã ˆÊ ‚Ì ƒ‚ ƒW ƒ… •[ ƒ‹ ‚Í •^ ‚É'B •¬ ‚µ ‚½‚¢ •s "®‚ð Šw•K‚· ‚é.‰ºˆÊ‰ºˆÊ ‚Ì ƒ‚ ƒW ƒ… •[ ƒ‹ ‚Í 'P •ƒ ‚È ƒ^ƒXƒN‚Å‚ ‚é ‚½‚ß,'f '• ‚-Šw•K‚· ‚é ‚± ‚AE‚ª ‚Å ‚« ‚é.‚± ‚Ì ‰ºˆÊ‰ºˆÊ ‚Ì ƒ‚ ƒW ƒ… •[ ƒ‹ ‚Å•" 'è ‚³ ‚ê ‚½ ‰¿ 'l ŠÖ•" ‚ð •ã ˆÊ ‚Ì ‰¿ 'l ŠÖ•" ‚ðŠw•K‚· ‚é ‚½‚ß ‚Ì Šî 'ê ŠÖ•" ‚AE‚µ‚Ä-p ‚¢ ‚é.•ã ˆÊ ‚Ì ƒ‚ ƒW ƒ… •[ ƒ‹ ‚Å‚Í ‰ºˆÊ‚Ì Še‰¿ 'l ŠÖ•" ‚Ö‚Ì •d ‚Ý‚AE,‚» OE´•OE´•eŽó•t2002"N11OEŽ5"ú-¦1ATR"] •î •ñOE¤ ‹ †•ŠOEv ŽZ •_OEo • ¶•¨ Šw OE¤ ‹ †Žº *2‰È Šw ‹Z•p•U‹»Ž-‹AE'cCREST

Cite

CITATION STYLE

APA

Uchibe, E., & Doya, K. (2004). Hierarchical Reinforcement Learning for Multiple Reward Functions. Journal of the Robotics Society of Japan, 22(1), 120–129. https://doi.org/10.7210/jrsj.22.120

Register to see more suggestions

Mendeley helps you to discover research relevant for your work.

Already have an account?

Save time finding and organizing research with Mendeley

Sign up for free