Reward Translation via Reward Machine in Semi-Alignable MDPs
Yun Hua, Haosheng Chen, Wenhao Li, Bo Jin, Baoxiang Wang, Hongyuan Zha, Xiangfeng Wang
摘要
Addressing reward design complexities in deep reinforcement learning is facilitated by knowledge transfer across different domains. To this end, we define reward translation to describe the cross-domain reward transfer problem. However, current methods struggle with non-pairable and non-time-alignable incompatible MDPs. This paper presents an adaptable reward translation framework neural reward translation featuring semi-alignable MDPs, which allows efficient reward translation under relaxed constraints while handling the intricacies of incompatible MDPs. Given the inherent difficulty of directly mapping semi-alignable MDPs and transferring rewards, we introduce an indirect mapping method through reward machines, created using limited human input or LLM-based automated learning. Graph-matching techniques establish links between reward machines from distinct environments, thus enabling cross-domain reward translation within semi-alignable MDP settings. This broadens the applicability of DRL across multiple domains. Experiments substantiate our approach’s effectiveness in tasks under environments with semi-alignable MDPs.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper6
- State Alignment-based Imitation LearningFangchen Liu, Zhan Ling, Tongzhou Mu, Hao SuICLR 2020 · 被引用 103 次
- Domain Adaptive Imitation LearningKuno Kim, Yihong Gu, Jiaming Song, Shengjia Zhao 等ICML 2020 · 被引用 86 次
- Learning Invariant Representations for Reinforcement Learning without ReconstructionAmy Zhang, Rowan Thomas McAllister, Roberto Calandra, Yarin Gal 等ICLR 2021 · 被引用 77 次
- Cross-Domain Imitation Learning via Optimal TransportArnaud Fickinger, Samuel Cohen, Stuart Russell, Brandon AmosICLR 2022 · 被引用 65 次
- Cross-domain Imitation from ObservationsDripta S. Raychaudhuri, Sujoy Paul, Jeroen van Baar, Amit K. Roy-ChowdhuryICML 2021 · 被引用 54 次
相关 Paper
- Contextual Pre-planning on Reward Machine Abstractions for Enhanced Transfer in Deep Reinforcement LearningGuy Azran, Mohamad H. Danesh, Stefano V. Albrecht, Sarah KerenAAAI 2024 · 被引用 2 次
- Cross-Domain Policy Adaptation by Capturing Representation MismatchJiafei Lyu, Chenjia Bai, Jingwen Yang, Zongqing Lu 等ICML 2024 · 被引用 30 次
- Cross-Domain Policy Optimization via Bellman Consistency and Hybrid CriticsMing-Hong Chen, Kuan-Chen Pan, You-De Huang, Xi Liu 等ICLR 2026 · 被引用 1 次
- ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement LearningRoger Creus Castanyer, Faisal Mohamed, Pablo Samuel Castro, Cyrus Neary 等ICLR 2026 · 被引用 6 次
- Translating Robot Skills: Learning Unsupervised Skill Correspondences Across RobotsTanmay Shankar, Yixin Lin, Aravind Rajeswaran, Vikash Kumar 等ICML 2022 · 被引用 10 次
