Multi-task Hierarchical Adversarial Inverse Reinforcement Learning
Jiayu Chen, Dipesh Tamboli, Tian Lan, Vaneet Aggarwal
摘要
Multi-task Imitation Learning (MIL) aims to train a policy capable of performing a distribution of tasks based on multi-task expert demonstrations, which is essential for general-purpose robots. Existing MIL algorithms suffer from low data efficiency and poor performance on complex long-horizontal tasks. We develop Multi-task Hierarchical Adversarial Inverse Reinforcement Learning (MH-AIRL) to learn hierarchically-structured multi-task policies, which is more beneficial for compositional tasks with long horizons and has higher expert data efficiency through identifying and transferring reusable basic skills across tasks. To realize this, MH-AIRL effectively synthesizes context-based multi-task learning, AIRL (an IL approach), and hierarchical policy learning. Further, MH-AIRL can be adopted to demonstrations without the task or skill annotations (i.e., state-action pairs only) which are more accessible in practice. Theoretical justifications are provided for each module of MH-AIRL, and evaluations on challenging multi-task settings demonstrate superior performance and transferability of the multi-task policies learned with MH-AIRL as compared to SOTA MIL baselines.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- A Unified Algorithm Framework for Unsupervised Discovery of Skills based on Determinantal Point ProcessJiayu Chen, Vaneet Aggarwal, Tian LanNeurIPS 2023 · 被引用 8 次
- Identifying Selections for Unsupervised Subtask DiscoveryYiwen Qiu, Yujia Zheng, Kun ZhangNeurIPS 2024 · 被引用 4 次
- Consistent Zero-Shot Imitation with Contrastive Goal InferenceKathryn Wantlin, Chongyi Zheng, Benjamin EysenbachICML 2026 · 被引用 1 次
- Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement LearningJunseok Kim, Dohyeong Kim, Mineui Hong, Songhwai OhICML 2026 · 被引用 1 次
- Diversifying Policy Behaviors with Extrinsic Behavioral CuriosityZhenglin Wan, Xingrui Yu, David Mark Bossens, Yueming Lyu 等ICML 2025
它引用的顶会 Paper2
相关 Paper
- Model Predictive Adversarial Imitation Learning for Planning from ObservationTyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo 等ICLR 2026 · 被引用 4 次
- Training Transition Policies via Distribution Matching for Complex TasksJu-Seung Byun, Andrew PerraultICLR 2022 · 被引用 7 次
- PEAR: Primitive Enabled Adaptive Relabeling for Boosting Hierarchical Reinforcement LearningUtsav Singh, Vinay P. NamboodiriICLR 2025
- Learning Generalizable Skills from Offline Multi-Task Data for Multi-Agent CooperationSicong Liu, Yang Shu, Chenjuan Guo, Bin YangICLR 2025
- Composing Task-Agnostic Policies with Deep Reinforcement LearningAhmed Hussain Qureshi, Jacob J. Johnson, Yuzhe Qin, Taylor Henderson 等ICLR 2020 · 被引用 35 次
