STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
Yao Luan, Ni Mu, Yiqin Yang, Bo Xu, Qing-Shan Jia
机构
*
Beijing Key Laboratory of Embodied Intelligence Systems, Department of Automation, Tsinghua University, Beijing, China(北京智能体智能系统重点实验室,自动化系,清华大学,北京,中国)
;
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院,北京,中国)
Leveraging Temporally Extended Behavior Sharing for Multi-task Reinforcement Learning
Gawon Lee, Daesol Cho, H. Jin Kim
机构
*
Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系)
;
Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所)
专题命中
模仿学习与强化学习
:robotics(abstract);分类 cs.RO、cs.LG
CommentsAccepted for publication in the proceedings of the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
Agentic DDQN-Based Scheduling for Licensed and Unlicensed Band Allocation in Sidelink Networks
Po-Heng Chou, Pin-Qi Fu, Walid Saad, Li-Chun Wang
机构
*
Department of Electronics and Electrical Engineering(电子与电气工程系)
;
Institute of Communications Engineering(通讯工程研究所)
;
National Yang Ming Chiao Tung University(阳明交通大学)
;
Research Center for Information Technology Innovation(信息技术创新研究中心)
;
Academia Sinica(台湾“中央研究院”)
;
Bradley Department of Electrical and Computer Engineering(电气与计算机工程系)
Beyond Human Demonstrations: Diffusion-Based Reinforcement Learning to Generate Data for VLA Training
Rushuai Yang, Hangxing Wei, Ran Zhang, Zhiyuan Feng, Xiaoyu Chen, Tong Li, Chuheng Zhang, Li Zhao, Jiang Bian, Xiu Su, Yi Chen
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Wuhan University(武汉大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Big Data Institute, Central South University(中南大学大数据研究院)