Metric-Based Imitation Learning Between Two Dissimilar Anthropomorphic Robotic Arms
专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG;robotics(comments)
Comments 8 pages, 5 figures, submitted to IEEE Robotics and Automation Letters/IROS 2020
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG;robotics(comments)
Comments 8 pages, 5 figures, submitted to IEEE Robotics and Automation Letters/IROS 2020
专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.LG;robot learning(comments)
Comments Presented at the 3rd Conference on Robot Learning (CoRL 2019), Osaka, Japan. Video: https://youtu.be/eUqQDLQXb7I
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG;robotics(comments)
Comments This is a preprint. This paper has been accepted to the fourth Iberian Robotics Conference (Robot 2019)
专题命中 模仿学习与强化学习 :embodied agent(title,comments);robotic(abstract);分类 cs.RO、cs.AI
Comments 4 pages, 2 figures, Accepted at the 2017 AAAI Spring Symposium on Interactive Multi-Sensory Object Perception for Embodied Agents
TPRU: 推动大型多模态模型中的时序与过程理解
机构 * East China Normal University(东华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)
AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。
Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU
专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Code and robot videos are available on https://rot-robot.github.io/
专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments ICML 2021. Website: https://linxifan.github.io/secant-site/
专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Videos available at https://sites.google.com/view/few-shot-goals
机构 * Toyota Research Institute (TRI)(丰田研究院) ; Woven by Toyota (WbyT)(丰田编织(WbyT))
专题命中 模仿学习与强化学习 :manipulation(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Accepted by Robotics: Science and Systems 2025
专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 30 pages, Conference of Robot Learning (CoRL) 2021
专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 4th Conference on Robot Learning (CoRL), 2020
HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Nankai University(南开大学)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。
Comments Project page: https://grange007.github.io/HAF
基于近体学奖励建模的深度强化学习中符合社会规范的导航研究
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 该研究针对DRL社会导航中社会合规目标不足的问题,提出基于近体学的奖励建模方法,经模拟验证可提升社会指标且保持导航性能。
基于稀疏离线到在线强化学习从SMPC演示中学习移动操作
机构 * RAI Institute(RAI研究所) ; Technical University of Munich(慕尼黑工业大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。
RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。
WorldCycle:用于长时序视频世界模型的自验证强化学习
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。
世界模型记忆,智能体遗忘:基于持续模型的强化学习中的梦境排练
机构 * Quantegra Research(Quantegra研究公司)
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究 DreamerV3 家族智能体在任务序列训练时的遗忘问题,通过组件级探测发现是通道问题,提出分级梦境排练方法,能产生无任务标签、参数恒定的持续学习者,在多任务链保留上表现优异。
Comments 11 pages, 2 figures. Code, pre-registration trail, and run data: https://github.com/gurpnijjer/dream-rehearsal
掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型
机构 * Patronus AI(守护神人工智能公司)
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。
Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling
反馈操纵正则化:实现用于模仿学习的离线智能体对齐
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI、cs.LG
AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。
一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; JD Explore Academy(京东探索研究院)
专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI
AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。
强化学习实现模拟毛细血管中自主微机器人导航与干预
机构 * Institute for Computational Physics, University of Stuttgart(斯图加特大学计算物理研究所)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 开发基于物理的毛细血管网络仿真,利用深度强化学习训练微机器人通过趋化性导航,发现多种通用策略并实现靶向血流阻塞与恢复。
Comments 12 pages, 4 figures
RARM:基于置信度门控的进展奖励建模用于操作中的强化学习
机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) ; University of Cambridge(剑桥大学) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。
面向社交导航的真实世界学习的增量残差强化学习
机构 * School of Engineering, Kyushu University(九州大学工学系) ; Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系) ; School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工学系)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI
AI总结 提出增量残差强化学习(IRRL),结合增量学习与残差强化学习,在无回放缓冲区的情况下实现与基于回放缓冲区方法相当的性能,并通过真实世界实验验证机器人适应新环境的能力。
Comments RO-MAN 2026, video https://youtu.be/NJOhv56CrPM
环境扩散策略:从次优数据中进行机器人模仿学习
机构 * MIT(麻省理工学院)
专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.AI
AI总结 提出环境扩散策略,通过噪声依赖的数据使用从次优数据中提取有用特征,在六项任务上优于现有方法,最高提升33%。
Comments 14 pages (main body), 52 pages total. Project website: https://ambient-diffusion-policy.github.io/
面向视觉条件的无人机导航的自优化智能体强化学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI
AI总结 提出AgenticRL框架,利用多模态GPT智能体自动设计奖励函数、通过闭环自改进优化策略,在多种无人机导航任务中提升性能并实现高成功率。
通过通信世界模型进行上下文强化学习
机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) ; Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) ; IBM Research(IBM研究院)
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出CORAL框架,通过将潜在表示学习与控制分离,利用信息代理预训练世界模型并生成通信消息,使控制代理实现零样本适应和样本效率提升。
利用场景图扩展机器人模仿学习的时空上下文
机构 * University of Pennsylvania(宾夕法尼亚大学) ; RAI Institute(RAI研究院) ; University of Michigan(密歇根大学)
专题命中 模仿学习与强化学习 :robotic(title);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。
BaRC:机器人强化学习中的逆向可达性课程
机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) ; School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学学院)
专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG
AI总结 本文提出BaRC方法,利用物理先验知识设计课程方案,通过逆向可达性策略加速连续控制MDP中模型无关RL算法的训练,提升性能并减少探索需求。
高斯过程在机器人和控制中的数据高效学习
专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.LG
AI总结 本文提出基于高斯过程的非参数转移模型,通过提取更多数据信息加速学习,减少模型误差影响,实现高效自主学习。
Comments 20 pages, 29 figures; fixed a typo in equation on page 8
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, issue no 2, pages 408-423, February 2015
基于Transformer世界模型的行为不变任务表示学习用于离线元强化学习
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出一种结合信息论任务表示学习与Transformer随机世界模型的框架,通过提取行为不变的任务变量和保守值惩罚,解决离线元强化学习中的分布偏移和稀疏奖励问题,实现鲁棒泛化。
Comments ICML2026