arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-02 至 2025-12-02 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 12 篇

2512.01383 2025-12-02 cs.CV 79%

PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications

PointNet4D: 一种轻量级的4D点云视频主干网络,用于机器人应用中的在线和离线感知

Yunze Liu, Zifan Wang, Peiran Wu, Jiayang Ao

机构 * Tsinghua University(清华大学) University of Bristol(布里斯托大学) The University of Melbourne(墨尔本大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.CV

AI总结 PointNet4D是一种轻量级4D点云视频主干网络,通过混合Mamba-Transformer时间融合模块和4DMAP预训练策略,提升机器人应用中的在线和离线感知性能。

Comments Accepted by WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00427 2025-12-02 cs.RO physics.optics 79%

Hardware-Software Collaborative Computing of Photonic Spiking Reinforcement Learning for Robotic Continuous Control

光子脉冲强化学习的软硬件协同计算用于机器人连续控制

Mengting Yu, Shuiying Xiang, Changjian Xie, Yonghang Chen, Haowen Zhao, Xingxing Guo, Yahui Zhang, Yanan Han, Yue Hao

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于光子脉冲RL的软硬件协同计算架构,通过硅光子芯片与电子域结合,实现机器人连续控制的高效能效和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15605 2025-12-02 cs.RO cs.CL cs.CV 79%

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

SRPO:用于视觉-语言-动作模型的自指政策优化

Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 73%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00050 2025-12-02 cs.RO cs.AI 73%

Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control

从隐式神经反馈强化学习实现人对齐的机器人控制

Suzie Kim

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出利用隐式神经反馈的强化学习框架,通过脑电图信号实现人对齐的机器人控制,实验表明其在复杂任务中表现与人工设计奖励相当。

Comments Master's thesis, Korea University, 2025. arXiv admin note: substantial text overlap with arXiv:2507.13171

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05061 2025-12-02 cs.RO 70%

Automaton Constrained Q-Learning

自动机约束的Q学习

Anastasios Manganaris, Vittorio Giammarino, Ahmed H. Qureshi

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 ACQL通过结合目标条件的值学习与自动机引导的强化学习,解决了在连续控制任务中同时满足时间有序目标和安全约束的问题。

Comments 10 main content pages, 4 main content figures, 11 appendix pages, 5 appendix figures, camera ready version submitted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00453 2025-12-02 cs.RO cs.AI cs.LG 67%

Sample-Efficient Expert Query Control in Active Imitation Learning via Conformal Prediction

通过置信预测实现高效的专家查询控制在主动模仿学习中

Arad Firouzkouhi, Omid Mirzaeedodangeh, Lars Lindemann

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Department of Information Technology and Electrical Engineering, ETH Zurich(信息科技与电气工程系,苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CRSAIL通过置信预测实现高效的专家查询控制,在主动模仿学习中减少专家查询次数,提升机器人任务的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06981 2025-12-02 cs.AI cs.LG 62%

Deep RL Needs Deep Behavior Analysis: Exploring Implicit Planning by Model-Free Agents in Open-Ended Environments

深度强化学习需要深度行为分析:通过无模型智能体在开放性环境中探索隐式规划

Riley Simmons-Edler, Ryan P. Badman, Felix Baastad Berg, Raymond Chua, John J. Vastola, Joshua Lunger, William Qian, Kanaka Rajan

机构 * Department of Neurobiology, Harvard Medical School(哈佛医学院神经生物学系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Department of Mathematics, NTNU(NTNU数学系) School of Computer Science, McGill University & Mila(麦吉尔大学计算机科学学院及Mila) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Biophysics Graduate Program, Harvard University(哈佛大学生物物理学研究生项目)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过ForageWorld环境研究DRL智能体的行为,发现无模型智能体可通过涌现动态展现规划行为,提出通用分析框架用于研究复杂智能体的学习动态。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15607 2025-12-02 cs.RO 57%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01228 2025-12-02 cs.LG 57%

On the Tension Between Optimality and Adversarial Robustness in Policy Optimization

在策略优化中最优性与对抗鲁棒性之间的张力

Haoran Li, Jiayu Lv, Congying Han, Zicheng Zhang, Anqi Li, Yan Liu, Tiande Guo, Nan Jiang

机构 * School of Mathematical Sciences University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Mathematical Sciences Nankai University(南开大学数学科学学院) School of Statistics and Data Science Nankai University(南开大学统计与数据科学学院) Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出 BARPO 框架,通过调节对手强度统一 SPO 和 ARPO,解决策略优化中最优性与对抗鲁棒性之间的张力问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01066 2025-12-02 cs.RO cs.SY eess.SY 57%

Reinforcement Learning for Gliding Projectile Guidance and Control

基于强化学习的滑翔弹体引导与控制

Joel Cahn, Antonin Thomas, Philippe Pastor

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出利用强化学习提升滑翔弹体在动态环境中的自主导航与高精度目标跟踪能力。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22969 2025-12-02 cs.AI cs.MA 57%

Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner

多智能体条件扩散模型与均场通信作为无线资源分配规划器

Kechen Meng, Sinuo Zhang, Rongpeng Li, Xiangming Meng, Yansha Deng, Chan Wang, Ming Lei, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏