arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-17 至 2026-02-17 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 7 篇

2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 81%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14526 2026-02-17 cs.RO cs.AI cs.LG 75%

TWISTED-RL: Hierarchical Skilled Agents for Knot-Tying without Human Demonstrations

TWISTED-RL:无人类示范的分层技能代理用于打结

Guy Freund, Tom Jurgenson, Matan Sudry, Erez Karpas

机构 * Reichman University(雷赫曼大学) Technion – Israel Institute of Technology(技术学院——以色列理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 TWISTED-RL通过强化学习和拓扑动作实现无示范的复杂打结任务,提升泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08655 2026-02-17 cs.LG 74%

From Robotics to Sepsis Treatment: Offline RL via Geometric Pessimism

从机器人到败血症治疗:通过几何悲观性进行离线强化学习

Sarthak Wanjari

机构 * Sarthak Wanjari(独立研究者)

专题命中 模仿学习与强化学习 :robotics(title);分类 cs.LG

AI总结 Geo-IQL通过几何悲观性方法在离线强化学习中提高性能,减少计算开销,并在败血症治疗中实现更高的临床一致性

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20326 2026-02-17 cs.RO cs.AI 62%

Deep Reinforcement Learning based Autonomous Decision-Making for Cooperative UAVs: A Search and Rescue Real World Application

基于深度强化学习的自主决策合作无人机:一种搜索与救援现实应用

Thomas Hickling, Maxwell Hogan, Abdulla Tammam, Nabil Aouf

机构 * School of Science(科学学院) Technology City St George's University of London London, United Kingdom(圣乔治伦敦大学技术学院伦敦英国)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于深度强化学习的自主决策框架,用于室内搜索与救援任务,通过APF奖励和图注意力网络实现高效任务分配与导航,实现实时厘米级稳定性,取得竞赛第一名。

Comments 22 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14587 2026-02-17 cs.LG cs.AI math.OC math.ST stat.TH 62%

Decoupled Continuous-Time Reinforcement Learning via Hamiltonian Flow

通过哈密顿流实现解耦的连续时间强化学习

Minh Nguyen

机构 * Google(谷歌) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解耦的连续时间强化学习算法,通过哈密顿流更新价值函数,并利用扩散生成器学习优势率函数,实现了在连续控制任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14534 2026-02-17 cs.CV 57%

MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation

MoRL: 用于统一运动理解与生成的强化推理

Hongpeng Wang, Zeyu Zhang, Wenhao Li, Hao Tang

机构 * The University of Sydney(悉尼大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10723 2026-02-17 eess.SY cs.SY 50%

Towards Dynamic Quadrupedal Gaits: A Symmetry-Guided RL Hierarchy Enables Free Gait Transitions at Varying Speeds

迈向动态四足步态:基于对称性的强化学习层次结构实现自由步态转换于不同速度下

Jiayu Ding, Xulin Chen, Garret E. Katz, Zhenyu Gan

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升步态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏