arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-11 至 2026-02-11 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 3 篇

2602.10044 2026-02-11 cs.LG cs.AI cs.SY eess.SY 81%

Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning

乐观世界模型:基于模型的深度强化学习中的高效探索

Akshay Mete, Shahid Aamir Sheikh, Tzu-Hsiang Lin, Dileep Kalathil, P. R. Kumar

机构 * Department of Electrical Computer Engineering, Texas A\&M University, College Station, Texas, USA

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出乐观世界模型,通过引入乐观动态损失提升深度强化学习中的高效探索能力,显著提高样本效率和累积回报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 57%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 57%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏