arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-30 至 2025-12-30 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 7 篇

2512.23703 2025-12-30 cs.RO 88%

Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation

Robo-Dopamine:高精度机器人操作的通用过程奖励建模

Huajie Tan, Sixiang Chen, Yijie Xu, Zixiao Wang, Yuheng Ji, Cheng Chi, Yaoxu Lyu, Zhongxia Zhao, Xiansheng Chen, Peterson Co, Shaoxuan Xie, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title);robotics(abstract);分类 cs.RO

AI总结 Robo-Dopamine通过多视角奖励融合和分步奖励离散化,提出了一种通用过程奖励模型,提升机器人操作的精准度和策略学习效率。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12548 2025-12-30 cs.AI cs.LG 81%

World Models Unlock Optimal Foraging Strategies in Reinforcement Learning Agents

世界模型解锁强化学习智能体的最优觅食策略

Yesid Fonseca, Manuel S. Ríos, Nicanor Quijano, Luis F. Giraldo

机构 * Center of Excellence in Analytics, Artificial Intelligence, and Information Governance, Bancolombia, Colombia(分析、人工智能和信息治理卓越中心,Bancolombia,哥伦比亚) Department of Biomedical Engineering, Universidad de los Andes, Bogotá, Colombia(生物医学工程系, Universidad de los Andes,波哥大,哥伦比亚) Department of Electrical and Electronics Engineering, Universidad de los Andes, Bogotá, Colombia(电气与电子工程系, Universidad de los Andes,波哥大,哥伦比亚)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 世界模型帮助强化学习智能体实现最优觅食策略,通过预见能力而非单纯奖励最大化驱动高效决策。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22824 2025-12-30 cs.LG 77%

TEACH: Temporal Variance-Driven Curriculum for Reinforcement Learning

TEACH: 基于时间方差的强化学习课程学习

Gaurav Chaudhary, Laxmidhar Behera

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.LG

AI总结 TEACH提出基于时间方差的课程学习方法,通过动态优先选择高不确定性目标,提升多目标强化学习的样本效率和策略学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22860 2025-12-30 cs.CR cs.LG cs.MA 57%

Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks

区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击

Soham Padia, Dhananjay Vaidya, Ramchandra Mangrulkar

机构 * Artificial Intelligence Northeastern University(人工智能东北大学) Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。

Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 57%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18850 2025-12-30 cs.RO 57%

InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement

InDRiVE: 通过潜在分歧进行无奖励世界模型预训练以实现自动驾驶

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学-迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 InDRiVE通过潜在分歧进行无奖励世界模型预训练,提升了自动驾驶在零样本迁移和少量样本适应中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 57%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏