arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-06 至 2026-02-06 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2602.05051 2026-02-06 cs.LG cs.AI cs.RO 78%

ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation

ReFORM:通过噪声操控实现支持下的离线强化学习

Songyuan Zhang, Oswin So, H. M. Sabbir Ahmad, Eric Yang Yu, Matthew Cleaveland, Mitchell Black, Chuchu Fan

机构 * MIT(麻省理工学院) Boston University(波士顿大学) MIT Lincoln Laboratory(麻省理工学院林伍德实验室)

专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.RO、cs.AI、cs.LG

AI总结 ReFORM通过反射流策略和噪声操控,在离线强化学习中实现更宽松的支持约束,从而在多模态分布下提升策略性能。

Comments 24 pages, 17 figures; Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14865 2026-02-06 cs.LG 70%

Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning

策略分层子空间用于持续离线强化学习

Anthony Kobanda, Rémy Portelas, Odalric-Ambrym Maillard, Ludovic Denoyer

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.LG

AI总结 HiSPO通过分层策略子空间实现持续离线强化学习,有效解决导航任务中的遗忘与可扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03493 2026-02-06 cs.LG cs.AI 62%

On Entropy Control in LLM-RL Algorithms

在LLM-RL算法中的熵控制

Han Shen

机构 * Ant Group(蚂蚁集团)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEnt方法,通过改进的熵控制策略提升LLM-RL算法在数学推理任务中的性能。

Comments Updated with ICLR 2026 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02594 2026-02-06 cs.LG cs.AI cs.SE 62%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05091 2026-02-06 cs.AI cs.LG cs.RO physics.space-ph 56%

Evaluating Robustness and Adaptability in Learning-Based Mission Planning for Active Debris Removal

评估基于学习的任务规划在主动清除任务中的鲁棒性和适应性

Agni Bandyopadhyay, Günther Waxenegger-Wilfing

机构 * Faculty of Mathematics and Computer Science, Julius-Maximilians-Universität Würzburg(数学与计算机科学学院,维尔堡大学)

专题命中 模仿学习与强化学习 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文评估了基于学习的任务规划在主动清除任务中的鲁棒性和适应性,比较了三种规划器在不同约束条件下的性能,发现领域随机化PPO在适应性上表现更优,而MCTS在处理约束变化时更稳定但计算成本高。

Comments Presented at Conference: International Conference on Space Robotics (ISPARO,2025) At: Sendai,Japan

详情

展开后加载摘要…

URL PDF HTML 收藏