arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-09 至 2025-12-09 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2503.14259 2025-12-09 cs.LG cs.RO 62%

Quantization-Free Autoregressive Action Transformer

无量化自回归动作变压器

Ziyad Sheebaelhamd, Michael Tschannen, Michael Muehlebach, Claire Vernade

机构 * University of Tübingen(图宾根大学) Google DeepMind(谷歌DeepMind) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 无量化自回归动作变压器通过生成无限词汇变换器直接参数化连续策略,简化流程并提升在模拟机器人任务中的性能。

Journal ref 39th Conference on Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06250 2025-12-09 cs.LG 57%

Learning When to Switch: Adaptive Policy Selection via Reinforcement Learning

学习何时切换:通过强化学习实现自适应策略选择

Chris Tava

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL 50%

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06645 2025-12-09 cs.MA 50%

Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning

通过多智能体强化学习分析大规模混合交通控制中的碰撞率

Muyang Fan

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06095 2025-12-09 cond-mat.str-el 50%

Comparative Analysis of Autonomous and Systematic Control Strategies for Hole-Doped Hubbard Clusters: Reinforcement Learning versus Physics-Guided Design

自适应与系统化控制策略在掺空Hubbard簇中的比较分析:强化学习与物理引导设计

Shivanshu Dwivedi, Kalum Palandage

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文比较了自主强化学习与物理引导设计在掺空Hubbard簇中的表现,证明自主RL在优化和策略发现中具有高效性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏