arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-22 至 2025-12-22 共收录 1 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 1 篇

2512.15692 2025-12-22 cs.RO cs.AI cs.CV cs.LG 56%

mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs

mimic-video: 用于超越VLAs的通用机器人控制的视频-动作模型

Jonas Pai, Liam Achenbach, Victoriano Montesinos, Benedek Forrai, Oier Mees, Elvis Nava

机构 * mimic robotics Microsoft Zurich(微软瑞士分公司) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) UC Berkeley(伯克利大学)

专题命中 具身与机器人 :分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)

AI总结 mimic-video通过结合预训练的视频模型和基于流匹配的动作解码器,实现了更有效的机器人控制,提升了样本效率和收敛速度。

Comments Revised Introduction, Related Work, and Appendix. Additional minor notational and grammatical fixes

详情

展开后加载摘要…

URL PDF HTML 收藏