arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-24 至 2026-02-24 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2511.05275 2026-02-24 cs.RO cs.LG 90%

TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models

TwinVLA: 通过双单臂视觉-语言-动作模型实现数据高效的双臂操作

Hokyun Im, Euijin Jeong, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 TwinVLA通过模块化组合预训练的单臂视觉-语言-动作模型,实现了高效双臂操作,无需额外双臂数据训练。

Comments Accepted to ICLR 2026 (Poster). Project webpage : https://jellyho.github.io/TwinVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 88%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18813 2026-02-24 cs.RO cs.LG 88%

Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

Habilis-β:一种快速运动且持续运行的设备端视觉-语言-动作模型

Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

机构 * Tommoro Robotics(Tommoro机器人公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 Habilis-β是一种快速运动且持续运行的设备端视觉-语言-动作模型,通过整合预训练和后训练方法,实现了在连续运行协议下的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19260 2026-02-24 cs.RO 70%

The Price Is Not Right: Neuro-Symbolic Methods Outperform VLAs on Structured Long-Horizon Manipulation Tasks with Significantly Lower Energy Consumption

价格并不合理:神经符号方法在结构化长周期操作任务中优于VLA,且能耗显著更低

Timothy Duggan, Pierrick Lorang, Hong Lu, Matthias Scheutz

机构 * Human-Robot Interaction Lab, Tufts University(Tufts大学人机交互实验室) AIT Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 神经符号方法在结构化长周期操作任务中表现优于VLA,且能耗更低。

Comments Accepted at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19941 2026-02-24 astro-ph.EP 50%

Probing Dust in the MWC 480 Disk from Millimeter to Centimeter Wavelengths

从毫米到厘米波长探测MWC 480盘中的尘埃

Yangfan Shi, Feng Long, Enrique Macías, Gregory J. Herczeg, Paola Pinilla, Sean M. Andrews, David J. Wilner, Haochang Jiang, Ruobing Dong, Richard Teague, Ilaria Pascucci, Claudia Toci, Yuri Aikawa, Daniel Harsono, Yao Liu

专题命中 VLA模型 :VLA(abstract)

AI总结 通过毫米至厘米波长观测,研究MWC 480盘尘埃性质,发现尘埃环结构及尘埃颗粒大小分布,揭示行星-盘相互作用特征。

Comments 29 pages, 18 figures, 4 tables. Accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19716 2026-02-24 nucl-th 50%

Investigation of the $K^{-}pp$ Bound State via the \( K^{-} + {}^{3}\mathrm{He} \) Reaction

通过 $ K^{-} + {}^{3}\mathrm{He} $ 反应研究 $ K^{-}pp $ 绑定态

Sajjad Marri, Ahmad Naderi Beni

专题命中 VLA模型 :action model(abstract)

AI总结 该研究通过低能 $ K^{-} + {}^{3}\mathrm{He} $ 反应探讨 $ K^{-}pp $ 准绑定态的形成可能性,利用四体 AGS 方程分析不同 $ \bar{K}N $ 作用模型下的中子缺失质量谱,发现 $ πΣp $ 质量谱中可能观测到该准绑定态信号。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2502.10040 2026-02-24 cs.RO 77%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2412.13877 2026-02-24 cs.RO cs.AI 73%

RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation

RoboMIND:机器人操作多躯体智能规范数据集基准

Kun Wu, Chengkai Hou, Jiaming Liu, Zhengping Che, Xiaozhu Ju, Zhuqin Yang, Meng Li, Yinuo Zhao, Zhiyuan Xu, Guang Yang, Shichao Fan, Xinhua Wang, Fei Liao, Zhen Zhao, Guangyu Li, Zhao Jin, Lecheng Wang, Jilei Mao, Ning Liu, Pei Ren, Qiang Zhang, Yaoxu Lyu, Mengzhen Liu, Jingyang He, Yulin Luo, Zeyu Gao, Chenxuan Li, Chenyang Gu, Yankai Fu, Di Wu, Xingyu Wang, Sixiang Chen, Zhenyu Wang, Pengju An, Siyuan Qian, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 RoboMIND是一个大规模多躯体机器人操作数据集,包含107万条演示轨迹和5000条失败示例,用于提升机器人模仿学习和多任务性能。

Comments 21 pages, 17 figures, Robotics: Science and Systems 2025

Journal ref Robotics: Science and Systems XXI (RSS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2602.19652 2026-02-24 eess.SP 50%

Hardware-Accelerated Geometrical Simulation of Biological and Engineered In-Air Ultrasonic Systems

硬件加速的生物与工程空气中超声系统几何模拟

Wouter Jansen, Jan Steckel

专题命中 部署与泛化 :action model(abstract)

AI总结 SonoTraceUE是一种基于Unreal Engine的高保真声学仿真框架,通过硬件加速的射线追踪和蒙特卡洛衍射模型,实现动态多材料环境中的实时声学传感模拟,用于生物声学研究和机器人闭环系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏