arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-17 至 2026-02-17 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2602.13329 2026-02-17 cs.CV cs.AI cs.RO 91%

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

HiST-VLA:一种用于端到端自动驾驶的分层时空视觉-语言-动作模型

Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

机构 * Bosch Corporate Research(博世企业研究) School of Communication and Information Engineering(信息工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 HiST-VLA通过分层时空视觉-语言-动作模型提升自动驾驶轨迹生成的精度与效率,实现端到端的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV 91%

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 88%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14577 2026-02-17 cs.CV 83%

DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving

DriveFine: 通过细化增强的掩码扩散VLA实现精确且鲁棒的驾驶

Chenxu Dang, Sining Ang, Yongkang Li, Haochen Tian, Jie Wang, Guang Li, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 DriveFine提出一种结合灵活解码与自我纠正能力的掩码扩散VLA模型,通过插件式块MoE和混合强化学习策略提升自动驾驶规划的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12063 2026-02-17 cs.RO 83%

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10556 2026-02-17 cs.RO cs.AI 80%

LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer

LAP:语言-动作预训练实现零样本跨躯体迁移

Lihan Zha, Asher J. Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z. Ren, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(abstract,comments);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。

Comments Project website: https://lap-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 76%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(title);分类 cs.RO、cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13444 2026-02-17 cs.RO cs.AI cs.CV 75%

FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation

FlowHOI: 基于流的语义引导的双手-物体交互生成用于灵巧机器人操作

Huajian Zeng, Lingyun Chen, Jiaqi Yang, Yuantai Zhang, Fan Shi, Peidong Liu, Xingxing Zuo

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·扎耶德人工智能大学) Technical University of Munich(慕尼黑技术大学) National University of Singapore(新加坡国立大学) Westlake University(西湖大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 FlowHOI通过语义引导的流匹配框架生成双手-物体交互序列,提升机器人操作的准确性和效率。

Comments Project Page: https://huajian-zeng.github.io/projects/flowhoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 70%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15011 2026-02-17 cs.HC 50%

TouchFusion: Multimodal Wristband Sensing for Ubiquitous Touch Interactions

TouchFusion: 多模态腕带传感用于无处不在的触控交互

Eric Whitmire, Evan Strasnick, Roger Boldu, Raj Sodhi, Nathan Godwin, Shiu Ng, Andre Levi, Amy Karlson, Ran Tan, Josef Faller, Emrah Adamey, Hanchuan Li, Wolf Kienzle, Hrvoje Benko

专题命中 VLA模型 :action model(abstract)

AI总结 TouchFusion通过多模态腕带传感实现无处不在的触控交互,结合多种传感器技术,支持环境和身体表面的触控检测与上下文自适应界面控制。

Comments 23 pages, 22 figures, accompanying video available at https://youtu.be/0fdCwHu7uaA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13360 2026-02-17 nucl-th nucl-ex 50%

Nuclear Fragmentation at Intermediate Energies in the DCM-QGSM-SMM Model

中间能区的核碎裂在DCM-QGSM-SMM模型中

M. A. Martemianov, B. M. Abramov, S. A. Bulychjov, I. A. Dukhovskoy, V. V. Kulikov, A. A. Kulikovskaya, M. A. Matsyuk

专题命中 VLA模型 :action model(abstract)

AI总结 本文比较了DCM-QGSM-SMM模型在中间能区的核碎裂预测与实验数据及其他模型的预测。

Comments 6 figures, 0 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18259 2026-02-17 astro-ph.CO 50%

Addressing Dipole Tension via Clustering in $Λ$CDM and beyond

通过聚类缓解ΛCDM及更广泛的理论中的偶极子张力

Arefeh Daei Rasouli, Haniyeh S. Tadayyoni, Shant Baghram, Sohrab Rahvar

专题命中 VLA模型 :VLA(abstract)

AI总结 通过聚类分析,研究发现ΛCDM及修改引力模型中偶极子张力有所缓解,但仍需进一步验证。

Comments 16 pages, 3 figures, 4 tables, final version with extensive modifications. Published version in Astrophysical Journal

Journal ref The Astrophysical Journal, 998, 207, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2602.13833 2026-02-17 cs.RO 70%

Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation

语义接触场用于类别级可泛化的触觉工具操作

Kevin Yuchen Ma, Heng Zhang, Weisi Lin, Mike Zheng Shou, Yan Wu

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 SCFields通过融合视觉语义与密集接触估计,实现类别级可泛化的触觉工具操作,显著优于视觉和原始触觉基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2602.14979 2026-02-17 cs.RO 83%

RynnBrain: Open Embodied Foundation Models

RynnBrain: 开放式具身基础模型

Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin Liu, Yunxuan Mao, Zhikai Wang, Yuqian Yuan, Minghao Zhu, Xiao Lin, Yang Bai, Qian Jiang, Yaxi Zhao, Minghua Zeng, Junlong Gao, Yuming Jiang, Jun Cen, Siteng Huang, Liuyi Wang, Wenqiao Zhang, Chengju Liu, Jianfei Yang, Shijian Lu, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);VLA(abstract);分类 cs.RO

AI总结 RynnBrain提出了一种开放的具身基础模型,通过统一框架强化感知、推理、规划等能力,显著优于现有模型,并能高效适应多种具身任务。

Comments Homepage: https://alibaba-damo-academy.github.io/RynnBrain.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2602.13764 2026-02-17 cs.RO cs.AI 73%

MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer

MOTIF: 为少样本跨躯体迁移学习动作动机

Heng Zhi, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 MOTIF通过学习动作动机实现高效的少样本跨躯体迁移,提升机器人在新躯体上的动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏