arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9186 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9186 篇

2510.17148 2025-11-05 cs.RO cs.CV 73%

DiffVLA++: Bridging Cognitive Reasoning and End-to-End Driving through Metric-Guided Alignment

Yu Gao, Anqing Jiang, Yiru Wang, Wang Jijun, Hao Jiang, Zhigang Sun, Heng Yuwen, Wang Shuo, Hao Zhao, Sun Hao

机构 * RIX, Bosch(博世研究院) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23763 2025-11-04 cs.RO cs.CL cs.CV 73%

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Siyin Wang, Jinlan Fu, Feihong Liu, Xinzhe He, Huangxuan Wu, Junhao Shi, Kexin Huang, Zhaoye Fei, Jingjing Gong, Zuxuan Wu, Yu-Gang Jiang, See-Kiong Ng, Tat-Seng Chua, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26406 2025-10-31 cs.RO cs.AI 73%

Human-in-the-loop Online Rejection Sampling for Robotic Manipulation

Guanxing Lu, Rui Zhao, Haitao Lin, He Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24161 2025-10-29 cs.AI cs.MM cs.RO 73%

BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning

Wentao Tan, Bowen Wang, Heng Zhi, Chenyu Liu, Zhe Li, Jian Liu, Zengrong Lin, Yukun Dai, Yipeng Chen, Wenjie Yang, Enci Xie, Hao Xue, Baixu Ji, Chen Xu, Zhibin Wang, Tianshi Wang, Lei Zhu, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21860 2025-10-28 cs.RO cs.AI 73%

Butter-Bench: Evaluating LLM Controlled Robots for Practical Intelligence

Callum Sharrock, Lukas Petersson, Hanna Petersson, Axel Backlund, Axel Wennström, Kristoffer Nordström, Elias Aronsson

机构 * Andon Labs(安登实验室)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21817 2025-10-28 cs.RO cs.CL cs.LG 73%

VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, Yi-Fan Zhang, Shaoqi Dong, Cheng Qian, Bin Luo, Xiuyong Yang, Guanwu Li, Yusheng Cai, Yunhang Shen, Deqiang Jiang, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) CASIA(中国科学院自动化研究所) Fourier Intelligence Inc.(傅里叶智能公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

Comments Homepage: https://lxysl.github.io/VITA-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11660 2025-10-15 cs.RO cs.AI 73%

ManiAgent: An Agentic Framework for General Robotic Manipulation

Yi Yang, Kefan Gu, Yuqing Wen, Hebei Li, Yucheng Zhao, Tiancai Wang, Xudong Liu

机构 * Beijing University of Technology(北京理工大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Dexmal

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07961 2025-10-15 cs.RO cs.AI 73%

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models

Peiyan Li, Yixiang Chen, Hongtao Wu, Xiao Ma, Xiangnan Wu, Yan Huang, Liang Wang, Tao Kong, Tieniu Tan

机构 * CASIA(中国科学院自动化研究所) ByteDance Seed(字节跳动种子实验室) UCAS(中国科学院大学) FiveAges NJU(南京大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24524 2025-09-30 cs.RO cs.AI cs.SY eess.SY 73%

PhysiAgent: An Embodied Agent Framework in Physical World

Zhihao Wang, Jianxiong Li, Jinliang Zheng, Wencong Zhang, Dongxiu Liu, Yinan Zheng, Haoyi Niu, Junzhi Yu, Xianyuan Zhan

机构 * AIR, Tsinghua University(清华大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15212 2025-09-19 cs.CV cs.RO 73%

RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation

Yuming Jiang, Siteng Huang, Shengke Xue, Yaxi Zhao, Jun Cen, Sicong Leng, Kehan Li, Jiayan Guo, Kexiang Wang, Mingxiu Chen, Fan Wang, Deli Zhao, Xin Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments GitHub Project: https://github.com/alibaba-damo-academy/RynnVLA-001

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03383 2025-09-04 cs.AI cs.RO 73%

ANNIE: Be Careful of Your Robots

Yiyang Huang, Zixuan Wang, Zishen Wan, Yapeng Tian, Haobo Xu, Yinhe Han, Yiming Gan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13045 2025-08-26 cs.LG cs.CV 73%

Continual Learning for Generative AI: From LLMs to MLLMs and Beyond

Haiyang Guo, Fanhu Zeng, Fei Zhu, Jiayi Wang, Xukai Wang, Jingang Zhou, Hongbo Zhao, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang, Cheng-Lin Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港科学与创新研究院人工智能与机器人中心) School of Computer and Information Engineering, Xiamen University of Technology(厦门理工大学计算机与信息工程学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02747 2025-07-04 cs.CV cs.RO 73%

DexVLG: Dexterous Vision-Language-Grasp Model at Scale

Jiawei He, Danshi Li, Xinqiang Yu, Zekun Qi, Wenyao Zhang, Jiayi Chen, Zhaoxiang Zhang, Zhizheng Zhang, Li Yi, He Wang

机构 * Institution1(机构1) Institution2(机构2)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16263 2025-06-23 cs.RO cs.AI 73%

CapsDT: Diffusion-Transformer for Capsule Robot Manipulation

Xiting He, Mingwu Su, Xinqi Jiang, Long Bai, Jiewen Lai, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong (CUHK)(电子工程系,香港中文大学(CUHK))

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08462 2025-06-11 cs.AI cs.HC cs.RO cs.SY eess.SY 73%

Hybrid Reasoning for Perception, Explanation, and Autonomous Action in Manufacturing

Christos Margadji, Sebastian W. Pattinson

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10345 2025-06-09 cs.RO cs.AI 73%

TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies

Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang, Jianfeng Gao, Hal Daumé, Andrey Kolobov, Furong Huang, Jianwei Yang

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Microsoft Research(微软研究院) Capital One

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23189 2025-05-30 cs.RO cs.CV 73%

TrackVLA: Embodied Visual Tracking in the Wild

Shaoan Wang, Jiazhao Zhang, Minghan Li, Jiahang Liu, Anqi Li, Kui Wu, Fangwei Zhong, Junzhi Yu, Zhizheng Zhang, He Wang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15576 2025-05-28 cs.RO cs.CV 73%

QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning

Xinyang Tong, Pengxiang Ding, Yiguo Fan, Donglin Wang, Wenjie Zhang, Can Cui, Mingyang Sun, Han Zhao, Hongyin Zhang, Yonghao Dang, Siteng Huang, Shangke Lyu

机构 * MiLAB, Westlake University, Hangzhou, 310030, China(西交利物浦大学微实验室,杭州,310030,中国) Zhejiang University, Hangzhou, 310027, China(浙江大学,杭州,310027,中国) Beijing University of Posts and Telecommunications, Beijing, 100876, China(北京邮电大学,北京,100876,中国)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Accepted to ICRA 2025; Github page: https://quart-online.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15659 2025-05-22 cs.RO cs.LG 73%

FLARE: Robot Learning with Implicit World Modeling

Ruijie Zheng, Jing Wang, Scott Reed, Johan Bjorck, Yu Fang, Fengyuan Hu, Joel Jang, Kaushil Kundalia, Zongyu Lin, Loic Magne, Avnish Narayan, You Liang Tan, Guanzhi Wang, Qi Wang, Jiannan Xiang, Yinzhen Xu, Seonghyeon Ye, Jan Kautz, Furong Huang, Yuke Zhu, Linxi Fan

机构 * NVIDIA University of Maryland, College Park(马里兰大学) Nanyang Technological University(南洋理工大学) University of Texas, Austin(德克萨斯大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

Comments Project Webpage / Blogpost: https://research.nvidia.com/labs/gear/flare

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08001 2025-02-07 cs.RO cs.AI 73%

Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation

Qingwen Bu, Hongyang Li, Li Chen, Jisong Cai, Jia Zeng, Heming Cui, Maoqing Yao, Yu Qiao

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments Project page: https://opendrivelab.com/RoboDual/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03272 2024-09-06 cs.CV cs.RO 73%

OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving

Julong Wei, Shanshuai Yuan, Pengfei Li, Qingda Hu, Zhongxue Gan, Wenchao Ding

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00678 2024-01-02 cs.RO cs.LG q-bio.TO 73%

General-purpose foundation models for increased autonomy in robot-assisted surgery

Samuel Schmidgall, Ji Woong Kim, Alan Kuntz, Ahmed Ezzat Ghazi, Axel Krieger

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22022 2026-08-17 math.NA cs.NA 版本更新 71%

A High-Accuracy Symplectic Scheme for a nonlinear transport problem

非线性输运问题的高精度辛格式

Farjana Siddiqua, Catalin Trenchea

专题命中 VLA模型 :action model(title)

AI总结 针对可建模色谱法的非齐次边界条件平流-扩散-反应问题,采用辛单步隐式中点法和有限元法,完成稳定性、误差分析及全离散解存在性证明,数值测试验证了理论结果。

Comments 33 pages, 5 Figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08266 2026-08-10 q-bio.QM physics.comp-ph 71%

An open-source computational framework for immersed fluid-structure interaction modeling using FEBio and MFEM

一种用于基于FEBio和MFEM的浸没流固耦合建模的开源计算框架

Ryan T. Black, Steve A. Maas, Wensi Wu, Jalaj Maheshwari, Tzanio Kolev, Jeffrey A. Weiss, Matthew A. Jolley

专题命中 VLA模型 :action model(title)

AI总结 本文提出一种开源框架,结合MFEM和FEBio实现高效流固耦合建模,用于生物力学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02847 2026-08-05 astro-ph.SR 新提交 71%

New Spatially Resolved Observations of Betelgeuse from the VLA and ALMA: Evidence for Atmospheric Perturbations from a Close Companion

L. D. Matthews, A. K. Dupree, A. M. S. Richards, W. R. F. Dent

专题命中 VLA模型 :VLA(title)

Comments 23 pages, 13 figures, 6 tables. Accepted to the Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14969 2026-07-23 cond-mat.str-el 版本更新 71%

On the Symmetries of Anisotropic Spin Interaction Models

关于各向异性自旋相互作用模型的对称性

Arist Zhenyuan Yang

专题命中 VLA模型 :action model(title)

AI总结 研究各向异性自旋相互作用模型的对称性,通过重新定义纯自旋群\(S_0\)制定tSSG理论,研究自旋-1模型发现\(\mathbb{Z}_2\)拓扑四极激发及相关特性,建立相互作用自旋系统对称语言,开辟非常规磁性研究途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12381 2026-07-23 quant-ph 版本更新 71%

Enhanced quantum illumination of a lossy target: A sequential interaction model

增强的损失性目标量子照明:一个顺序交互模型

Shilpi Srivastava, Shubhrangshu Dasgupta

专题命中 VLA模型 :action model(title)

AI总结 研究在现实环境中量子照明对损失性目标的有效性,比较高斯双模压缩态与最优经典协议的性能,发现TMSS在低反射率目标下具有更高的SNR和更强的抗热噪声能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02564 2026-07-13 cs.CL 版本更新 71%

Relation Extraction Model Based on Semantic Enhancement Mechanism

基于语义增强机制的关系抽取模型

Peiyu Liu, Junping Du, Yingxia Shao, Zeli Guan

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(计算机学院(国家试点软件工程学院)、北京邮电大学) Beijing Key Laboratory of Intelligent Telecommunication Software and Multimedia(智能电信软件与多媒体北京重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :action model(title)

AI总结 研究自然语言处理中关系抽取的三元组重叠问题,提出基于CasRel框架结合语义增强机制的CasAug模型,通过对可能主语预分类、计算语义相似度等操作,提升关系抽取效果,增强处理重叠问题及抽取多关系的能力。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31832 2026-07-09 physics.comp-ph cond-mat.stat-mech 新提交 71%

Navigating committor landscape of biomolecules with a general pairwise interaction model

利用通用成对相互作用模型导航生物分子的提交者景观

Jintu Zhang, Zichang Jin, Huifeng Zhao, Kai Zhu, Bowei Zhao, Xujun Zhang, Peilin Kang, Tingjun Hou

专题命中 VLA模型 :action model(title)

AI总结 提出基于AlphaFold 3范式的提交者学习框架,通过轻量级原子嵌入和简化Pairformer架构,准确捕捉生物系统动力学特征,揭示了chignolin折叠的过渡态结构和杯芳烃主客体系统的结合路径调控机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16752 2026-07-09 quant-ph 版本更新 71%

Characterizing Phase Fragility via Algorithmically Prepared Ancillas in Repeated-Interaction Models

通过重复相互作用模型中算法制备的辅助量子比特表征相位脆弱性

S. Elham Mousavigharalari, Deniz Türkpençe

专题命中 VLA模型 :action model(title)

AI总结 研究通过单比特门序列编码的相位参数$\phi$在噪声动力学下的量子费希尔信息,采用碰撞模型和脉冲分辨开放系统模拟两种方法,结果表明二者QFI分布对相位依赖性相似,稳态框架可表征相位敏感性,还给出未来应用方向。

Comments 21 pages, 5 figures. This work presents an analytic and simulation-based study of phase sensitivity in noisy quantum devices, linking collision models and device-level simulations via quantum Fisher information, and will be of interest to readers in quantum computing and quantum metrology

详情

展开后加载摘要…

URL PDF HTML 收藏