arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-10 至 2026-02-10 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2602.07845 2026-02-10 cs.RO 91%

Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning

递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展

Yalcin Tur, Jalal Naghiyev, Haoquan Fang, Wei-Chuan Tsai, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * Stanford University(斯坦福大学) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。

Comments 11 Pages, Project page:https://rd-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05342 2026-02-10 cs.RO cs.AI 88%

Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control

信息论图融合:基于视觉-语言-动作模型的政策推理与双臂机器人控制

Shunlei Li, Longsen Gao, Jin Wang, Chang Che, Xi Xiao, Jiuwen Cao, Yingbai Hu, Hamid Reza Karimi

机构 * Electrical and Computer Engineering Department, University of New Mexico, Albuquerque, United States, 87106(电气与计算机工程系,新墨西哥大学,阿尔伯克基,美国,87106) Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford, United Kingdom, OX26NN(动态机器人系统组,牛津机器人研究所,牛津大学,英国,OX26NN) Mechanical and Aerospace Engineering Department, The George Washington University, DC, United States, 22202(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区,美国,22202) Department of Computer Science, University of Alabama at Birmingham, Alabama, United States, 35294(计算机科学系,阿拉巴马大学伯明翰分校,阿拉巴马,美国,35294) The School of Computation, Information and Technology, Technical University of Munich, Germany, 85748(计算、信息与技术学院,慕尼黑技术大学,德国,85748) Department of Mechanical Engineering, Politecnico di Milano, Milan, Italy, 20156(机械工程系,米兰理工学院,米兰,意大利,20156)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 GF-VLA通过信息论图融合视觉-语言-动作模型,实现双臂机器人任务推理与执行,提升空间泛化与任务成功率。

Comments Journal accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07555 2026-02-10 cs.CV cs.AI 73%

VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation

VISOR:基于语言驱动的对象导航的视觉空间对象推理

Francesco Taioli, Shiping Yang, Sonia Raychaudhuri, Marco Cristani, Unnat Jain, Angel X Chang

机构 * Polytechnic of Turin(都灵理工大学) Simon Fraser University(Simon Fraser大学) University of Verona(威尼斯大学) University of Reykjavik(雷克雅未克大学) University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 VISOR提出了一种紧凑的3B参数VLA智能体,通过显式图像基础推理实现人类般的具身推理,提升对象识别和动作选择的可解释性、泛化能力和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07541 2026-02-10 cs.RO 70%

Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning

区分与注入:通过参数结构推理诱导的功能区分来增强VLAs

Jingyi Hou, Leyu Zhou, Chenchen Jing, Jinghan Yang, Xinbo Yu, Wei He

机构 * University of Science(科学大学) Zhejiang University of Technology(浙江工业大学) Technology University(技术大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 iSTAR通过参数结构推理诱导功能区分,提升VLA模型在任务分解和任务变化下的可靠性与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05325 2026-02-10 cs.RO 70%

RoboPaint: From Human Demonstration to Any Robot and Any View

RoboPaint:从人类示范到任何机器人和任何视角

Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang, Chao Chen, Peide Wang, Hengdi Zhang, Zhengxue Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO 70%

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08822 2026-02-10 cs.CV 57%

Any-to-All MRI Synthesis: A Unified Foundation Model for Nasopharyngeal Carcinoma and Its Downstream Applications

任意到全部MRI合成:鼻咽癌及其下游应用的统一基础模型

Yao Pu, Yiming Shi, Zhenxi Zhang, Peixin Yu, Yitao Zhuang, Xiang Wang, Hongzhao Chen, Jing Cai, Ge Ren

专题命中 VLA模型 :VLA(abstract);分类 cs.CV

AI总结 本文提出统一基础模型实现任意到全部MRI合成,提升鼻咽癌放疗的准确性和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07802 2026-02-10 cs.HC 50%

TouchScribe: Augmenting Non-Visual Hand-Object Interactions with Automated Live Visual Descriptions

TouchScribe: 通过自动化实时视觉描述增强非视觉手-物体交互

Ruei-Che Chang, Rosiana Natalie, Wenqian Xu, Jovan Zheng Feng Yap, Tiange Luo, Venkatesh Potluri, Anhong Guo

专题命中 VLA模型 :action model(abstract)

AI总结 TouchScribe通过自动化实时视觉描述增强手-物体交互,帮助视障人士更准确地理解物体特征。

详情

展开后加载摘要…

URL PDF HTML 收藏