arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-16 至 2026-02-16 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2412.14058 2026-02-16 cs.RO cs.CV 90%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO 88%

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12322 2026-02-16 cs.RO cs.AI 84%

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

ForeAct: 通过高效的视觉前瞻性规划控制您的VLA

Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Caltech(加州理工学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12532 2026-02-16 cs.RO 83%

CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning

CRAFT: 通过力感知的课程微调适应接触密集的操纵

Yike Zhang, Yaonan Wang, Xinxin Sun, Kaizhen Huang, Zhiyuan Xu, Junjie Ji, Zhengping Che, Jian Tang, Jingtao Sun

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12351 2026-02-16 cs.RO cs.CV 82%

LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation

LongNav-R1: 基于水平自适应的多轮强化学习用于长周期视觉语言导航

Yue Hu, Avery Xi, Qixin Xiao, Seth Isaacson, Henry X. Liu, Ram Vasudevan, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 LongNav-R1通过多轮强化学习提升长周期视觉语言导航性能,实现高效样本利用和多样化导航行为。

Comments VLA, Navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13086 2026-02-16 cs.RO 70%

UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph

UniManip: 通用目的零样本机器人操作的代理操作图

Haichao Liu, Yuanjiang Xue, Yuheng Zhou, Haoyuan Deng, Yinan Liang, Lihua Xie, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University, China(清华大学自动化系)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。

Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13089 2026-02-16 math.PR 50%

Well-posedness of stochastic reacting particle systems with non-local and Lennard-Jones interactions

具有非局部和伦敦-琼斯相互作用的随机反应粒子系统的适定性

Daniela Morale, Giulia Rui, Stefania Ugolini

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了具有非局部和伦敦-琼斯相互作用的随机反应粒子系统的适定性,通过交错技术分析了环境场与粒子配置的耦合效应。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12989 2026-02-16 cs.CL 50%

Evaluating the Homogeneity of Keyphrase Prediction Models

评估关键词预测模型的同质性

Maël Houbre, Florian Boudin, Beatrice Daille

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出评估关键词预测模型同质性的方法,发现生成缺失关键词的能力可能降低模型同质性,而关键词提取方法与生成模型表现相当。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16145 2026-02-16 math.AP math.DS 50%

On the Ginzburg-Landau approximation for quasilinear pattern forming reaction-diffusion-advection systems

关于准线性模式形成反应-扩散-对流系统的吉因斯-兰道近似

Théo Belin, Guido Schneider

专题命中 VLA模型 :action model(abstract)

AI总结 本文证明吉因斯-兰道方程能准确预测准线性模式形成反应-扩散-对流系统的动力学,并应用于格雷-斯科特-克劳斯梅尔模型。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2602.10915 2026-02-16 cs.CR cs.AI 57%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2602.12510 2026-02-16 cs.IR cs.CV cs.LG 62%

Visual RAG Toolkit: Scaling Multi-Vector Visual Retrieval with Training-Free Pooling and Multi-Stage Search

视觉RAG工具包:通过无训练池化和多阶段搜索扩展多向量视觉检索

Ara Yeroyan

机构 * Independent Researcher(独立研究者)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.LG

AI总结 视觉RAG工具包通过无训练池化和多阶段搜索提升多向量视觉检索效率,减少向量存储并提高检索吞吐量。

Comments 4 pages, 3 figures. Submitted to SIGIR 2026 Demonstrations Track. Project website: https://github.com/Ara-Yeroyan/visual-rag-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏