arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9866 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9186 篇

2501.03841 2025-01-08 cs.RO 77%

OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints

Mingjie Pan, Jiyao Zhang, Tianshu Wu, Yinghao Zhao, Wenlong Gao, Hao Dong

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18243 2024-08-20 cs.CL cs.AI cs.CV cs.LG cs.RO 77%

LEGENT: Open Platform for Embodied Agents

Zhili Cheng, Zhitong Wang, Jinyi Hu, Shengding Hu, An Liu, Yuge Tu, Pengkai Li, Lei Shi, Zhiyuan Liu, Maosong Sun

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments ACL 2024 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16093 2024-06-25 cs.RO cs.AI cs.CV cs.LG 77%

Towards Natural Language-Driven Assembly Using Foundation Models

Omkar Joglekar, Tal Lancewicki, Shir Kozlovsky, Vladimir Tchuiev, Zohar Feldman, Dotan Di Castro

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交 76%

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23909 2026-08-03 cs.LG cs.RO 版本更新 76%

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT:用于世界和动作建模的统一扩散架构

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.LG

AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28243 2026-07-31 cs.CV cs.AI 新提交 76%

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tianji KernalMind Co., Ltd.(天机芯智有限公司) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学)

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI

AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。

Comments project page: https://egogenesis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 76%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02076 2026-07-09 cs.LG cs.AI 版本更新 76%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07686 2026-06-09 cs.LG cs.AI 新提交 76%

Knowledge-Inclusive Adaptive Physics-Informed Neural Network for Microbial Interaction Modelling

知识包容的自适应物理信息神经网络用于微生物相互作用建模

Ravisha Rupasinghe, Rajith Vidanaarachchi, Asela Hevapathige, Sachith Seneviratne, Sen-Lin Tang, Saman Halgamuge

机构 * University of Melbourne(墨尔本大学) Academia Sinica(中央研究院)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 提出一种知识包容的自适应PINN框架,通过整合文本和网络结构知识改进微生物群落建模,在真实和模拟数据集上性能提升最高53%。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20246 2026-05-22 cs.LG cs.AI 76%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 76%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(title);分类 cs.CV、cs.LG

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 76%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24581 2026-03-26 cs.CV cs.RO 76%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08333 2026-03-03 cs.RO cs.AI 76%

Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging

通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调

Yajat Yadav, Zhiyuan Zhou, Andrew Wagenmaker, Karl Pertsch, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

AI总结 通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调,使策略在保持泛化能力的同时有效学习新技能。

Journal ref The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 76%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(title);分类 cs.RO、cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06214 2026-01-13 cs.LG cs.AI q-bio.QM 76%

Dynamics-inspired Structure Hallucination for Protein-protein Interaction Modeling

受动力学启发的结构幻想用于蛋白质-蛋白质相互作用建模

Fang Wu, Stan Z. Li

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学) School of Engineering(工程学院) Westlake University(西湖大学)

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

AI总结 本文提出Refine-PPI框架,通过结构细化模块和概率密度云网络,解决突变蛋白质结构获取困难和动态几何不确定性建模问题。

Journal ref Transactions on Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20900 2025-11-18 cs.RO cs.AI 76%

DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping

Yifan Zhong, Xuchuan Huang, Ruochong Li, Ceyao Zhang, Zhang Chen, Tianrui Guan, Fanlian Zeng, Ka Num Lui, Yuyao Ye, Yitao Liang, Yaodong Yang, Yuanpei Chen

专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06828 2025-10-09 cs.LG cs.AI 76%

Recurrence-Complete Frame-based Action Models

Michael Keiblinger

机构 * Prime Intellect

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11093 2025-08-18 cs.RO cs.AI cs.HC 76%

Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance

Cesar Alan Contreras, Manolis Chiou, Alireza Rastegarpanah, Michal Szulik, Rustam Stolkin

机构 * University of Birmingham(伯明翰大学) Queen Mary University of London(伦敦大学女王学院) Aston University(阿斯顿大学) United Kingdom National Nuclear Laboratory Ltd.(英国国家核实验室有限公司)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI

Comments Accepted at Human-Centered Robot Autonomy for Human-Robot Teams (HuRoboT) at IEEE RO-MAN 2025, Eindhoven, the Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15029 2025-03-20 cs.RO cs.CV 76%

DRoPE: Directional Rotary Position Embedding for Efficient Agent Interaction Modeling

Jianbo Zhao, Taiyu Ban, Zhihao Liu, Hangning Zhou, Xiyang Wang, Qibin Zhou, Hailong Qin, Mu Yang, Lei Liu, Bin Li

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.11866 2025-02-24 cs.LG cs.AI cs.IR 76%

GraphFM: Graph Factorization Machines for Feature Interaction Modeling

Shu Wu, Zekun Li, Yunyue Su, Zeyu Cui, Xiaoyu Zhang, Liang Wang

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments The code and data are available at https://github.com/CRIPAC-DIG/GraphCTR

Journal ref Mach. Intell. Res. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17622 2024-09-27 cs.LG cs.AI 76%

Neural P$^3$M: A Long-Range Interaction Modeling Enhancer for Geometric GNNs

Yusong Wang, Chaoran Cheng, Shaoning Li, Yuxuan Ren, Bin Shao, Ge Liu, Pheng-Ann Heng, Nanning Zheng

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments Published as a conference paper at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09685 2024-07-18 cs.LG cs.AI q-bio.QM 76%

Accelerating the inference of string generation-based chemical reaction models for industrial applications

Mikhail Andronov, Natalia Andronova, Michael Wand, Jürgen Schmidhuber, Djork-Arné Clevert

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08139 2023-01-20 cs.IR cs.AI cs.LG 76%

DynInt: Dynamic Interaction Modeling for Large-scale Click-Through Rate Prediction

YaChen Yan, Liubo Li

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2301.01089

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13848 2022-11-01 cs.AI cs.RO 76%

ProspectNet: Weighted Conditional Attention for Future Interaction Modeling in Behavior Prediction

Yutian Pang, Zehua Guo, Binnan Zhuang

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.02140 2022-08-04 cs.CL cs.AI cs.LG 76%

KPI-BERT: A Joint Named Entity Recognition and Relation Extraction Model for Financial Reports

Lars Hillebrand, Tobias Deußer, Tim Dilmaghani, Bernd Kliem, Rüdiger Loitz, Christian Bauckhage, Rafet Sifa

专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG

Comments Accepted at ICPR 2022, 8 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.04313 2021-05-11 cs.CV cs.LG 76%

DocReader: Bounding-Box Free Training of a Document Information Extraction Model

Shachar Klaiman, Marius Lehne

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02148 2021-03-26 cs.CV cs.RO 76%

Graph-SIM: A Graph-based Spatiotemporal Interaction Modelling for Pedestrian Action Prediction

Tiffany Yau, Saber Malekmohammadi, Amir Rasouli, Peter Lakner, Mohsen Rohani, Jun Luo

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV

Comments 7 pages, 3 figures, 4 tables, accepted at ICRA 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09045 2026-07-13 eess.SY cs.SY 新提交 75%

Can the Cloud Drive? Infrastructure Feasibility of Offloading Autonomous Driving Across 5G and 6G

云能驱动自动驾驶吗?跨5G和6G卸载自动驾驶的基础设施可行性

Pouya Parsa, Kawon Han, Seongjin Choi

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 探讨云能否驱动自动驾驶,通过耦合通信限制、GPU服务模型等构建分析框架,应用于纽约市,研究发现通信、计算、成本依次起约束作用,延迟决定模型可行性,成本决定是否经济。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04146 2026-07-07 cs.RO cs.AI cs.CL cs.CR cs.LG 新提交 75%

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

!帝国,小型甚大阵:数据投毒对开源机器人技术的影响

Stefan Bühler, Mark Schutera

机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。

Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning

详情

展开后加载摘要…

URL PDF HTML 收藏