arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-24 至 2026-08-24 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2608.20556 2026-08-24 cs.RO cs.LO eess.SY 新提交 94%

Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model

Logic-VLA:一种时序逻辑条件下的视觉-语言-动作模型

Celina Shiyu Wang, Yiqi Zhao, Junjie Ye, Yue Wang, Jyotirmoy V. Deshmukh

机构 * University of Southern California(南加州大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 Logic-VLA是感知形式化需求的VLA模型,以STL规约为条件,经两阶段适配后,在四旋翼导航仿真中大幅提升STL满足率,仅小幅降低常规NL任务成功率,可适配不同形式化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20735 2026-08-24 cs.AI cs.RO 新提交 93%

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))

专题命中 VLA模型 :VLA(title,title_cn);action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。

Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20791 2026-08-24 cs.CV cs.AI 新提交 91%

CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models

CertVLA:针对视觉-语言-动作模型的物理视觉攻击的可验证防御

Hui Lu, Zhijie Peng, Yuqi Lin, Zaijia Yang, Jiaming He, Shuhan Ye, Yi Yu, Hanwei Zhu, Bingquan Shen, Alex Kot, Xudong Jiang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 本文提出CertVLA,一种针对VLA模型的物理视觉攻击的可验证防御,通过校准动作区域、确定性覆盖掩码等技术,可验证闭环控制的动作安全性,经仿真和真实实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20890 2026-08-24 cs.CV cs.RO 新提交 91%

A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互

Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang, Ajmal Mian, Mike Zheng Shou

机构 * National University of Singapore (NUS)(新加坡国立大学) Hunan University(湖南大学) The University of Western Australia (UWA)(西澳大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21247 2026-08-24 cs.CV cs.RO 新提交 90%

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20430 2026-08-24 cs.CV 新提交 83%

RISE: Adaptive Imagination for World Action Models

RISE:面向世界动作模型的自适应想象

Hongbo Lu, Liang Yao, Chenghao He, Hao Han, Fan Liu, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(科沃机器人有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有WAM固定想象预算的缺陷,提出自适应框架RISE,构建反事实数据集CounterDrive,在NAVSIM和nuScenes上验证其规划性能更优且可跨WAM架构通用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20114 2026-08-24 cs.AI cs.RO 版本更新 82%

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云神初科技有限公司(深智机器人))

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出DECOWAM模型,通过解耦全身动作因素提升移动操作的视觉与动作预测性能,在真实机器人数据集ARMDOG上验证了其在协调性和鲁棒性上的优势。

Comments 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20974 2026-08-24 cs.CV cs.AI 新提交 81%

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式

Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-08-24 cs.SD cs.AI cs.CL cs.MM eess.AS 版本更新 79%

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-08-24 cs.AI 新提交 77%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21320 2026-08-24 astro-ph.HE 新提交 67%

VLASS Discovery of a Luminous Galactic Radio Transient Evolving on Decade Timescales

VLASS 发现一个演化时标为十年级的明亮银河系射电暂现源

Jessie M. Miller, Gregg Hallinan, Dillon Dong, Adolfo S. Carvalho, S. T. Myers, Jean Somalwar, Casey Law, B. M. Gaensler, Vikram Ravi, Laura Chomiuk, Assaf Horesh, Delina Levine, Yuyang Chen

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 该研究通过多波段分析发现银河系射电暂现源VT J1906+0849,其演化时标为十年级,性质类似微类星体SS 433,或为研究致密天体吸积与喷流提供新样本。

Comments 50 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交 57%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20527 2026-08-24 cond-mat.quant-gas 新提交 50%

Photon-mediated thermodynamics and density fluctuations in an ensemble of laser-cooled Cesium atoms

激光冷却铯原子系综中光子介导的热力学与密度涨落

Arnab Ghosh, Inderpreet Kaur, Hemant Yadav, Shiva Kant Dwivedi, R Shanmukesh, Mithun Thudiyangal, Matthew J. Davis, Bodhaditya Santra

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过实验探究磁光阱中激光冷却铯云的失谐依赖特性,采用广义莱恩-埃姆登模型分析密度分布,揭示空间密度涨落与关联规律,为光子介导相互作用等研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2608.21031 2026-08-24 cs.RO 新提交 57%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20478 2026-08-24 cs.RO 新提交 57%

EndoLIFT: Language-Disambiguated Latent-Conditioned Rectified Flow for Bidirectional Endoscopic Control

EndoLIFT:用于双向内镜控制的语言消歧潜在条件修正流

Chi Kit Ng, Yidong Zhang, Lui Siu Hing, Jinsong Lin, Tianchun Wu, Ho Yin Chim, Zhiqing Tang, Tao Yang, Huxin Gao, Trevor Yeung, Raymond Shing-Yan Tang, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学附属第六医院)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 EndoLIFT是一种视觉-语言-动作策略,通过结合语言意图条件与潜在条件修正流,解决双向内镜控制的意图混叠问题,在导航准确率、错误方向减少及多 phantom 试验中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏