arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9881 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9200 篇

2505.04999 2026-07-31 cs.RO cs.AI cs.LG 版本更新 83%

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

CLAM:基于未标记演示的连续潜在动作模型用于机器人学习

Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CLAM通过连续潜在动作标签和联合训练动作解码器,有效解决复杂连续控制任务中未标记数据的学习问题,实现在DMControl和MetaWorld等基准及真实机器人上的性能提升。

Comments Latent Action Models, Self-supervised Pretraining, Learning from Videos

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03682 2026-08-17 cs.AI cs.RO 版本更新 82%

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

PhyAI:边缘端实时物理人工智能,云端可扩展部署

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Junbo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Ruixin Liu, Shangguang Wang, Tam Sikyuen, Tianyue Zhang, Weikai Xie, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Yuxin Zheng, Ziqi Guo

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对物理AI多部署场景推理程序不统一的问题,提出PhyAI推理引擎,实现多模型跨端部署,在多个基准上取得1.40-4.65倍加速,还引入控制时间屋顶线分析模型特性。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 82%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 82%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 82%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12936 2026-07-17 cs.RO cs.AI 版本更新 82%

Pipette: An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics

面向湿实验室机器人的具身仿真平台、基准测试及数据高效增强框架

Zhe Liu, Huanbo Jin, Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, He Xu, Peijia Li, Jiaming Gu, Quan Lu, Qi Wang, Bin Ji, Ting Xiao

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education(能源化工过程智能制造国家重点实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Laboratory Medicine(实验室医学系) Shanghai Jiao Tong University School of Medicine(上海交通大学医学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Pipette平台,包含可编辑资产、仿真数据增强管道和11任务基准测试,将30次演示的VLA成功率从44.1%提升至74.7%。

Comments 19 pages, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11270 2026-07-14 cs.RO cs.AI 新提交 82%

Towards Predictive, Aligned, and Scalable Robot Learning

迈向可预测、对齐且可扩展的机器人学习

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28545 2026-07-03 cs.RO cs.CV 版本更新 82%

ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation

ManipArena: 通用机器人操作的综合现实世界评估

Yu Sun, Meng Cao, Yang Ping, Kaidong Zhang, Qingxuan Chen, Rongtao Xu, Liangwang Ruan, Xuecheng Chen, Dongxiu Liu, Yunxiao Yan, Zunnan Xu, Runze Xu, Charles Yang, Peilun Zhang, Xiaofan Li, Ruyi Gan, Liang Ma, Yuehao Yin, Jincheng Yu, Lufang Chen, Yuxin Liang, Peng Zhai, Hao Wang, Ivan Laptev, Ian Reid, Qian Wang, Xiaodan Liang

机构 * SYSU(中山大学) X SQUARE ROBOT MBZUAI(穆罕默德·本·扎耶德人工智能大学) Thsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 ManipArena通过标准化框架解决现有评估不足问题,提供真实场景下的多任务测试与多级泛化能力,支持长时移动操作与传感诊断,促进视觉-语言-动作模型和世界模型的发展。

Comments Technical report for CVPR 2026 Challenge ManipArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05226 2026-06-24 cs.RO cs.AI 版本更新 82%

Reward-Centered ReST-MCTS: A Robust Decision-Making Framework for Robotic Manipulation in High Uncertainty Environments

以奖励为中心的ReST-MCTS:高不确定性环境下机器人操作的鲁棒决策框架

Xibai Wang

机构 * Xibai Wang(王西拜)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Reward-Centered ReST-MCTS框架,通过分解中间反馈为中心信号并引导搜索,解决高不确定性环境下MCTS因稀疏奖励和噪声导致的决策脆弱性问题,实验验证其在同骨干VLA上的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22966 2026-06-23 cs.LG cs.AI cs.CR 新提交 82%

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

攻击可信想象:对“先想象后行动”世界模型的预言机级完整性攻击

Linghan Chen, Kaiyan Ji, Minyu Guo

机构 * Adelaide University(阿德莱德大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 针对“先想象后行动”的视觉-语言-动作策略,发现世界模型中的想象轨迹是暴露的攻击面,通过有界观测扰动破坏想象,并设计无参数去噪检测器,实验显示非定向破坏效果显著,但定向控制受限。

Comments 13 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 82%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(summary_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17800 2026-04-21 cs.RO cs.CV 82%

ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略

Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu

机构 * VinRobotics University of Texas at Arlington(德克萨斯大学阿灵顿分校) Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) Intelligent Autonomous Systems Lab(智能自主系统实验室) TU Darmstadt(德累斯顿技术大学) Automation & Control Institute(自动化与控制研究所) TU Wien(维也纳技术大学) Austrian Institute of Technology (AIT)(奥地利技术研究所)

专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。

Comments arXiv admin note: substantial text overlap with arXiv:2505.19080

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13515 2026-06-12 cs.CV cs.LG cs.RO 新提交 82%

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

MaskWAM:统一掩码提示与预测的世界-动作模型

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent Robotics X(腾讯机器人X实验室) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 82%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09811 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

AHA-WAM:异步自适应时域世界-动作建模与观测引导的上下文路由

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Baidu AI Cloud(百度智能云) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出AHA-WAM,一种基于双扩散Transformer的异步时域自适应世界-动作模型,通过低频世界规划器和高频动作执行器解耦时序,实现高效闭环控制,在RoboTwin和真实任务上达到SOTA性能。

Comments Project page: https://serene-sivy.github.io/aha-wam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05254 2026-06-05 cs.LG cs.CV cs.RO 82%

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM:面向世界动作模型的模态感知蒸馏

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) EmbodyX Inc.(EmbodyX公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20634 2026-06-05 astro-ph.GA 82%

The VLA Frontier Fields Survey: A 6GHz High-resolution Radio Survey of Abell2744

VLAFrontierFields调查:阿贝尔2744的6GHz高分辨率射电调查

Esteban A. Orozco, Eric F. Jiménez-Andrade, Eric J. Murphy, Ian Smail, Emmanuel Momjian, Ian Heywood, Miguel Vega-Gutierrez, Christa DeCoursey

专题命中 VLA模型 :VLA(title,abstract)

AI总结 该研究利用VLAFrontierFields计划对阿贝尔2744进行6GHz射电连续观测,揭示了高红移星系在前景大质量星系团放大效应下的射电发射特性,并发现射电源的星形成率显著高于紫外至近红外数据。

Comments 25 pages, 13 figures, 7 tables. Accepted for publication in ApJ; in press

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05525 2026-04-08 cs.GR 82%

CrowdVLA: Embodied Vision-Language-Action Agents for Context-Aware Crowd Simulation

CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理

Juyeong Hwang, Seong-Eun Hong, Jinhyun Kim, JaeYoung Seon, Giljoo Nam, Hanyoung Jang, HyeongYeop Kang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract)

AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08124 2026-03-10 cs.RO cs.AI cs.LG 82%

SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action

SaiVLA-0:基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作

Xiang Shi, Wenlong Huang, Menglin Zou, Xinhai Sun

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 SaiVLA-0提出基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作系统,通过模块化设计提升效率与稳定性,初步实验显示训练时间减少且成功率显著提升。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14396 2025-12-24 cs.RO cs.AI cs.CV 82%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13778 2025-10-16 cs.RO cs.AI cs.CV 82%

InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy

Xinyi Chen, Yilun Chen, Yanwei Fu, Ning Gao, Jiaya Jia, Weiyang Jin, Hao Li, Yao Mu, Jiangmiao Pang, Yu Qiao, Yang Tian, Bin Wang, Bolun Wang, Fangjing Wang, Hanqing Wang, Tai Wang, Ziqin Wang, Xueyuan Wei, Chao Wu, Shuai Yang, Jinhui Ye, Junqiu Yu, Jia Zeng, Jingjing Zhang, Jinyu Zhang, Shi Zhang, Feng Zheng, Bowen Zhou, Yangkun Zhu

机构 * Intern Robotics Shanghai AI Laboratory(Intern Robotics上海AI实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19400 2025-09-30 cs.LG cs.AI cs.RO 82%

Vintix: Action Model via In-Context Reinforcement Learning

Andrey Polubarov, Nikita Lyubaykin, Alexander Derevyagin, Ilya Zisman, Denis Tarasov, Alexander Nikulin, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

Comments ICML 2025, Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10416 2025-08-15 cs.RO cs.AI cs.CL cs.CV 82%

CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model

Zhuoyuan Yu, Yuxing Long, Zihan Yang, Chengyan Zeng, Hongwei Fan, Jiyao Zhang, Hao Dong

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20114 2026-08-24 cs.AI cs.RO 版本更新 82%

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云神初科技有限公司(深智机器人))

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出DECOWAM模型,通过解耦全身动作因素提升移动操作的视觉与动作预测性能,在真实机器人数据集ARMDOG上验证了其在协调性和鲁棒性上的优势。

Comments 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12351 2026-02-16 cs.RO cs.CV 82%

LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation

LongNav-R1: 基于水平自适应的多轮强化学习用于长周期视觉语言导航

Yue Hu, Avery Xi, Qixin Xiao, Seth Isaacson, Henry X. Liu, Ram Vasudevan, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 LongNav-R1通过多轮强化学习提升长周期视觉语言导航性能,实现高效样本利用和多样化导航行为。

Comments VLA, Navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19161 2026-08-20 cs.AI cs.CR 新提交 81%

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

超越文本记录:检测潜在多智能体通信中的隐蔽协同

Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy

机构 * MIT Media Lab(麻省理工学院媒体实验室) Westtown School(韦斯顿镇学校) University of Florida(佛罗里达大学) SRI International(SRI国际公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.AI

AI总结 本研究针对语言模型智能体通过不可见潜在状态进行隐蔽协同的问题,提出可验证潜在对齐(VLA)框架,设计三层监控器与可引导性框架,在多智能体拍卖基准上实现了高效的隐蔽协同检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 81%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-19 cs.RO 版本更新 81%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Yao Li, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Jiajun Deng, Yanyong Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交 81%

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00337 2026-08-04 cs.RO 新提交 81%

Action Chunk Scheduling for Batched Robot Policy Serving

用于批量机器人策略服务的动作块调度

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO

AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。

详情

展开后加载摘要…

URL PDF HTML 收藏