NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
NS-VLA:迈向神经符号视觉-语言-动作模型
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 NS-VLA通过在线强化学习提出神经符号视觉-语言-动作模型,解决VLA在学习可重用原始构件、减少数据依赖和扩展探索能力方面的挑战。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
NS-VLA:迈向神经符号视觉-语言-动作模型
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 NS-VLA通过在线强化学习提出神经符号视觉-语言-动作模型,解决VLA在学习可重用原始构件、减少数据依赖和扩展探索能力方面的挑战。
$Δ$VLA:通过世界知识变化引导的视觉-语言-动作模型
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Great Bay University(大湾大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Macao Polytechnic University(澳门理工学院)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.CV
AI总结 $Δ$VLA通过建模世界知识变化,结合先验引导和潜在空间学习,提升机器人动作生成的效率和性能。
重新思考视觉-语言-动作模型的扩展:对齐、混合与正则化
机构 * Renmin University of China(中国人民大学) ; BeingBeyond ; Peking University(北京大学)
专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 本研究重新审视视觉-语言-动作模型的扩展问题,探讨了对齐、混合与正则化在机器人控制中的关键作用,挑战了传统假设并提供实践指导。
递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展
机构 * Stanford University(斯坦福大学) ; Technical University of Munich(慕尼黑技术大学) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO
AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。
Comments 11 Pages, Project page:https://rd-vla.github.io/
从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)
专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO
AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
高效视觉-语言-动作模型的综述
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机科学与人工智能学院) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) ; Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文综述了高效视觉-语言-动作模型,系统分类了模型设计、训练和数据收集三个核心领域,总结了最新方法并提出了未来研究方向。
Comments 28 pages, 8 figures
视觉-语言-动作(VLA)模型:概念、进展、应用与挑战
机构 * Cornell University(康奈尔大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of the Peloponnese(希腊皮洛斯大学)
专题命中 机器人基础模型 :robotics(abstract);embodied agent(abstract);分类 cs.CV
AI总结 本文综述了视觉-语言-动作(VLA)模型的概念、进展、应用与挑战,探讨了其在自动驾驶、医疗机器人等领域的应用及未来发展方向。
STARE-VLA:渐进式阶段感知强化用于视觉-语言-动作模型微调
机构 * Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 STARE-VLA通过渐进式阶段感知强化方法,提升视觉-语言-动作模型的动作准确性,实现SimplerEnv和ManiSkill3任务中的高成功率。
机构 * Shanghai University(上海大学)
专题命中 机器人基础模型 :robot learning(abstract);robotic(abstract);分类 cs.RO
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; CASIA(中国科学院自动化研究所)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.CV
Comments Homepage: https://ltbai.github.io/VITA-VLA/
机构 * Fudan University(复旦大学) ; Shanghai AI Lab(上海人工智能实验室) ; Sea AI Lab(Sea人工智能实验室)
专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.CV
机构 * Beijing Xiaomi Robot Technology Co., Ltd.(北京小米机器人科技有限公司) ; City University of Hong Kong(香港城市大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
机构 * Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) ; Institute for AI Industry Research (AIR), Tsinghua Univeristy(清华大学人工智能产业研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
Comments Accepted to CoRL 2025, project page: \url{https://zzongzheng0918.github.io/Torque-Aware-VLA.github.io/}
机构 * Intuitive Robots Lab(直观机器人实验室) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Microsoft Research(微软研究院)
专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO
Comments Published at CoRL 2025
机构 * Shanghai University(上海大学) ; Midea Group(美的集团) ; East China Normal University(华东师范大学)
专题命中 机器人基础模型 :robot foundation model(abstract);robot policy(abstract);分类 cs.RO
Comments Project webpage is available at https://chain-of-affordance.github.io
机构 * K-Scale Labs(K-Scale实验室) ; McGill University(麦吉尔大学)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO
Journal ref IROS-MoMA3 Workshop 2024
机构 * HKUST(GZ)(香港科技大学(广州)) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO
Comments 16 pages
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO
视觉分布偏移下OpenVLA故障的早期预警信号
机构 * New York University(纽约大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。
Comments 16 pages, 2 figures, 8 tables
基于动作缓存与优化的视觉-语言-动作模型免训练加速
机构 * Institute of Science Tokyo(东京科学研究所)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 针对视觉-语言-动作模型动作头计算瓶颈问题,提出ActionCache即插即用外部缓存,利用紧凑多模态键存储中间动作,可跨不同场景检索重用,在模拟和真实环境实验中显著加速推理,提升任务成功率。
DLAM:带时间约束的分布隐式动作模型
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。
VLASH: 通过未来状态感知的异步推断实现实时VLAs
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达) ; Tsinghua University(清华大学) ; UC Berkeley(加州大学伯克利分校) ; UCSD(加州大学圣地亚哥分校) ; Caltech(加州理工学院)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。
力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science and Technology(南方科技大学) ; Noematrix Ltd.(诺玛矩阵有限公司)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。
Comments Project page: https://lift-policy.github.io/
触觉模态融合用于视觉-语言-动作模型
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。
Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures
InSight: 通过可引导的VLA实现自主技能获取
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。
Comments Project website: https://insight-vla.github.io
ASCII艺术将LLMs转化为VLA控制器
机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) ; Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) ; Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。
SCALE: 基于自不确定性条件自适应观察与执行的视觉-语言-动作模型
机构 * Seoul National University(首尔国立大学)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出SCALE推理策略,利用自不确定性联合调节视觉感知和动作,无需额外训练或验证器,仅单次前向传播,提升VLA模型在模拟和真实环境中的鲁棒性。
Comments ICML 2026 Spotlight. Project page: https://dcahn12.github.io/projects/scale/
DAM-VLA: 解耦异步多模态视觉语言动作模型
机构 * Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT)(直觉机器人实验室,卡尔斯鲁厄理工学院) ; NVIDIA(英伟达) ; Robotics Institute of Germany(德国机器人研究所)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 针对VLA模型同步时钟与物理交互中不同模态频率不匹配的问题,提出DAM-VLA,通过解耦各模态时间处理、维护传感器速率更新的潜在缓冲区,并利用门控交叉注意力整合高频模态,在7个真实操作任务中平均成功率提升至95.2%。
Comments 17 pages, 8 figures
机器人策略编排的关键因素:分层VLA智能体的系统研究
机构 * Google DeepMind(谷歌DeepMind)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。