HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化
专题命中 机器人基础模型 :robotic(abstract);分类 cs.LG
AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化
专题命中 机器人基础模型 :robotic(abstract);分类 cs.LG
AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。
VLAConf: 视觉-语言-动作模型的校准任务成功置信度
机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学电子与电气工程系,深圳,中国) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; National Cybersecurity Academy, Wuhan University, Wuhan, China(武汉大学国家网络安全学院,武汉,中国)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 提出VLAConf,一种基于单类判别性置信度框架的方法,通过冻结预训练VLA内部表示和轻量级置信度头,在单次前向传播中直接估计逐步异常分数,实现高效且跨架构通用的任务成功置信度估计。
Comments 10 pages, 6 figures
SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO
AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。
Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness
及时检索,频率校正
机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) ; Everwise-Tech Co., Ltd.(恒智慧科技有限公司) ; Tongji University(同济大学) ; Fudan University(复旦大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。
τ:从未来视觉监督中学习触觉增强的视觉-语言-动作模型
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 研究旨在解决学习触觉表示并应用于VLA模型的挑战,提出τ框架从未来视觉监督学习动作条件时空触觉表示,结合视觉语言特征用于动作生成,引入TacAura数据集,实验证明其性能优于现有模型且能泛化。
STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xidian University(西安电子科技大学)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO
AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
通过预言强化行动策略
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO
AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。
RynnBrain 1.1:迈向更具能力和通用性的具身基础模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。
Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11
CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力
Comments Project Page: https://dannymcy.github.io/cyclevla/
RouterVLA:将冒烟测试转化为异构VLA选择的监督信号
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; Tsinghua University(清华大学)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO
AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。
Comments v2: revised title, updated author list, restructured the experiments
Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。
Comments 13 pages, 3 figures, 4 tables
诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败
机构 * SimpleAI
专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO
AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。
Journal ref RSS SemRob Workshop 2026
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
行动、感知、行动:从大规模自我中心人类数据中学习主动感知
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 研究如何让机器人在无约束环境中实现可泛化操作,提出CoMe - VLA框架,利用大规模人类自我中心数据学习主动感知,集成认知辅助头和双轨记忆系统,经三个阶段训练模型,实验证明该方法在多场景长期任务中有强鲁棒性和适应性。
StereoVLA:利用立体视觉增强视觉-语言-动作模型
机构 * Galbot ; CFCS, School of CS, Peking University(北京大学计算机学院CFCS) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The University of Hong Kong(香港大学) ; Xiamen University Malaysia(厦门大学马来西亚分校) ; Southern University of Science and Technology(南方科技大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。
IVRA: 通过无需训练的提示引导改善机器人动作策略的视觉-令牌关系
机构 * Stony Brook University(石溪大学) ; ETRI(电子技术研究院)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 提出IVRA方法,利用模型内置视觉编码器的亲和力提示,无需额外编码器或重训练,在推理时调整视觉-令牌交互以增强空间理解,在多种VLA架构和任务上提升操作成功率。
基于VLA的驾驶系统的安全案例模式:来自SimLingo的见解
机构 * York University(约克大学) ; National Institute of Informatics(国家信息研究所)
专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO
AI总结 针对VLA驾驶系统提出RAISE安全案例设计方法,通过扩展HARA和定制模式,结合SimLingo案例验证其构建基于证据的安全声明的有效性。
CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型
机构 * University of Arkansas(亚拉巴马大学) ; Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学) ; Center of AI Research, VinUniversity(Vin大学人工智能研究中心) ; TU Wien(维也纳技术大学) ; University of Liverpool(利物浦大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 CodeGraphVLP结合语义图状态与可执行代码规划器,提升非马尔可夫长周期任务的视觉语言动作执行效率,降低规划延迟并提高任务完成率。
稀疏自编码器揭示VLA模型中可解释且可操控的特征
机构 * Department of Mechanical Engineering(机械工程系) ; Department of Computer Science(计算机科学系) ; Department of Aeronautics & Astronautics(航空与航天系)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 本文通过训练稀疏自编码器揭示VLA模型中可解释且可操控的特征,验证了其在不同任务和场景中的可迁移性。
Comments 24 pages, 11 figures