The p-spin interaction model with external field
专题命中 VLA模型 :action model(title,abstract)
Comments 57 pages
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :action model(title,abstract)
Comments 57 pages
专题命中 VLA模型 :action model(title,abstract)
Comments 8 pages, 5 figures
TrAct:通过视觉轨迹连接机器人控制与视觉预测
机构 * University of Michigan(密歇根大学) ; Stanford University(斯坦福大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。
从未来隐状态推断机器人操纵动作
机构 * DeepLeap Research(DeepLeap研究院)
专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。
在部署中学习:面向通用机器人策略的机群规模强化学习
机构 * Shanghai Innovation Institute(上海创新研究院) ; AGIBOT Finch ; Columbia University(哥伦比亚大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出LWD框架,通过机群规模的离线到在线强化学习,结合分布式隐式价值学习与伴随匹配Q学习,持续后训练通用视觉-语言-动作策略,在16台双臂机器人上实现95%平均成功率。
Comments No
多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断
机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) ; Unicom Data Intelligence, China Unicom(中国联通数据智能)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI
AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。
CompCPZ:在语言引导的机器人操作中保留多模态意图
机构 * School of Computation, Information and Technology(计算、信息与技术学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);language-conditioned robot(abstract);分类 cs.RO
AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。
更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间
机构 * Xidian University(西安电子科技大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。
Comments 19 pages, 7 pages
PACE:面向长周期具身操纵的阶段进度感知信用分配框架
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 PACE是面向长周期具身操纵的信用分配框架,通过GLC-Critic实现步骤级信用分配,结合PPD训练策略,在仿真与真实机械臂实验中较基线取得显著性能提升。
Comments 9 pages, 6 figures
用于自主可变形操作的TCAM:WBCD 2026赛道4的RMC2冠军系统
机构 * TermiTech(特米科技)
专题命中 VLA模型 :VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO
AI总结 该研究围绕TCAM框架构建自主可变形操作系统,在WBCD 2026赛道4挑战赛中以平均23秒/件的速度完成25件T恤操作,22件达标,获赛道冠军。
针对新型机器人实体的OpenVLA-OFT的RL引导
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 本文针对形态特殊的缆绳驱动并联机器人,无需实体专属数据集,通过仿真中PPO与GRPO两阶段强化学习,提升了OpenVLA-OFT的指令执行成功率,为仅靠RL生成适配全新实体的语言条件控制器提供了证据。
CheckVLA:面向长 horizon 移动操作的基于动作条件世界模型的执行时验证
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 CheckVLA 是基于动作条件世界模型的长 horizon 移动操作执行时验证方法,在 RoboCasa365 上其平均成功率比定期重规划提升 8.5 个百分点,且及时召回率显著优于仅观测及动作打乱的对照方法。
ReferTrack:用于具身视觉跟踪的先指认后跟踪
机构 * SUSTech(南方科技大学) ; Tencent Robotics X(腾讯机器人X实验室) ; Peking University(北京大学) ; Futian Laboratory(福田实验室)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。
评估具有视觉语言动作能力的机器人的不确定性和质量
机构 * Mondragon University(蒙dragon大学) ; Simula Research Laboratory(Simula研究实验室)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。
感受意外:通过残差触觉表示实现用于丰富接触操作的ResTacVLA
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村科学城) ; Dexmal(德克斯马尔)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 为解决触觉感知融入视觉语言动作模型时的模态坍塌问题,提出ResTacVLA,将触觉数据转为残差触觉表示,过滤视觉可预测动态,经矢量量化瓶颈离散化,利用视觉先验不确定性自适应控制触觉整合。
Comments 8 pages, 6 figures, 3 tables. Accepted by IROS 2026, Project page: https://awilekong.github.io/ResTacVLA/
PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Cambricon Technologies(寒武科技) ; Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。
通过智能强化学习在机器人操作中学习鲁棒执行
机构 * School of Inteligence Science and Engineering, the Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)智能科学与工程学院) ; Faculty of Robot Science and Engineering, Northeastern University(东北大学机器人科学与工程学院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 针对机器人操作面临的挑战,提出用两个互补指标评估执行质量,构建智能强化学习框架,通过高级决策恢复有效执行,在LIBERO基准测试中提升了执行成功率,增强了执行鲁棒性。
从更少中学习更多:事后诸葛亮式强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Stanford University(斯坦福大学) ; University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.LG
AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。
基于机载视觉语言模型的多智能体机器人控制
机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision language action(abstract);分类 cs.RO
AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。
Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)
MobileEgo Anywhere:基于商用硬件的长时域自我中心数据开放基础设施
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV
AI总结 提出MobileEgo Anywhere框架,利用智能手机传感器实现超过一小时的自我中心轨迹采集,并发布开源处理流水线STERA、移动应用及200小时数据集,验证其在视觉-语言-动作模型训练中的有效性。
OpenSPM:一种环境可迁移的机器人关键空间位姿记忆与闭环高频流匹配动作生成模型
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出OpenSPM框架,通过空间位姿记忆和流匹配动作生成模型,实现开放环境桌面机器人操作的高频、精确控制,在LIBERO-GOAL任务中达到85.6%成功率和1033.3 Hz等效控制频率。
Comments Preprint
人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DeepCybo ; ZGCA ; ZGCI ; Harbin Institute of Technology(哈尔滨工业大学) ; Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北京航空航天大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。
Comments 20 pages, 9 figures
ExploreVLA: 为端到端自动驾驶的密集世界建模与探索
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV
AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。
Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/
基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航
机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) ; University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。
Comments International Conference on Intelligent Robots and Systems (IROS) 2026
解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示
机构 * Tsinghua University(清华大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; National University of Singapore(新加坡国立大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。
RoboRouter: 机器人操作的无训练策略路由
机构 * South China University of Technology(华南理工大学) ; Nanjing University(南京大学) ; University of New South Wales(新南威尔士大学) ; Southwest Jiaotong University(西南交通大学) ; Xiamen University(厦门大学) ; The Hong Kong Polytechnic University(香港理工大学) ; ShanghaiTech University(上海科技大学) ; University of Zaragoza(巴塞罗那大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出RoboRouter,一种无需训练的策略路由框架,通过维护异构策略池并基于历史经验选择最优策略,在模拟和真实环境中分别提升平均成功率超过3%和13%。
Comments We need to withdraw the paper as some of the reference papers are incorrect and need to be removed
HiL-ResRL: 通过人在回路残差强化学习的模型无关微调适配器
机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司云机器人实验室) ; South China University of Technology(华南理工大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出一种模型无关的即插即用微调流程,通过残差策略和人在回路指导,在1.5小时内使机器人操作成功率超过95%。
Comments 8 pages, 9 figures
T-Rex: 触觉反应灵巧操作
机构 * UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达) ; Stanford(斯坦福大学) ; Panasonic(松下) ; La Sapienza University(罗马大学) ; ItalAI
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。
Comments Project page: https://tactile-rex.github.io/
用于机器人操作中一步流匹配的可逆神经网络适配器
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出可逆神经网络适配器,通过一步去噪过程生成高维动作,降低推理复杂度并保持精度,在仿真和真实实验中提升效率。
DREAM-Chunk:基于潜在世界模型的反应式动作分块
机构 * Purdue University(普渡大学) ; Stanford University(斯坦福大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出DREAM-Chunk方法,通过轻量级潜在世界模型在测试时采样多个候选动作分块并选择最优执行,提升动作分块策略在随机动态下的鲁棒性。