arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 584 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 584 篇

2606.16253 2026-06-16 cs.CV cs.AI 新提交 62%

Learned Image Compression for Vision-Language-Action Models

面向视觉-语言-动作模型的图像压缩学习

Hyeonjun Kim, Jegwang Ryu, Sangbeom Ha, Junhyeok Lee, Jun-Hyuk Kim, Hyemin Ahn, Jaeho Lee

机构 * POSTECH(浦项科技大学) Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出SPARC框架,通过自适应比特率分配和倾斜率损失,在低带宽下保持VLA机器人控制性能,优于传统编解码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12978 2026-06-16 cs.RO cs.CV cs.SY eess.SY 新提交 62%

Trajectory-Level Redirection Attacks on Vision-Language-Action Models

轨迹级重定向攻击对视觉-语言-动作模型

Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda, Hooshang Nayyeri, Dilek Hakkani-Tür, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文发现VLA模型存在轨迹级漏洞:看似保留原始指令的对抗性提示,能重定向机器人最终物理结果,并提出了命令保持的轨迹重定向威胁模型和在线提示搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10862 2026-06-16 cs.CV cs.AI 新提交 62%

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

LIBERO-Occ:通过视角想象评估和改进场景诱导遮挡下的视觉-语言-动作模型

Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 针对VLA模型在场景遮挡下性能下降的问题,提出LIBERO-Occ基准和视角想象方法,通过生成互补视图提升鲁棒性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21391 2026-06-16 cs.RO cs.AI 版本更新 62%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14375 2026-06-15 cs.RO cs.AI 新提交 62%

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models

弹性查询强化学习:VLA模型的自我感知策略执行

Ge Wang, Xinyu Tan, Xiang Li, Man Luo, Chengsi Yao, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xiangyuan Wang, Zhixin Mai, Yiming Zhao, Yatong Han, Zhen Li

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出弹性查询强化学习(EQRL),通过轻量级潜在调度适配器动态调整VLA模型的推理步骤和动作块长度,利用评论家集成分歧估计状态难度,在降低推理成本的同时保持或提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11743 2026-06-11 cs.RO cs.GR cs.LG 新提交 62%

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

TacCoRL: 通过仿真将触觉反馈集成到视觉-语言-动作模型中

Siyu Ma, Yuqi Liang, Chang Yu, Yunuo Chen, Hao Su, Yixin Zhu, Yin Yang, Chenfanfu Jiang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Utah(犹他大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出TacCoRL框架,通过仿真与真实联合训练和强化学习,将触觉反馈注入视觉-语言-动作策略,在接触密集型任务中平均成功率提升22.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14836 2026-06-10 cs.CV cs.RO 版本更新 62%

QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models

QDepth-VLA:量化深度预测作为视觉-语言-动作模型的辅助监督

Yixuan Li, Yuhui Chen, Mingcai Zhou, Haoran Li, Zhengtao Zhang, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongke Huiling Robot Technology Co.(北京中科创联机器人科技有限公司)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出QDepth-VLA框架,通过辅助深度预测任务增强VLA模型的空间感知与推理能力,在仿真和真实任务中提升操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 62%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07895 2026-06-09 cs.CV cs.RO 新提交 62%

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA: 时序块扩散视觉语言动作模型

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出TBD-VLA框架,通过时序块扩散机制实现离散令牌VLA模型的并行动作生成,兼顾时序连贯性与推理速度,在仿真和真实任务中优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04708 2026-06-05 cs.RO cs.AI 62%

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

VISTA: 基于视觉和物理验证的UMI数据适配用于VLA训练

Siyuan Yang, Linzheng Guo, Ouyang Lu, Zhaxizhuoma, Daoran Zhang, Xinmiao Wang, Ting Xiao, Fangzheng Yan, Zhijun Chen, Yan Ding, Chao Yu, Chenjia Bai, Xuelong Li

机构 * Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Lumos Robotics(Lumos机器人) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Harbin Engineering University(哈尔滨工程大学) Fudan University(复旦大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出VISTA框架,通过UMI-VQA数据集对齐视觉表示、物理验证流水线筛选可行轨迹以及两阶段联合训练,解决UMI数据训练VLA模型时的视觉分布偏移和物理不可行动作问题。

Comments Corrected the typing error

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 62%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02775 2026-06-03 cs.AI cs.AR cs.DC cs.PF cs.RO 62%

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

AURA: 恒定VRAM下机器人策略的动作门控记忆

Josef Chen

机构 * KAIKAKU(卡基库)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 提出AURA-Mem,一种恒定大小、基于动作误差信号门控写入的循环记忆,替代KV缓存,在边缘机器人任务中实现与基线相当的准确率,同时减少5-9倍写入次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14323 2026-06-02 cs.CR cs.AI cs.RO 62%

SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models

SilentDrift: 利用动作分块对视觉-语言-动作模型进行隐蔽后门攻击

Bingxin Xu, Yuzhang Shang, Binghui Wang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中央佛罗里达大学) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型中的动作分块与增量位姿表示导致的视觉开环漏洞,提出一种利用平滑步函数构建满足C2连续扰动的隐蔽黑盒后门攻击方法SilentDrift,并通过关键帧攻击策略实现高攻击成功率与低中毒率。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30834 2026-06-01 cs.RO cs.AI 62%

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

轨迹中的捉迷藏:发现VLA运行时监控的失败信号

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出Hide-and-Seek框架,通过轨迹间和轨迹内对比学习,从轨迹级监督中定位失败指示动作,实现无需步骤标注的VLA模型运行时失败检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30660 2026-06-01 cs.LG cs.RO 62%

BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies

BOKBO (Best of K Bad Options): VLA策略的校准式弃权

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 针对视觉-语言-动作(VLA)策略的测试时扩展方法,提出首个共形弃权层BOKBO,通过全局和逐任务变体提供有限样本无分布保证的执行违规率控制,并揭示基于扰动的K采样下策略内部非一致性分数的结构性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28726 2026-05-28 cs.RO cs.LG 62%

How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures

VLA如何以不同方式失败:黑盒动作监控揭示架构特定的失败特征

Krishnam Gupta

机构 * Independent Research(独立研究)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文通过黑盒动作监控发现,视觉-语言-动作(VLA)架构在电机指令层面以根本不同且可预测的方式失败,并证明架构匹配的监控器选择至关重要。

Comments Accepted at IEEE ICRA 2026 Workshop "From Data to Decisions: VLA Pipelines for Real Robots", Vienna, June 2026. Non-archival workshop. 5 pages, 2 figures, 22 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03668 2026-05-28 cs.RO cs.CV 62%

MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction

MVP-LAM:通过跨视角重建学习以动作为中心的潜在动作

Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University, Seoul, South Korea(首尔国立大学,首尔,韩国) Konkuk University, Seoul, South Korea(韩国konkuk大学,首尔,韩国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) HodooAI Labs, Seoul, South Korea(HodooAI实验室,首尔,韩国)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出MVP-LAM模型,利用多视角视频通过跨视角重建目标学习与真实动作高度相关的潜在动作,提升动作预测和下游操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 62%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15735 2026-05-19 cs.CV cs.AI 62%

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

UAM:VL A训练中遗忘的双流视角

Jianke Zhang, Yuanfei Luo, Yucheng Hu, Xiaoyu Chen, Yanjiang Guo, Ziyang Liu, Hongbin Xu, Tian Lan, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出UAM模型,通过双流架构解决VL A训练中因单一编码器导致的多模态能力下降问题,展示了通过架构分离而非冻结权重或辅助数据可实现语义保留,并在多种任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16154 2026-05-18 cs.LG cs.RO 62%

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

学习结果分歧之处:通过概率块掩码实现高效的VLA强化学习

Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出概率块掩码(PCM),通过选择性分配梯度计算来提升GRPO-based VLA RL的效率,实现更快的训练速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09410 2026-05-12 cs.RO cs.AI 62%

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA:面向视觉-语言-动作模型的恢复驱动策略优化

Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RePO-VLA框架,通过恢复驱动策略优化提升视觉-语言-动作模型在长时程接触丰富操作中的鲁棒性,通过恢复意识初始化、进度感知语义价值函数和价值条件细化等方法,提高对抗成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI 62%

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18486 2026-05-12 cs.CV cs.CL cs.RO 62%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.CV

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07474 2026-05-11 cs.CV cs.AI 62%

ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

ForgeVLA:无需语言标注的联邦视觉-语言-动作学习

Yuhao Zhou, Yunpeng Zhu, Yang Zhou, Jindi Lyu, Jian Lan, Zhangyuan Wang, Dan Si, Thomas Seidl, Qing Ye, Jiancheng Lyu

机构 * Sichuan University(四川大学) Zhejiang University(浙江大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Lenovo Group Limited(联想集团有限公司) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ForgeVLA框架,通过分布式视觉-动作对训练联邦VLA模型,无需集中数据或人工标注。通过客户端指令分类器构建完整三元组,并引入对比规划损失和自适应聚合策略以解决特征坍塌问题,实验表明性能优于基线模型。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI 62%

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01581 2026-04-28 cs.RO cs.LG 62%

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV:基于运动学的具身VLA模型的推测解码

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan), Wuhan, China(中国地质大学(武汉)计算机科学学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出KERV框架,结合token域和运动学域预测,通过运动学卡尔曼滤波和动态调整策略提升VLA模型的推理速度,实验显示在多种任务中加速27%-37%且成功率损失极小。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 62%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10698 2026-04-27 cs.CV cs.AI 62%

AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models

AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型

Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Information Technology, Carleton University(卡尔顿大学信息技术学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出AugVLA-3D框架,通过整合深度估计提升视觉-语言-动作模型的3D特征表示,增强模型在复杂3D环境中的感知与动作预测能力。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20472 2026-04-23 cs.RO cs.LG 62%

Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models

时间差校准在连续任务中的应用:用于视觉-语言-动作模型

Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano, Aviv Tamar

机构 * Technion - Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种用于连续任务的时间差校准方法,通过将Brier分数扩展到序列任务,将不确定性校准与强化学习结合,提高了视觉-语言-动作模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20347 2026-04-23 cs.RO cs.AI 62%

A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

面向自适应超声引导针插入与针跟踪的视觉-语言-动作模型

Yuelin Zhang, Qingpeng Ding, Longxiang Tang, Chengyu Fang, Shing Shin Cheng

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Automation Engineering, T Stone Robotics Institute, Shun Hing Institute of Advanced Engineering, Multi-Scale Medical Robotics Center, and Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系、T Stone机器人研究所、Shun Hing先进工程研究所、多尺度医疗机器人中心以及医学智能与XR研究所)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出视觉-语言-动作模型,用于实现自适应超声引导针插入与跟踪,通过跨深度融合和跟踪条件化注册提升跟踪精度与插入成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏