arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 177 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 177 篇

2608.06374 2026-08-07 cs.RO 新提交 79%

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作

Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04428 2026-08-06 cs.AR cs.LG 新提交 79%

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris:通过比特级稀疏性和推测性推理实现具身AI中的实时VLA推理

Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

专题命中 机器人基础模型 :embodied AI(title,abstract);分类 cs.LG

AI总结 Deltoris作为算法-硬件协同设计框架,通过时间感知比特级稀疏性、推测性推理及定制加速器,实现具身AI中实时VLA推理,加速比显著且精度相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16636 2026-07-21 cs.RO 新提交 79%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 机器人基础模型 :embodied agent(title);world model(abstract);分类 cs.RO

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交 79%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03146 2026-07-07 cs.RO 新提交 79%

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

Exp2VLA:通过专家示范实现无人机导航的视觉-语言-动作

Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar, Erdal Kayacan

机构 * Isaac Lab(艾萨克实验室)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO

AI总结 提出用于语言条件无人机导航的专家蒸馏管道Exp2VLA,将专家行为提炼为训练数据微调紧凑VLA模型,实现控制策略转移,降低新行为部署难度,实验表明微调模型可处理多样语义命令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01088 2026-07-02 cs.RO cs.DC 新提交 79%

ROSA: A Robotics Foundation Model Serving System for Robot Factories

ROSA: 面向机器人工厂的基础模型服务系统

Wenqi Jiang, Jason Clemons, Rowland O'Flaherty, Hugo Hadfield, Alperen Degirmenci, Shuran Song, Yashraj Narang, Christos Kozyrakis

机构 * NVIDIA Research(英伟达研究院) Stanford University(斯坦福大学)

专题命中 机器人基础模型 :robotics(title,abstract);分类 cs.RO

AI总结 提出ROSA系统,通过共享GPU池服务、多模型流水线支持和工厂目标驱动调度,将机器人工厂的RFM推理性能提升12倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23589 2026-06-23 cs.RO 新提交 79%

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

KEMO: 面向长程机器人操作的VLA策略事件驱动关键帧记忆

Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li

机构 * Hong Kong Embodied AI Lab(香港具身智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 提出KEMO,一种轻量级插件式记忆框架,通过事件驱动选择关键帧并编码为紧凑记忆令牌,结合交叉注意力和门控残差融合,提升VLA策略在长程操作中的任务成功率23.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 79%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 机器人基础模型 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10495 2026-06-16 cs.RO 新提交 79%

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models

Act on What You See: 在视觉-语言-动作模型中解锁安全社交导航

Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha

机构 * University of Maryland(马里兰大学) University of Southern California(南加州大学)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO

AI总结 提出SALSA框架,通过两阶段无标注后训练(社交行为对齐和时间安全对齐),使预训练VLA模型利用已有表征实现安全社交导航,减少86.4%的近距离碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12956 2026-06-12 cs.RO 新提交 79%

SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation

SERF:面向长时域移动操作任务的时空环境与机器人特征地图

Sunghwan Kim, Byeonghyun Pak, Kehan Long, Yulun Tian, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Agency for Defense Development(国防发展局) SceniX Inc.(SceniX公司) University of Michigan(密歇根大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 提出SERF地图,将环境与机器人身体表示为共享潜空间中的神经点,并在线更新,作为VLA模型的状态输入,提升长时域移动操作中的推理能力,在BEHAVIOR-1K上优于纯图像基线。

Comments Project page: https://existentialrobotics.org/serf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12859 2026-06-12 cs.RO 新提交 79%

AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots

AIR-VLA+: 通过级联双动作解码器与非对称MoE解耦空中机器人的移动与操作

Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) Information Science, East China Normal University(华东师范大学信息科学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 针对空中机器人移动与操作在动作尺度、动力学和控制目标上的显著差异,提出级联双动作解码器与非对称MoE架构,实现解耦协调控制,在AIR-VLA基准上取得48.0平均分,任务完成度提升80.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07723 2026-06-09 cs.RO 新提交 79%

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

VoLo: 面向开放词汇长时程操控的物理编排器

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

机构 * NVIDIA(英伟达) University of Michigan(密歇根大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15636 2026-08-18 cs.RO cs.AI 新提交 79%

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

结合推测推理与验证的高效VLA推理的算法-架构协同设计

Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对VLA模型推理延迟高、动作长度有限的问题,提出SpecVLA算法-架构协同框架,通过状态感知推理、sVLA验证模型与异构架构,在保持任务成功率的同时降低延迟,实现高效可靠的实时机器人操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13453 2026-08-14 cs.CV cs.AI 新提交 79%

UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models

UniTexture:面向视觉-语言-动作模型的跨任务通用对抗纹理

Yukun Dai, Mingzhe Dai, Tianshi Wang, Fengling Li, Jingjing Li, Lei Zhu

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 该研究提出UniTexture跨任务通用对抗纹理攻击,通过单个带纹理3D物体诱导VLA动作预测偏差,在OpenVLA等模型上可显著降低任务成功率,且具备跨套件与跨模型迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20246 2026-06-23 cs.RO cs.AI 新提交 79%

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

微调视觉-语言-动作模型所需的层数比你想象的少

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics University of Arkansas(阿肯色大学) Technical University of Denmark(丹麦技术大学) Hanoi University of Science and Technology(河内科技大学) KAIST(韩国科学技术院) Monash University(莫纳什大学) Oldenburg University(奥尔登堡大学) DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Stanford University(斯坦福大学) Technische Universität Darmstadt(达姆施塔特工业大学)

专题命中 机器人基础模型 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08107 2026-06-09 cs.RO cs.AI 新提交 79%

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

Ego-Pi: 面向自我中心人类与机器人数据的VLA微调

Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong Zhao, Jeff Lai, Chelsea Finn

机构 * Stanford University(斯坦福大学) Meta

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 为解决机器人数据稀缺问题,利用自我中心人类数据,基于π₀.₅模型微调,使机器人学习新任务语义并组合现有技能,无需对应机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19490 2026-08-21 cs.RO cs.CV cs.LG 新提交 78%

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

通过自演示生成控制对视觉-语言动作(VLA)模型进行微调以实现多任务操作

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.CV、cs.LG

AI总结 本文针对VLA模型部署到新机器人时因硬件不匹配导致性能下降的问题,提出自监督方法生成在线交互rollout数据微调VLA模型,使模型在目标机器人上同时具备先验任务能力、指令遵循能力与高效学习新技能的能力。

Comments Project Page: https://self-supervised-control.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 77%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12497 2026-06-12 cs.LG cs.RO 新提交 76%

$μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models

$μ$VLA:部分可观测操作中VLA模型的循环记忆研究

Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky, Aydar Bulatov, Artem Pshenitsyn, Yuri Kuratov, Alexey Skrynnik, Aleksandr I. Panov, Alexey K. Kovalev

机构 * CogAI Lab, Moscow, Russia(CogAI实验室,莫斯科,俄罗斯) MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG

AI总结 针对VLA模型在部分可观测场景中的记忆缺失问题,提出仅通过可学习记忆令牌和截断反向传播时间实现最小化循环记忆增强,在MIKASA-Robo上将训练任务成功率从0.42提升至0.84,并在LIBERO上保持全可观测性能。

Comments 34 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交 75%

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 75%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交 75%

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16172 2026-08-18 cs.RO 新提交 74%

SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation

SparkVLA:用于长程操作的停止感知分层视觉-语言-动作(VLA)模型,结合自适应动作分块

Xunyao Lei, Renjun Wu, Tianlin Huo, Xuesong Li

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO

AI总结 针对分层VLA系统中停止与动作分块决策孤立评估的问题,提出SparkVLA,通过统一排序解决依赖,在RoboCerebra上取得显著性能提升,真实机器人实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15269 2026-08-18 cs.RO 新提交 74%

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间

Dai Zhou, Jiexi Yan, Tong Li, Yuxuan Wang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 机器人基础模型 :robotic(title);分类 cs.RO

AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。

Comments 19 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22836 2026-06-23 cs.RO 新提交 74%

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Cloak: 通过遮蔽末端执行器实现零样本跨本体操作

Michael Piseno, Guy Tevet, C. Karen Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO

AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15502 2026-08-18 cs.AI cs.RO 新提交 73%

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

EcoVLA:面向实时约束的视觉-语言-动作模型的节能设备-边缘协同推理

Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang

机构 * Beihang University(北京航空航天大学) Beijing University of Technology(北京工业大学)

专题命中 机器人基础模型 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 EcoVLA是面向VLA模型的自适应设备-边缘协同推理框架,可在实时约束下最大化能效,提升能效达236%,同时保持服务水平目标满足。

Comments Accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14822 2026-08-18 cs.RO cs.CV 新提交 73%

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

想象恢复:视觉-语言-动作模型的推理时反事实重对齐

Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对VLA模型易受在线干扰的问题,提出无需训练的CoRe框架,通过反事实想象与最小重对齐实现无试错恢复,大幅提升任务成功率并减少物理恢复操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 73%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03231 2026-08-05 cs.RO cs.AI 新提交 73%

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏