arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 584 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 584 篇

2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 75%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 75%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06001 2026-07-03 cs.RO cs.AI cs.CV 版本更新 75%

Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration

恢复VLA模型中的语言基础:无需训练的注意力重校准方法

Ninghao Zhang, Bin Zhu, Shijie Zhou, Jingjing Chen

机构 * Tsinghua University(清华大学) Singapore Management University(新加坡管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18960 2026-06-16 cs.LG cs.CV cs.RO 版本更新 75%

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型

Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu

机构 * LiAuto Inc.(LiAuto公司) Beijing University of Technology(北京理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。

Comments Accepted at CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交 75%

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03598 2026-06-04 cs.RO cs.AI cs.CV 75%

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。

Comments 20 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29562 2026-05-29 cs.RO cs.AI cs.CV 75%

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

VLA-Pro:面向视觉-语言-动作模型的跨任务程序性记忆迁移

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.(上海新智具身智能技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLA-Pro框架,通过存储和检索任务相关的LoRA适配器作为程序性记忆,实现跨任务泛化,在仿真和真实任务中成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22896 2026-05-25 cs.RO cs.AI cs.LG 75%

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models

Agentic-VLA:视觉-语言-动作模型的高效在线自适应

Ruofan Jin, Zaixi Zhang

机构 * Ruofan Jin(金鲁凡) Zaixi Zhang(张在西)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Agentic-VLA框架,通过自适应奖励合成、语言引导探索和经验记忆三大创新,实现VLA模型在线高效自适应,在LIBERO基准上长时域任务提升12.3%,单样本学习提升28.5%,并实现零演示跨任务迁移。

Comments Total 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14148 2026-05-08 cs.RO cs.AI cs.LG 75%

AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models

AsyncVLA: 视觉-语言-动作模型中的异步流匹配

Yuhua Jiang, Shuang Cheng, Yan Ding, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Lumos Robotics(Lumos机器人)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出AsyncVLA,一种引入异步流匹配的视觉-语言-动作模型框架,通过非均匀时间调度和自修正机制提升长周期任务的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24921 2026-04-29 cs.RO cs.AI cs.CL cs.CV 75%

Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System

Libra-VLA:通过异步粗到细双系统实现学习平衡

Yifei Wei, Linqing Zhong, Yi Liu, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren

机构 * Beihang University(北航) AgiBot

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Libra-VLA通过粗到细双系统架构,解决视觉-语言-动作模型在机器人操作中语义与动作间的鸿沟问题,实现训练平衡与高效执行。

Comments Accepted to the Main Conference of ACL 2026. Project page: https://libra-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14523 2026-03-17 cs.CV cs.AI cs.RO 75%

VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

VLA-Thinker: 通过图像推理增强视觉-语言-动作模型

Chaoyang Wang, Wenrui Bao, Sicheng Gao, Bingxin Xu, Yu Tian, Yogesh S. Rawat, Yunhao Ge, Yuzhang Shang

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出VLA-Thinker框架,通过动态可调用的推理动作提升视觉语言动作模型的能力,通过两阶段训练流程提升操控性能,在LIBERO和RoboTwin 2.0基准上取得显著成果。

Comments We introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01914 2025-11-05 cs.CV cs.AI cs.RO 75%

iFlyBot-VLA Technical Report

Yuan Zhang, Chenyu Xue, Wenjie Xu, Chao Ji, Jiajia wu, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10274 2025-10-14 cs.RO cs.AI cs.CV 75%

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

Jinliang Zheng, Jianxiong Li, Zhihao Wang, Dongxiu Liu, Xirui Kang, Yuchun Feng, Yinan Zheng, Jiayin Zou, Yilun Chen, Jia Zeng, Ya-Qin Zhang, Jiangmiao Pang, Jingjing Liu, Tai Wang, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究院(AIR)清华大学) Shanghai AI Lab(上海人工智能实验室) Peking University(北京大学)

专题命中 机器人基础模型 :robot learning(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments preprint, technical report, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14734 2025-03-28 cs.RO cs.AI cs.LG 75%

GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

NVIDIA, :, Johan Bjorck, Fernando Castañeda, Nikita Cherniadev, Xingye Da, Runyu Ding, Linxi "Jim" Fan, Yu Fang, Dieter Fox, Fengyuan Hu, Spencer Huang, Joel Jang, Zhenyu Jiang, Jan Kautz, Kaushil Kundalia, Lawrence Lao, Zhiqi Li, Zongyu Lin, Kevin Lin, Guilin Liu, Edith Llontop, Loic Magne, Ajay Mandlekar, Avnish Narayan, Soroush Nasiriany, Scott Reed, You Liang Tan, Guanzhi Wang, Zu Wang, Jing Wang, Qi Wang, Jiannan Xiang, Yuqi Xie, Yinzhen Xu, Zhenjia Xu, Seonghyeon Ye, Zhiding Yu, Ao Zhang, Hao Zhang, Yizhou Zhao, Ruijie Zheng, Yuke Zhu

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Authors are listed alphabetically. Project leads are Linxi "Jim" Fan and Yuke Zhu. For more information, see https://developer.nvidia.com/isaac/gr00t

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02359 2024-11-05 cs.RO cs.AI cs.LG 75%

DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution

Yang Yue, Yulin Wang, Bingyi Kang, Yizeng Han, Shenzhi Wang, Shiji Song, Jiashi Feng, Gao Huang

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 25 pages, 6 figures, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16172 2026-08-18 cs.RO 新提交 74%

SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation

SparkVLA:用于长程操作的停止感知分层视觉-语言-动作(VLA)模型,结合自适应动作分块

Xunyao Lei, Renjun Wu, Tianlin Huo, Xuesong Li

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO

AI总结 针对分层VLA系统中停止与动作分块决策孤立评估的问题,提出SparkVLA,通过统一排序解决依赖,在RoboCerebra上取得显著性能提升,真实机器人实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15269 2026-08-18 cs.RO 新提交 74%

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间

Dai Zhou, Jiexi Yan, Tong Li, Yuxuan Wang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 机器人基础模型 :robotic(title);分类 cs.RO

AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。

Comments 19 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22836 2026-06-23 cs.RO 新提交 74%

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Cloak: 通过遮蔽末端执行器实现零样本跨本体操作

Michael Piseno, Guy Tevet, C. Karen Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO

AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15502 2026-08-18 cs.AI cs.RO 新提交 73%

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

EcoVLA:面向实时约束的视觉-语言-动作模型的节能设备-边缘协同推理

Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang

机构 * Beihang University(北京航空航天大学) Beijing University of Technology(北京工业大学)

专题命中 机器人基础模型 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 EcoVLA是面向VLA模型的自适应设备-边缘协同推理框架,可在实时约束下最大化能效,提升能效达236%,同时保持服务水平目标满足。

Comments Accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14822 2026-08-18 cs.RO cs.CV 新提交 73%

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

想象恢复:视觉-语言-动作模型的推理时反事实重对齐

Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对VLA模型易受在线干扰的问题,提出无需训练的CoRe框架,通过反事实想象与最小重对齐实现无试错恢复,大幅提升任务成功率并减少物理恢复操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-08-18 cs.CV cs.RO 版本更新 73%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09430 2026-08-17 cs.RO cs.AI 版本更新 73%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01265 2026-08-11 cs.RO cs.CV 版本更新 73%

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

作为视觉-语言-动作模型轨迹先验的埃尔米特曲线

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏赛克德智能科技有限公司) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作模型动作块的弱结构化问题,提出埃尔米特轨迹先验,其中埃尔米特正则化变体在仿真与真实机器人任务中显著提升了操纵成功率且无额外推理开销。

Comments Project page is available at https://aopolin-lv.github.io/Hermite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 73%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03231 2026-08-05 cs.RO cs.AI 新提交 73%

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29169 2026-08-03 cs.RO cs.AI 新提交 73%

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

ActFovea:基于时空视觉-动作一致性的VLA策略运行时安全保障

Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ActFovea是一种即插即用的VLA策略运行时安全保障框架,通过构建动作条件化凹形区域、检测时空一致性及触发安全故障,提升了机器人操纵在各类干扰下的成功率与安全性。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/SunnyYWD/ActFovea.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27782 2026-07-31 cs.RO cs.AI 新提交 73%

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

RedFlow:将失败重定向为流匹配VLA策略的动作级修正

Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RedFlow是将失败转化为动作级修正监督的离线RL框架,在LIBERO基准及真实操纵任务上,其真实成功率达74.7%,优于现有离线RL基线,样本量仅为强在线方法的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 73%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18236 2026-07-21 cs.RO cs.LG 新提交 73%

Patch Policy: Efficient Embodied Control via Dense Visual Representations

补丁策略:通过密集视觉表示实现高效具身控制

Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

机构 * Courant Institute, New York University(纽约大学柯朗数学科学研究所) Meta-FAIR(Meta FAIR) AMI Labs(AMI 实验室)

专题命中 机器人基础模型 :robotics(abstract);robot learning(abstract);分类 cs.RO、cs.LG

AI总结 研究利用预训练密集视觉特征,提出补丁策略,通过块因果注意力掩码等实现高效具身控制。该策略轻量级、快速且高效,在模拟和真实环境中相比其他策略有显著提升,为机器人社区利用视觉表示学习提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏