arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9186 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9186 篇

2607.10350 2026-07-20 cs.AI cs.RO 版本更新 73%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12892 2026-07-15 cs.RO cs.AI 新提交 73%

UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies

UR-VC:用于时间衍生进度代理的无监督机器人价值校正

Lirui Zhao, Modi Shi, Li Chen, Qi Liu, Ping Luo, Hongyang Li

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究针对机器人学习中时间衍生进度标签不准确问题,提出无监督机器人价值校正方法UR-VC,利用演示数据中相似状态不同时出现的规律校正标签,在真实双手布料操作任务中取得积极效果,还能用于构建优势标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 73%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09590 2026-07-13 cs.RO cs.AI 新提交 73%

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

PAC-ACT:用于动作分块变换器的训练后演员评论家方法

Yujie Pang, Zudong Li

机构 * LeRobot

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 73%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23864 2026-06-30 cs.RO cs.CV 73%

Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation

学习感知未来:DreamTacVLA用于接触丰富的 manipulation

Guo Ye, Zexi Zhang, Xu Zhao, Shang Wu, Haoran Lu, Shihan Lu, Han Liu

机构 * Northwestern University(西北大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DreamTacVLA通过结合高分辨率触觉图像与多尺度视觉信息,提升接触丰富任务的鲁棒性,实现95%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28133 2026-06-29 cs.RO cs.CV 新提交 73%

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

翻译作为桥接动作:将操作技能从人类迁移到机器人

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

机构 * HKU-MMLab(香港大学多媒体实验室) ByteDance Seed(字节跳动Seed)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。

Comments Project Page: https://translation-as-a-bridging-action.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27268 2026-06-26 cs.RO cs.AI 新提交 73%

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS:一种新的机器人操作具身测试时缩放框架

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) FiveAges(五时代)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。

Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 73%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 73%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15757 2026-06-23 cs.RO cs.AI 版本更新 73%

You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector

你有一张金票:用单一噪声向量改进生成式机器人策略

Omkar Patil, Ondrej Biza, Thomas Weng, Karl Schmeckpeper, Wil Thomason, Xiaohan Zhang, Kausik Sivakumar, Robin Walters, Nakul Gopalan, Sebastian Castro, Stephen Hart, Eric Rosen

机构 * Robotics and AI Institute(机器人与人工智能研究所) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。

Comments 34 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13355 2026-06-12 cs.RO cs.AI 新提交 73%

Real-Time Execution with Autoregressive Policies

基于自回归策略的实时执行

Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) Seoul National University(首尔大学) Google Research(谷歌研究院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 通过异步推理和约束解码实现自回归策略的实时执行,在保证低延迟的同时提升任务完成速度,实验表明其性能优于流匹配策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09499 2026-06-09 cs.RO cs.AI cs.CR 新提交 73%

Targeting World Models to Compromise Robot Learning Pipelines

针对世界模型以破坏机器人学习流程

Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

机构 * Northeastern University(东北大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出针对世界模型的新型数据投毒攻击方法,通过注入恶意提示或转换动态,在看似安全的数据中生成危险训练轨迹,导致下游策略不安全。

Comments 8 Pages, CoRL Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03385 2026-06-03 cs.RO cs.AI 73%

Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation

先抓取后规划与失败归因:一种用于精确且可泛化机器人操作的闭环两阶段框架

Jiahao Xu, Peiyuan Wang, Hanzhuo Zhang, Zihao Yu, Tianyu Fu, Hao Chen, Xuanhao Xiang, Jianbo Yu, Chenchen Fu, Wanyuan Wang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出GTP-FA框架,通过任务导向的两阶段抓取-规划流程和失败归因模型,在抓取和规划模块中分别注入任务先验和风险惩罚以及针对高风险初始状态进行数据收集和微调,显著提升机器人操作任务的成功率。

Comments 32 pages, project page: https://sites.google.com/view/gtp-fa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15975 2026-05-20 cs.AI cs.RO 73%

Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning

在符号世界模型上学习双层策略以实现长周期规划

Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen, Sheila A. McIlraith

机构 * Vector Institute(向量研究所) University of Toronto(多伦多大学) LAAS-CNRS(Laas--cnrs) University of Toulouse(图卢兹大学) RWTH Aachen University(亚琛工业大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出了一种结合低层模仿学习和高层符号抽象的双层策略,用于解决长周期规划问题,通过BISON系统在扩展的MetaWorld基准上验证了其在处理大量物体和长周期任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18556 2026-05-19 cs.RO cs.AI 73%

Key-Gram: Extensible World Knowledge for Embodied Manipulation

Key-Gram: 用于具身操作的可扩展世界知识

Jingjing Fan, Siyuan Li, Botao Ren, Zhidong Deng

机构 * Department of Computer Science and Technology(计算机科学与技术系) Department of Automation(自动化系)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Key-Gram框架,通过分离语言知识与视觉状态推理,提升具身控制中对组合语言指令的理解和执行能力,主要贡献是引入可扩展的外部记忆模块以提高迁移和现实世界操作性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV 73%

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10388 2026-05-12 cs.CV cs.RO 73%

Temporal Sampling Frequency Matters: A Capacity-Aware Study of End-to-End Driving Trajectory Prediction

时间采样频率至关重要:一种容量感知的端到端驾驶轨迹预测研究

Yumao Liu, Tao Liu, Xiangyu Li, Jiaxiang Li, Ke Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文研究了时间采样频率对端到端驾驶轨迹预测性能的影响,发现较小模型在低或中等频率下表现最佳,而大模型在高频率下表现更优,表明需根据模型和数据集调整采样频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08638 2026-05-12 cs.RO cs.AI 73%

Geometry Guided Self-Consistency for Physical AI

基于几何的自一致性物理AI

Yinwei Dai, Zhuofu Chen, Lijie Yang, Ravi Netravali

机构 * Princeton University(普林斯顿大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KeyStone方法,通过并行生成动作片段并聚类,返回最大簇的质心,提升任务成功率13.3%且无额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18486 2026-05-12 cs.CV cs.CL cs.RO 73%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 73%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21138 2026-04-24 cs.RO cs.AI 73%

Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems

在杂乱中导航:基于路标的目标级规划用于多机器人系统

Jiabao Ji, Yongchao Chen, Yang Zhang, Ramana Rao Kompella, Chuchu Fan, Gaowen Liu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Cisco Research(思科研究)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出了一种混合多机器人控制框架,通过引入路标和课程训练策略,解决多机器人任务和运动规划的联合优化问题,提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19730 2026-04-22 cs.LG cs.AI 73%

FASTER: Value-Guided Sampling for Fast RL

FASTER:基于价值引导的快速强化学习采样

Perry Dong, Alexander Swerdlow, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 FASTER通过建模去噪过程中的动作候选过滤作为马尔可夫决策过程,提升采样测试时间缩放的效率,减少计算成本并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 73%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17651 2026-04-21 cs.CV cs.RO 73%

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知

Siyuan Meng, Chengbo Ai

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。

Comments 18 pages, 7 tables, 1 figure, vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08410 2026-04-15 cs.CV cs.RO 73%

BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields

BLaDA: 在3DGS场域中实现语言到功能灵巧动作的桥梁

Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao, Wanjun Jia, Dongsheng Luo, Jiacheng Lin, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Key Laboratory of Advanced Manufacturing Technology of the Ministry of Education, Guizhou University(教育部贵州大学先进制造技术重点实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 BLaDA提出一个可解释的零样本框架,通过解析自然语言为结构化的六元组操作约束,结合三角功能点定位模块和3D关键点抓取矩阵转换执行模块,实现功能灵巧操作的高精度和高成功率。

Comments Code will be publicly available at https://github.com/PopeyePxx/BLaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05656 2026-04-08 cs.CV cs.AI 73%

SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation

SnapFlow:通过渐进式自我蒸馏实现流匹配视觉-语言-动作模型的一步动作生成

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * Jilin University(吉林大学) Chongqing University(重庆大学) University of Liverpool(利物浦大学) GenY

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 SnapFlow通过渐进式自我蒸馏将多步去噪压缩为单步前向传递,提升流匹配VLA模型的效率,减少延迟并提高成功率。

Comments 10 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04967 2026-04-08 cs.RO cs.LG 73%

Belief Dynamics for Detecting Behavioral Shifts in Safe Collaborative Manipulation

信念动力学在安全协作操作中检测行为转变

Devashri Naik, Divake Kumar, Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文研究了在非平稳环境中通过信念跟踪模块检测行为转变,提出UA-TOM方法在协作操作中显著降低碰撞风险,同时在跨领域实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15279 2026-04-06 cs.RO cs.CV 73%

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10394 2026-04-02 cs.RO cs.LG 73%

RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI

RoboNeuron:面向具身AI的代理驱动编排中层基础设施

Weifan Guan, Qinghao Hu, Huasen Xi, Chenxiao Zhang, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA MAICRO

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。

详情

展开后加载摘要…

URL PDF HTML 收藏