arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9157 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9157 篇

2512.11584 2025-12-15 cs.LG cs.AI cs.RO 85%

Atomic Action Slicing: Planner-Aligned Options for Generalist VLA Agents

原子动作切片:为通用VLA代理的规划对齐选项

Stefan Tabakov, Asen Popov, Dimitar Dimitrov, S. Ensiye Kiyamousavi, Vladimir Hristov, Boris Kraychev

机构 * Sofia University 'St. Kliment Ohridski(索菲亚大学 '圣克莱门特·欧里基斯基') Technical University of Sofia(索菲亚技术大学) EEMCS, University of Twente(EEMCS,特文特大学) GATE Institute, Sofia University 'St. Kliment Ohridski(GATE研究所,索菲亚大学 '圣克莱门特·欧里基斯基')

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出原子动作切片方法,通过分解长周期演示为短的原子动作,提升VLA代理的任务成功率,并公开发布相关数据集。

Comments The 41st ACM/SIGAPP Symposium On Applied Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18950 2025-11-25 cs.RO cs.CV cs.LG 85%

Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation

Compressor-VLA:基于指令的视觉标记压缩用于高效的机器人操作

Juntao Gao, Feiyang Ye, Jing Zhang, Wenjing Qian

机构 * School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) LiAuto Inc.(LiAuto公司) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology(计算智能与智能系统北京市重点实验室,北京理工大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Compressor-VLA通过指令引导的视觉标记压缩,提升机器人操作的效率与精度。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16263 2025-10-22 cs.RO cs.AI cs.CV 85%

NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?

Jierui Peng, Yanyan Zhang, Yicheng Duan, Tuo Liang, Vipin Chaudhary, Yu Yin

机构 * Department of Computer & Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Homepage: https://vulab-ai.github.io/NEBULA-Alpha/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16845 2025-10-15 cs.CV cs.AI cs.LG 85%

NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows

Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Nikita Lyubaykin, Andrei Polubarov, Alexander Derevyagin, Vladislav Kurenkov

机构 * ETH Zürich(苏黎世联邦理工学院) MIPT(莫斯科国立信息安全大学) Skoltech(斯克里普斯基技术大学) Innopolis University(因诺波利斯大学) HSE(俄罗斯高等经济学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI、cs.LG

Comments https://github.com/dunnolab/NinA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07134 2025-10-09 cs.RO cs.AI cs.CV 85%

TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking

Jiahang Liu, Yunpeng Qi, Jiazhao Zhang, Minghan Li, Shaoan Wang, Kui Wu, Hanjing Ye, Hong Zhang, Zhibo Chen, Fangwei Zhong, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot USTC(中国科学技术大学) BAAI(北京人工智能研究院) Beihang University(北京航空航天大学) SUSTech(四川大学) Beijing Normal University(北京师范大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project page: https://pku-epic.github.io/TrackVLA-plus-plus-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23224 2025-09-30 cs.RO cs.AI cs.CV cs.SY eess.SY 85%

Leave No Observation Behind: Real-time Correction for VLA Action Chunks

Kohei Sendai, Maxime Alvarez, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09674 2025-09-12 cs.RO cs.AI cs.CL cs.LG 85%

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning

Haozhan Li, Yuxin Zuo, Jiale Yu, Yuhao Zhang, Zhaohui Yang, Kaiyan Zhang, Xuekai Zhu, Yuchen Zhang, Tianxing Chen, Ganqu Cui, Dehui Wang, Dingxiang Luo, Yuchen Fan, Youbang Sun, Jia Zeng, Jiangmiao Pang, Shanghang Zhang, Yu Wang, Yao Mu, Bowen Zhou, Ning Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05485 2025-05-13 cs.RO cs.AI cs.CV 85%

HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation

Yi Li, Yuquan Deng, Jesse Zhang, Joel Jang, Marius Memmel, Raymond Yu, Caelan Reed Garrett, Fabio Ramos, Dieter Fox, Anqi Li, Abhishek Gupta, Ankit Goyal

机构 * NVIDIA University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments update related work and results on VQA benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11974 2024-12-18 cs.RO cs.AI cs.CL cs.CV 85%

Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning

Qi Sun, Pengfei Hong, Tej Deep Pala, Vernon Toh, U-Xuan Tan, Deepanway Ghosal, Soujanya Poria

专题命中 VLA模型 :action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05821 2024-12-10 cs.RO cs.CV cs.LG 85%

Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks

Pranav Guruprasad, Harshvardhan Sikka, Jaewoo Song, Yangyue Wang, Paul Pu Liang

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

Comments 16 Pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 84%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17484 2026-08-19 cs.RO 新提交 84%

Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies

检索前先复用:诊断具身多模态策略测试时增强的余量与互补性

Yuhwan Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出通过可恢复余量与检索互补性两个因素,为具身多模态冻结 VLA 策略的测试时增强选择采样或检索干预,在 LIBERO 上成功提升最高 21.0 个百分点,且可迁移至其他机器人与环境。

Comments Accepted to ECCV 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17209 2026-08-19 cs.RO cs.AI cs.CV cs.LG 新提交 84%

Teach and Grow: An Agent-Centered Architecture for General Robot Learning

教学与成长:面向通用机器人学习的智能体中心架构

Chang Nie, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出TGL智能体中心架构,通过将演示转化为可复用技能块,无需特定任务再训练即可实现通用机器人学习,在LIBERO评估中达SOTA性能,还提出相关缩放定律假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 84%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10413 2026-08-12 cs.CV 新提交 84%

DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

DriveVLA-M0:面向自动驾驶的故障感知记忆增强方法

Zebin Xing, Yupeng Zheng, Qiang Chen, Linbo Wang, Yichen Zhang, Pengxuan Yang, Junli Wang, Deheng Qian, Xiaoqing Ye, Junyu Han, Yifeng Pan, Qichao Zhang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd.(重庆长安科技有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出DriveVLA-M0,一种具备故障感知潜在记忆的检索增强型VLA模型,通过故障案例记忆与针对性修正机制,在NAVSIM基准上优于现有方法,实现自动驾驶性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 84%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 84%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04527 2026-08-10 cs.RO 版本更新 84%

Retrieve in Time, Correct in Frequency

及时检索,频率校正

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) Everwise-Tech Co., Ltd.(恒智慧科技有限公司) Tongji University(同济大学) Fudan University(复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05999 2026-08-07 cs.RO 新提交 84%

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

超越扁平策略:面向机器人操作具身智能体的分层后训练

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 84%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 84%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29569 2026-08-03 cs.RO cs.SY eess.SY 新提交 84%

Safe Vision Language Action Models via Barrier Enhanced Flow Matching

基于障碍增强流匹配的安全视觉语言动作模型

Kasra Sinaei, Hung-Chieh Wu, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 VLA模型 :vision language action(title);action model(title);分类 cs.RO

AI总结 该研究提出将流匹配生成模型与控制障碍函数安全保证结合的模块化推理框架,通过修改流匹配去噪过程实现本质安全,在不降低模型成功率的前提下完成安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14609 2026-07-17 cs.RO 新提交 84%

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

用于接触丰富的机器人操作的表示对齐触觉基础

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Lenovo CTO Organization(联想首席技术官组织) Nanyang Technological University(南洋理工大学) TeleAl, China Telecom(中国电信天翼人工智能公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13621 2026-07-16 cs.AI 新提交 84%

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

UESF-Bench:统一的具身寻找与跟随的基准测试与探究

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Qilu University of Technology(齐鲁工业大学) Xiaomi Inc(小米公司) Beijing University Of Technology(北京工业大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04600 2026-07-13 cs.RO 版本更新 84%

Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data

行动、感知、行动:从大规模自我中心人类数据中学习主动感知

Jialiang Li, Yi Qiao, Yunhan Guo, Changwen Chen, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究如何让机器人在无约束环境中实现可泛化操作,提出CoMe - VLA框架,利用大规模人类自我中心数据学习主动感知,集成认知辅助头和双轨记忆系统,经三个阶段训练模型,实验证明该方法在多场景长期任务中有强鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交 84%

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 84%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 84%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(abstract);分类 cs.RO

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30613 2026-06-30 cs.RO 84%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 84%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏