arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 200 篇

1905.05877 2019-05-16 cs.CL 50%

Extraction and Analysis of Clinically Important Follow-up Recommendations in a Large Radiology Dataset

Wilson Lau, Thomas H Payne, Ozlem Uzuner, Meliha Yetisgen

专题命中 数据集与评测 :action model(abstract)

Comments Under Review at American Medical Informatics Association Fall Symposium'2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1207.3091 2019-05-16 nlin.AO cs.IT math.IT 50%

Hidden stochastic, quantum and dynamic information of Markov diffusion process and its evaluation by an entropy integral measure under the impulse controls actions, applied to information observer

Vladimir S. Lerner

专题命中 数据集与评测 :action model(abstract)

Comments 87 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03287 2018-10-09 physics.flu-dyn 50%

Evaluation of a new cavitation erosion metric based on fluid-solid energy transfer in channel flow simulations

Gina M. Magnotti, Michele Battistoni, Kaushik Saha, Sibendu Som

专题命中 数据集与评测 :action model(abstract)

Comments 9 pages, 6 figures, ICLASS 2018, 14th Triennial International Conference on Liquid Atomization and Spray Systems, Chicago, IL, USA, July 22-26, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.07296 2018-06-20 cs.IR 50%

End-to-End Neural Ranking for eCommerce Product Search: an application of task models and textual embeddings

Eliot Brenner, Jun Zhao, Aliasgar Kutiyanawala, Zheng Yan

专题命中 数据集与评测 :action model(abstract)

Comments Accepted to appear at the SIGIR 2018 workshop on eCommerce

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.02114 2018-02-07 cs.CL 50%

Investigations on Knowledge Base Embedding for Relation Prediction and Extraction

Peng Xu, Denilson Barbosa

专题命中 数据集与评测 :action model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.07321 2017-08-23 astro-ph.HE astro-ph.SR 50%

Analyzing the Largest Spectroscopic Dataset of Hydrogen-Poor Super-Luminous Supernovae

Yu-Qian Liu, Maryam Modjaz, Federica B. Bianco

专题命中 数据集与评测 :action model(abstract)

Comments Released all code and data products on our github pages (https://github.com/nyusngroup/SESNspectraLib and https://github.com/nyusngroup/SESNtemple). Accepted by ApJ. 15 pages, 7 figures, 3 tables. No major changes, but more references & discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.04818 2016-11-16 physics.soc-ph math.PR q-bio.PE 50%

Evaluation of vaccination strategies for SIR epidemics on random networks incorporating household structure

Frank Ball, David Sirl

专题命中 数据集与评测 :action model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.07809 2016-10-26 cs.CL 50%

How Document Pre-processing affects Keyphrase Extraction Performance

Florian Boudin, Hugo Mougard, Damien Cram

专题命中 数据集与评测 :action model(abstract)

Comments Accepted at the COLING 2016 Workshop on Noisy User-generated Text (WNUT)

详情

展开后加载摘要…

URL PDF HTML 收藏
1102.2227 2015-05-27 astro-ph.CO 50%

The Allen Telescope Array Twenty-centimeter Survey -- A 700-Square-Degree, Multi-Epoch Radio Dataset -- II: Individual Epoch Transient Statistics

Steve Croft, Geoffrey C. Bower, Garrett Keating, Casey Law, David Whysong, Peter K. G. Williams, Melvyn Wright

专题命中 数据集与评测 :VLA(abstract)

Comments 28 pages, 12 figures, ApJ accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
1006.2003 2015-05-19 astro-ph.CO 50%

The Allen Telescope Array Twenty-centimeter Survey - A 690-Square-Degree, 12-Epoch Radio Dataset - I: Catalog and Long-Duration Transient Statistics

Steve Croft, Geoffrey C. Bower, Rob Ackermann, Shannon Atkinson, Don Backer, Peter Backus, William C. Barott, Amber Bauermeister, Leo Blitz, Douglas Bock, Tucker Bradford, Calvin Cheng, Chris Cork, Mike Davis, Dave DeBoer, Matt Dexter, John Dreher, Greg Engargiola, Ed Fields, Matt Fleming, James R. Forster, Colby Gutierrez-Kraybill, Gerry Harp, Tamara Helfer, Chat Hull, Jane Jordan, Susanne Jorgensen, Garrett Keating, Tom Kilsdonk, Casey Law, Joeri van Leeuwen, John Lugten, Dave MacMahon, Peter McMahon, Oren Milgrome, Tom Pierson, Karen Randall, John Ross, Seth Shostak, Andrew Siemion, Ken Smolek, Jill Tarter, Douglas Thornton, Lynn Urry, Artyom Vitouchkine, Niklas Wadefalk, Jack Welch, Dan Werthimer, David Whysong, Peter K. G. Williams, Melvyn Wright

专题命中 数据集与评测 :VLA(abstract)

Comments 41 pages, 19 figures, ApJ accepted; corrected minor typo in Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 163 篇

2603.22876 2026-06-30 cs.RO cs.AI 88%

Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究

Ruixing Jin, Zicheng Zhu, Ruixiang Ouyang, Sheng Xu, Bo Yue, Zhizheng Wu, Guiliang Liu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 部署与泛化 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16211 2025-06-23 cs.RO 86%

ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models

Puhao Li, Yingying Wu, Ziheng Xi, Wanlin Li, Yuzhe Huang, Zhiyuan Zhang, Yinghan Chen, Jianan Wang, Song-Chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Astribot Inc.(Astribot公司)

专题命中 部署与泛化 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO

Comments Website: https://controlvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09613 2026-05-12 cs.RO cs.CV 86%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 部署与泛化 :VLA(title,title_cn);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11921 2025-12-16 cs.RO cs.AI 84%

Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control

迈向可及的物理AI:基于LoRA的VLA模型在现实机器人控制中的微调

Abdullah Yahya Abdullah Omaisan, Ibrahim Sheikh Mohamed

机构 * Independent Researchers(独立研究者)

专题命中 部署与泛化 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LoRA的VLA模型微调方法,使大规模VLA模型能在消费级GPU上高效运行,实现在低成本机器人平台上的现实部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 83%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 部署与泛化 :embodied foundation model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16444 2026-02-20 cs.RO cs.AI cs.LG 82%

RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation

RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务

Yixue Zhang, Kun Wu, Zhi Gao, Zhen Zhao, Pei Ren, Zhiyuan Xu, Fei Liao, Xinhua Wang, Shichao Fan, Di Wu, Qiuxuan Feng, Meng Li, Zhengping Che, Chang Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Beijing Institute of Technology(北京理工大学) The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 部署与泛化 :VLA(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05378 2026-05-28 cs.CL cs.CV 81%

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性

Kaiser Hamid, Can Cui, Nade Liang

机构 * Texas Tech University(德克萨斯科技大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);embodied foundation model(abstract);分类 cs.CV

AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO 81%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03233 2025-08-28 cs.RO 81%

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

Shengliang Deng, Mi Yan, Songlin Wei, Haixin Ma, Yuxin Yang, Jiayi Chen, Zhiqi Zhang, Taoyu Yang, Xuheng Zhang, Wenhao Zhang, Heming Cui, Zhizheng Zhang, He Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);action model(abstract);embodied foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26103 2026-08-28 cs.RO cs.CV 版本更新 81%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments https://robbyant-research.github.io/Zero-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12690 2026-06-12 cs.RO cs.AI 新提交 81%

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型

Xin Zhou, Cong Miao

机构 * Astronex Robotics Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07217 2026-06-08 cs.RO cs.CV cs.LG 新提交 80%

Robotic Policy Adaptation via Weight-Space Meta-Learning

通过权重空间元学习实现机器人策略自适应

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

机构 * ItalAI University of Verona(威尼斯大学) Sapeinza University of Rome(罗马萨佩因扎大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出WIZARD框架,通过权重空间元学习从语言指令和演示视频生成任务特定LoRA参数,无需微调即可适应新任务,在LIBERO上性能提升高达14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04907 2026-06-16 cs.RO 版本更新 79%

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) FiveAges National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) GigaAI

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10363 2026-06-10 cs.RO 新提交 79%

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

机构 * The University of Hong Kong(香港大学) INFIFORCE Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Southern University of Science and Technology(南方科技大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10980 2026-02-12 cs.RO 79%

RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation

RADAR:通过现实动态、空间-物理智能和自主评估进行视觉-语言-动作泛化基准测试

Yuhao Chen, Zhihao Zhan, Xiaoxin Lin, Zijian Song, Hao Liu, Qinhan Lyu, Yubo Zu, Xiao Chen, Zhiyuan Liu, Tao Pu, Tianshui Chen, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 部署与泛化 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 RADAR通过现实动态、空间-物理智能和自主评估,系统评估VLA模型在现实环境中的泛化能力,揭示其在物理动态和空间推理上的脆弱性。

Comments 12 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 79%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 部署与泛化 :VLA(title,abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27881 2026-07-31 cs.RO cs.AI 新提交 79%

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架

Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。

Comments Accepted to IROS 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 79%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10094 2026-05-13 cs.RO cs.AI 79%

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应

Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) One Robotics Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07381 2026-05-11 cs.RO cs.AI 79%

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

通过锚点中心适应摆脱机器人操作中的多样性陷阱

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Institude for Information Research, A STAR(A*STAR信息研究所)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏