arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-13 至 2026-02-13 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2602.11598 2026-02-13 cs.RO cs.AI cs.CV 85%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11832 2026-02-13 cs.CV cs.RO 84%

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12062 2026-02-13 cs.RO 70%

HoloBrain-0 Technical Report

HoloBrain-0 技术报告

Xuewu Lin, Tianwei Lin, Yun Du, Hongyu Xie, Yiwei Jin, Jiawei Li, Shijie Wu, Qingze Wang, Mengdi Li, Mengao Zhao, Ziang Li, Chaodong Huang, Hongzhe Bi, Lichao Huang, Zhizhong Su

机构 * Horizon Robotics

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10983 2026-02-13 cs.RO 70%

Scaling World Model for Hierarchical Manipulation Policies

为分层操作策略扩展世界模型

Qian Long, Yueze Wang, Jiaxi Song, Junbo Zhang, Peiyan Li, Wenxuan Wang, Yuqi Wang, Haoyang Li, Shaoxuan Xie, Guocai Yao, Hanbo Zhang, Xinlong Wang, Zhongyuan Wang, Xuguang Lan, Huaping Liu, Xinghang Li

机构 * Xi’an Jiao Tong University(西安交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出分层VLA框架,利用大规模预训练世界模型提升机器人操作在分布外场景的泛化能力,实验显示性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2602.12032 2026-02-13 cs.RO 70%

When would Vision-Proprioception Policies Fail in Robotic Manipulation?

视觉-本体感觉策略在机器人操作中何时会失败?

Jingxian Lu, Wenke Xia, Yuxuan Wu, Zhiwu Lu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光明学院人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型与智能治理研究重点实验室) School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究提出GAP算法,通过动态调节本体感觉优化,解决视觉-本体感觉策略在运动转换阶段的泛化问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11214 2026-02-13 cs.CV cs.RO 62%

DD-MDN: Human Trajectory Forecasting with Diffusion-Based Dual Mixture Density Networks and Uncertainty Self-Calibration

DD-MDN: 基于扩散的双混合密度网络与不确定性自校准的人体轨迹预测

Manuel Hetzel, Kerim Turacan, Hannes Reichert, Konrad Doll, Bernhard Sick

机构 * Faculty of Engineering, University of Applied Sciences Aschaffenburg(亚琛应用科学大学工程学院) Intelligent Embedded Systems Lab, University of Kassel(卡塞尔大学智能嵌入式系统实验室)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 DD-MDN通过结合扩散模型和双混合密度网络,实现高精度的人体轨迹预测,具备自校准的不确定性建模和对短观察期的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2602.07837 2026-02-13 cs.RO 70%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏