arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9855 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9176 篇

2602.16710 2026-02-19 cs.RO 70%

EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

EgoScale:利用多样化的视点人类数据进行规模化灵巧操作

Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, Linxi Fan

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校) University of Maryland(马里兰大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01843 2026-02-18 cs.RO 70%

MoIRA: Modular Instruction Routing Architecture for Multi-Task Robotics

MoIRA:多任务机器人中的模块化指令路由架构

Dmytro Kuzmenko, Nadiya Shvai

机构 * Department of Multimedia Systems, National University of Kyiv-Mohyla Academy(多媒体系统系,基尔夫学院国家大学) Department of Mathematics, National University of Kyiv-Mohyla Academy(数学系,基尔夫学院国家大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 MoIRA是一种模块化指令路由架构,通过外部文本路由器协调专家,实现高效多任务机器人系统。

Comments Updated to reflect the final accepted version published in Neurocomputing

Journal ref Neurocomputing, vol. 674, 132962, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 70%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13086 2026-02-16 cs.RO 70%

UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph

UniManip: 通用目的零样本机器人操作的代理操作图

Haichao Liu, Yuanjiang Xue, Yuheng Zhou, Haoyuan Deng, Yinan Liang, Lihua Xie, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University, China(清华大学自动化系)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。

Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12062 2026-02-13 cs.RO 70%

HoloBrain-0 Technical Report

HoloBrain-0 技术报告

Xuewu Lin, Tianwei Lin, Yun Du, Hongyu Xie, Yiwei Jin, Jiawei Li, Shijie Wu, Qingze Wang, Mengdi Li, Mengao Zhao, Ziang Li, Chaodong Huang, Hongzhe Bi, Lichao Huang, Zhizhong Su

机构 * Horizon Robotics

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10983 2026-02-13 cs.RO 70%

Scaling World Model for Hierarchical Manipulation Policies

为分层操作策略扩展世界模型

Qian Long, Yueze Wang, Jiaxi Song, Junbo Zhang, Peiyan Li, Wenxuan Wang, Yuqi Wang, Haoyang Li, Shaoxuan Xie, Guocai Yao, Hanbo Zhang, Xinlong Wang, Zhongyuan Wang, Xuguang Lan, Huaping Liu, Xinghang Li

机构 * Xi’an Jiao Tong University(西安交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出分层VLA框架,利用大规模预训练世界模型提升机器人操作在分布外场景的泛化能力,实验显示性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10377 2026-02-12 cs.LG cs.CL 70%

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律

Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University College London(伦敦大学学院) Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) The University of Edinburgh(爱丁堡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10093 2026-02-11 cs.RO 70%

UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台

Baijun Chen, Weijie Wan, Tianxing Chen, Xianda Guo, Congsheng Xu, Yuanyang Qi, Haojie Zhang, Longyan Wu, Tianling Xu, Zixuan Li, Yizhe Wu, Rui Li, Xiaokang Yang, Ping Luo, Wei Sui, Yao Mu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) D-Robotics ViTai Robotics The University of Hong Kong(香港大学) Nanjing University(南京大学) Shenzhen University(深圳大学) Wuhan University(武汉大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。

Comments Website: https://univtac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 70%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 70%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07541 2026-02-10 cs.RO 70%

Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning

区分与注入:通过参数结构推理诱导的功能区分来增强VLAs

Jingyi Hou, Leyu Zhou, Chenchen Jing, Jinghan Yang, Xinbo Yu, Wei He

机构 * University of Science(科学大学) Zhejiang University of Technology(浙江工业大学) Technology University(技术大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 iSTAR通过参数结构推理诱导功能区分,提升VLA模型在任务分解和任务变化下的可靠性与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05325 2026-02-10 cs.RO 70%

RoboPaint: From Human Demonstration to Any Robot and Any View

RoboPaint:从人类示范到任何机器人和任何视角

Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang, Chao Chen, Peide Wang, Hengdi Zhang, Zhengxue Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO 70%

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO 70%

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 70%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02864 2026-02-04 cs.RO 70%

Accelerating Structured Chain-of-Thought in Autonomous Vehicles

加速自动驾驶中的结构化链式推理

Yi Gu, Yan Wang, Yuxiao Chen, Yurong You, Wenjie Luo, Yue Wang, Wenhao Ding, Boyi Li, Heng Yang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA University of Southern California(南加州大学) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 FastDriveCoT通过并行解码方法加速自动驾驶中的结构化链式推理,实现3-4倍的生成速度提升和端到端延迟的显著降低,同时保持推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00557 2026-02-03 cs.RO 70%

ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation

ConLA:从人类视频中通过对比学习学习机器人操作

Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳)) ZTE Corporation(中兴通讯) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 ConLA通过对比学习从人类视频中学习机器人操作,有效解决潜在表示中的捷径学习问题,提升机器人学习的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21506 2026-01-30 cs.RO cs.SY eess.SY 70%

IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation

IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构

Joonhee Lee, Hyunseung Shin, Jeonggil Ko

机构 * Yonsei University(延世大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19859 2026-01-30 cs.RO 70%

Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

统一感知与行动:一种融合模态的管道,具有隐式视觉推理链的机器人行动生成

Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 VITA通过融合视觉和动作的共享潜在空间,实现机器人行动生成的统一感知与行动,提升了多个任务的成功率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20262 2026-01-29 cs.RO 70%

Shallow-π: Knowledge Distillation for Flow-based VLAs

Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏

Boseong Jeon, Yunho Choi, Taehan Kim

机构 * Samsung Research South Korea(三星韩国研究)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18323 2026-01-27 cs.RO 70%

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11475 2026-01-19 cs.CV 70%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24210 2026-01-12 cs.RO 70%

GR-Dexter Technical Report

GR-Dexter 技术报告

Ruoshi Wen, Guangzeng Chen, Zhongren Cui, Min Du, Yang Gou, Zhigang Han, Liqun Huang, Mingyu Lei, Yunfei Li, Zhuohang Li, Wenlei Liu, Yuxiao Liu, Xiao Ma, Hao Niu, Yutao Ouyang, Zeyu Ren, Haixin Shi, Wei Xu, Haoxiang Zhang, Jiajun Zhang, Xiao Zhang, Liwei Zheng, Weiheng Zhong, Yifei Zhou, Zhengming Zhu, Hang Li

机构 * ByteDance Seed(字节跳动种子)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 GR-Dexter 提出了一种综合框架,通过紧凑机械手、双臂遥控系统和训练配方,实现基于VLA的通用灵巧手机器人操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO 70%

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08189 2025-12-24 cs.CV 70%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 70%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11612 2025-12-15 cs.CV eess.IV 70%

Embodied Image Compression

具身图像压缩

Chunyi Li, Rui Qing, Jianbo Zhang, Yuan Tian, Xiangyang Zhu, Zicheng Zhang, Xiaohong Liu, Weisi Lin, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出具身图像压缩问题,建立EmbodiedComp基准测试,证明现有模型在超低比特率下无法完成简单任务,推动具身AI在现实中的应用。

Comments 15 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 70%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04537 2025-12-05 cs.CV 70%

X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale

X-Humanoid:将人类视频机器人化以生成大规模人形视频

Pei Yang, Hai Ci, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 X-Humanoid通过生成式视频编辑方法,将人类视频机器人化,生成大规模人形视频数据集,提升人形机器人研究的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO 70%

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏