arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 200 篇

2501.02189 2026-08-25 cs.CV cs.AI cs.CL cs.LG cs.RO 70%

A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges

Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, Guangyao Shi

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 26 pages, 4 figures

Journal ref Navigating the Future: Ensuring Trustworthiness in Multi-Modal Open-World Intelligence @ CVPR, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02580 2026-08-04 cs.RO 新提交 70%

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ego2Robot:从第一视角人类数据生成可扩展机器人数据

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学AIM3实验室) Qwen Team, Alibaba Inc.(阿里巴巴通义千问团队) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Ego2Robot提出将第一视角人类操控视频转换为机器人训练数据的可扩展流水线,生成18561小时机器人数据,扩展RoboTwin2.0验证其联合预训练可提升机器人分布外泛化能力并经真实部署验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20575 2026-07-21 cs.CV 版本更新 70%

An interactive enhanced driving dataset for autonomous driving

一种交互增强的自动驾驶数据集

Haojie Feng, Xinrui Zhang, Mengjie Tian, Peizhi Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Junfan Zhu, Jianzhou Wang, Dongxiao Yin, Lu Xiong

专题命中 数据集与评测 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。

Comments Accepted for publication in Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04880 2026-07-07 cs.RO 新提交 70%

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对大规模预训练模型在特定环境泛化有限的问题,提出PRISM端到端管道,从单张图像和自然语言指令生成个性化机器人数据集,构建场景并合成演示,实验表明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02800 2026-06-24 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 70%

Cosmos 3: Omnimodal World Models for Physical AI

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA, :, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang, Michael Huang, Sophia Huang, Yufan Huang, Jacob Huffman, DeLesley Hutchins, Suneel Indupuru, Boris Ivanovic, Arihant Jain, Joel Jang, Ryan Ji, Yanan Jian, Dongfu Jiang, Jingyi Jin, Atharva Joshi, Nikhilesh Joshi, Pranjali Joshi, Andy Ju, Jaehun Jung, Weiwei Kang, Scott Kassekert, Jan Kautz, Ashna Khetan, Julia Kiczka, Slawek Kierat, Gwanghyun Kim, Kuno Kim, Sunny Kim, Kezhi Kong, Xin Kong, Zhifeng Kong, Tomasz Kornuta, Egor Krivov, Hui Kuang, Saurav Kumar, Chia-Wen Kuo, George Kurian, Wojciech Kutak, JF Lafleche, Himangshu Lahkar, Omar Laymoun, Jayjun Lee, Sanggil Lee, Gabriele Leone, Boyi Li, Freya Li, Jiajun Li, Jinfeng Li, Ling Li, Pengcheng Li, Shangru Li, Tingle Li, Xiaolong Li, Xuan Li, Zhaoshuo Li, Zhiqi Li, Hao Liang, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Ming-Yu Liu, Sifei Liu, Zihan Liu, Hai Loc Lu, Xiangyu Lu, Alice Luo, Ruipu Luo, Wenjie Luo, Jiangran Lyu, Martin Ding Ma, Nic Ma, Qianli Ma, Dawid Majchrowski, Louis Marcoux, Miguel Martin, Qing Miao, Ashkan Mirzaei, Shreyas Misra, Kaichun Mo, Durra Mohsin, Hyejin Moon, Pawel Morkisz, Saeid Motiian, Kirill Motkov, Seungjun Nah, Yashraj Narang, Deepak Narayanan, Thabang Ngazimbi, Julian Ouyang, Shubham Pachori, David Page, Yatian Pang, Sehwi Park, Mahesh Patekar, Mostofa Patwary, Marco Pavone, Trung Pham, Wei Ping, Soha Pouya, Shrimai Prabhumoye, Varun Praveen, Delin Qu, Hesam Rabeti, Morteza Ramezanali, Marilyn Reeb, Xuanchi Ren, Kristen Rumley, Wojciech Rymer, Jun Saito, Yeongho Seol, John Shao, Piyush Shekdar, Tianwei Shen, Humphrey Shi, Min Shi, Stella Shi, Kevin Shih, Mohammad Shoeybi, Mateusz Sieniawski, Shuran Song, Alexander Sotelo, Amir Sotoodeh, Sunil Srinivasa, Vignesh Srinivasakumar, Bartosz Stefaniak, Rahul Heinrich Steiger, Shangkun Sun, Jiaxiang Tang, Shitao Tang, Yangyang Tang, Yue Tang, Tolou Tavakkoli, Kayley Ting, Krzysztof Tomala, Wei-Cheng Tseng, Jibin Varghese, Sergei Vasilev, Thomas Volk, Raju Wagwani, Roger Waleffe, Andrew Z. Wang, Boxiang Wang, Haoxiang Wang, Qiao Wang, Shihao Wang, Shijie Wang, Ting-Chun Wang, Yan Wang, Yu Wang, Rohit Watve, David Wehr, Fangyin Wei, Xinshuo Weng, Jay Zhangjie Wu, Kedi Wu, Hongchi Xia, Summer Xiao, Tianjun Xiao, Kevin Xie, Daguang Xu, Jiashu Xu, Mengyao Xu, Ruqing Xu, Xingqian Xu, Yao Xu, Dinghao Yang, Dong Yang, Hans Yang, Xiaodong Yang, Xuning Yang, Yichu Yang, Yurong You, Zhiding Yu, Hao Yuan, Simon Yuen, Xiaohui Zeng, Pengcuo Zeren, Cindy Zha, Haotian Zhang, Jenny Zhang, Jing Zhang, Liangkai Zhang, Paris Zhang, Shun Zhang, Xuanmeng Zhang, Zhizheng Zhang, Ann Zhao, Yilin Zhao, Yuliya Zhautouskaya, Charles Zhou, Fengzhe Zhou, Shilin Zhu, Yuke Zhu, Dima Zhylko, Artur Zolkowski

机构 * NVIDIA

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO 70%

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16886 2026-04-21 cs.RO 70%

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

交互链基准(COIN):当推理遇见具身交互

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI 70%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11920 2026-03-17 cs.RO 70%

H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos

H2R: 一种从视频中为机器人预训练的人到机器人的数据增强

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, Shanghang Zhang

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18396 2026-03-16 cs.RO 70%

AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

AOMGen: 为关节物体操控生成逼真、物理一致的演示

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。

Comments Accepted by CVPR Findings2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08260 2026-03-10 cs.RO 70%

Seed2Scale: A Self-Evolving Data Engine for Embodied AI via Small to Large Model Synergy and Multimodal Evaluation

Seed2Scale: 一种通过小到大模型协同和多模态评估的自我进化数据引擎用于具身AI

Cong Tai, Zhaoyu Zheng, Haixu Long, Hansheng Wu, Zhengbin Long, Haodong Xiang, Rong Shi, Zhuo Cui, Shizhuang Zhang, Gang Qiu, He Wang, Ruifeng Li, Biao Liu, Zhenzhe Sun, Tao Shen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Seed2Scale通过小到大模型协同和多模态评估,实现具身AI的自我进化数据引擎,显著提升性能并提供可扩展的开发路径

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24653 2026-03-02 cs.RO 70%

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

RoboMIND 2.0:一种多模态、双臂移动操作数据集,用于通用具身智能

Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboMIND 2.0通过多模态双臂移动操作数据集和MIND-2系统,提升通用具身智能的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09367 2026-02-11 cs.RO 70%

CAPER: Constrained and Procedural Reasoning for Robotic Scientific Experiments

CAPER:用于机器人科学实验的约束和程序性推理

Jinghan Yang, Jingyi Hou, Xinbo Yu, Wei He, Yifan Wu

机构 * University of Science and Technology Beijing(北京科技大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 CAPER通过约束和程序性推理框架提升机器人在科学实验中的可控性、鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14968 2025-10-17 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 70%

RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks

Mingxuan Yan, Yuping Wang, Zechun Liu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Meta AI

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06553 2025-08-12 cs.CV 70%

Static and Plugged: Make Embodied Evaluation Simple

Jiahao Xiao, Jianbo Zhang, BoWen Yan, Shengyu Guo, Tongrui Ye, Kaiwei Zhang, Zicheng Zhang, Xiaohong Liu, Zhengxue Cheng, Lei Fan, Chuyi Li, Guangtao Zhai

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04681 2025-08-07 cs.CV 70%

Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions

Liang Xu, Chengqun Yang, Zili Lin, Fei Xu, Yifan Liu, Congsheng Xu, Yiyi Zhang, Jie Qin, Xingdong Sheng, Yunhui Liu, Xin Jin, Yichao Yan, Wenjun Zeng, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学AI研究院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) MoE Key Lab of AI, School of Computer Science, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学计算机学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Lenovo(联想公司)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Project Page: https://liangxuy.github.io/InterVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14030 2025-05-30 cs.RO 70%

AutoBio: A Simulation and Benchmark for Robotic Automation in Digital Biology Laboratory

Zhiqian Lan, Yuxuan Jiang, Ruiqi Wang, Xuanbing Xie, Rongkui Zhang, Yicheng Zhu, Peihang Li, Tianshuo Yang, Tianxing Chen, Haoyu Gao, Xiaokang Yang, Xuelong Li, Hongyuan Zhang, Yao Mu, Ping Luo

机构 * HKU(香港大学) TeleAI THU(清华大学) SJTU(上海交通大学) HKU Shanghai Intelligent Computing Center(香港大学上海智能计算中心)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 67%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 67%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 67%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02427 2026-01-07 cs.CV cs.AI cs.LG 67%

NitroGen: An Open Foundation Model for Generalist Gaming Agents

NitroGen:一种通用游戏代理的开源基础模型

Loïc Magne, Anas Awadalla, Guanzhi Wang, Yinzhen Xu, Joshua Belofsky, Fengyuan Hu, Joohwan Kim, Ludwig Schmidt, Georgia Gkioxari, Jan Kautz, Yisong Yue, Yejin Choi, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA Stanford(斯坦福大学) Caltech(加州理工学院) UChicago(芝加哥大学) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 NitroGen通过大规模行为克隆训练,实现跨游戏泛化能力,提升任务成功率达52%

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05513 2025-09-09 cs.CV cs.AI cs.RO 67%

OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation

Ahad Jawaid, Yu Xiang

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Physical Automation, Inc.(Physical Automation 公司)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18088 2025-08-28 cs.RO cs.AI cs.CL cs.CV cs.MA 67%

RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation

Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, Weiliang Deng, Yubin Guo, Tian Nian, Xuanbing Xie, Qiangyu Chen, Kailun Su, Tianling Xu, Guodong Liu, Mengkang Hu, Huan-ang Gao, Kaixuan Wang, Zhixuan Liang, Yusen Qin, Xiaokang Yang, Ping Luo, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, SJTU(人工智能联合实验室、人工智能研究院、上海交通大学) HKU MMLab(香港大学多模态实验室) Shanghai AI Lab(上海人工智能实验室) D-Robotics(D-机器人) SZU(深圳大学) THU(清华大学) TeleAI FDU(福建大学) USTC(中国科学技术大学) SUSTech(南方科技大学) SYSU(深圳大学) CSU(中国科学技术大学) NEU(南京大学) HKU-SH ICRC(香港大学深圳研究院) NJU(南京大学) Lumina EAI

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project Page: https://robotwin-platform.github.io/, Code: https://github.com/robotwin-Platform/robotwin, Doc: https://robotwin-platform.github.io/doc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09839 2025-06-12 cs.CV cs.AI cs.RO 67%

OctoNav: Towards Generalist Embodied Navigation

Chen Gao, Liankai Jin, Xingyu Peng, Jiazhao Zhang, Yue Deng, Annan Li, He Wang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 31 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15679 2025-02-24 cs.RO cs.AI cs.CV 67%

BOSS: Benchmark for Observation Space Shift in Long-Horizon Task

Yue Yang, Linfeng Zhao, Mingyu Ding, Gedas Bertasius, Daniel Szafir

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 62%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.RO、cs.CV

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11901 2026-06-11 cs.RO cs.AI 新提交 62%

DuoBench: A Reproducible Benchmark for Bimanual Manipulation in Simulation and the Real World

DuoBench: 一个可复现的双手操作基准,涵盖仿真与现实世界

Tobias Jülg, Seongjin Bien, Simon Hilber, Yannik Blei, Pierre Krack, Maximilian Li, Sven Parusel, Rudolf Lioutikov, Florian Walter, Wolfram Burgard

机构 * University of Technology Nuremberg(纽伦堡工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Franka Robotics Technical University of Munich(慕尼黑工业大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出DuoBench,一个基于FR3 Duo平台的双手操作基准框架,包含11个任务和阶段式评估方案,用于诊断当前策略在双手协调、仿真到现实迁移等方面的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23499 2026-06-10 cs.RO cs.AI 版本更新 62%

TaCarla: A comprehensive benchmarking dataset for end-to-end autonomous driving

TaCarla: 端到端自动驾驶的综合基准数据集

Tugrul Gorgulu, Atakan Dag, M. Esat Kalfaoglu, Halil Ibrahim Kuru, Baris Can Cam, Halil Ibrahim Ozturk, Ozsel Kilinc

机构 * Tuğrul Gorgülü *†(土耳其巴伊塞蒂大学) Atakan Dağ †(土耳其巴伊塞蒂大学) M. Esat Kalfaoğlu ‡(土耳其巴伊塞蒂大学) Halil İbrahim Kuru †(土耳其巴伊塞蒂大学) Barış Can Cam †(土耳其巴伊塞蒂大学) Halil İbrahim Öztürk †(土耳其巴伊塞蒂大学) Özsel Kılınç §(土耳其巴伊塞蒂大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.AI

AI总结 针对现有自动驾驶数据集不完整、行为多样性不足及闭环评估缺失等问题,基于CARLA Leaderboard 2.0挑战场景收集超过285万帧的多任务数据集,支持规划、检测、预测及视觉语言动作模型,并提供数值稀有度评分。

Comments Accepted at the Third Workshop on Simulation for Autonomous Driving (SAD), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 62%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏