arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 200 篇

2605.07299 2026-05-11 cs.CV cs.AI 62%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 62%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 62%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 62%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 数据集与评测 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15469 2026-03-17 cs.RO cs.AI 62%

RoCo Challenge at AAAI 2026: Benchmarking Robotic Collaborative Manipulation for Assembly Towards Industrial Automation

AAAI 2026机器人协作操作挑战赛:面向工业自动化的协作操作基准测试

Haichao Liu, Yuheng Zhou, Zhenyu Wu, Ziheng Ji, Ziyu Shan, Qianzhun Wang, Ruixuan Liu, Zhiyuan Yang, Yejun Gu, Shalman Khan, Shijun Yan, Jun Liu, Haiyue Zhu, Changliu Liu, Jianfei Yang, Jingbing Zhang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学,北京,中国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoCo挑战赛,通过模拟和真实世界装配任务,推动工业机器人协作操作能力的发展,展示了双模型框架和故障恢复数据在长周期多任务学习中的有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12510 2026-02-16 cs.IR cs.CV cs.LG 62%

Visual RAG Toolkit: Scaling Multi-Vector Visual Retrieval with Training-Free Pooling and Multi-Stage Search

视觉RAG工具包:通过无训练池化和多阶段搜索扩展多向量视觉检索

Ara Yeroyan

机构 * Independent Researcher(独立研究者)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.LG

AI总结 视觉RAG工具包通过无训练池化和多阶段搜索提升多向量视觉检索效率,减少向量存储并提高检索吞吐量。

Comments 4 pages, 3 figures. Submitted to SIGIR 2026 Demonstrations Track. Project website: https://github.com/Ara-Yeroyan/visual-rag-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11421 2026-01-19 cs.RO cs.AI 62%

The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents

伟大的百日行进100:100个注重细节的任务用于评估具身体验人工智能代理

Ziyu Wang, Chenyuan Liu, Yushun Xiang, Runhao Zhang, Qingbo Hao, Hongliang Lu, Houyu Chen, Zhizhong Feng, Kaiyue Zheng, Dehao Ye, Xianchao Zeng, Xinyu Zhou, Boran Wen, Jiaxin Li, Mingyu Zhang, Kecheng Zheng, Qian Zhu, Ran Cheng, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海人工智能研究院) Robbyant

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 GM-100通过100个精心设计的任务全面评估具身体验人工智能代理的能力,推动机器人数据集任务设计的多样性和复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05895 2025-08-06 cs.CV cs.AI 62%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22274 2025-07-31 cs.CV cs.LG 62%

HOG-CNN: Integrating Histogram of Oriented Gradients with Convolutional Neural Networks for Retinal Image Classification

Faisal Ahmed

机构 * Department of Data Science(数据科学系) Mathematics, Embry-Riddle Aeronautical University(数学,埃默里-瑞利航空大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.LG

Comments 13 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21125 2025-07-30 cs.IR cs.AI cs.LG cs.SY eess.SY 62%

RATE: An LLM-Powered Retrieval Augmented Generation Technology-Extraction Pipeline

Karan Mirhosseini, Arya Aftab, Alireza Sheikh

机构 * Dept. of Management, Science and Technology(管理、科学与技术系) Amirkabir University of Technology(阿姆尔卡比尔科技大学) Dept. of Electrical Engineering(电气工程系) Sharif University of Technology(沙里夫科技大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15725 2025-05-27 cs.RO cs.CV 62%

UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning

Xiangyu Wang, Donglin Yang, Yue Liao, Wenhao Zheng, wenjun wu, Bin Dai, Hongsheng Li, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) National University of Singapore(新加坡国立大学) MMLab, CUHK(香港中文大学MMLab) Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01345 2025-03-04 cs.RO cs.CV 62%

Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy

Ricardo Garcia, Shizhe Chen, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(巴黎高等师范学院) CNRS(法国国家科学研究中心) PSL Research University(巴黎文理研究大学)

专题命中 数据集与评测 :language-conditioned robot(abstract);分类 cs.RO、cs.CV

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12326 2025-01-22 cs.AI cs.CL cs.CV cs.HC 62%

UI-TARS: Pioneering Automated GUI Interaction with Native Agents

Yujia Qin, Yining Ye, Junjie Fang, Haoming Wang, Shihao Liang, Shizuo Tian, Junda Zhang, Jiahao Li, Yunxin Li, Shijue Huang, Wanjun Zhong, Kuanye Li, Jiale Yang, Yu Miao, Woyu Lin, Longxiang Liu, Xu Jiang, Qianli Ma, Jingyu Li, Xiaojun Xiao, Kai Cai, Chuang Li, Yaowei Zheng, Chaolin Jin, Chen Li, Xiao Zhou, Minchao Wang, Haoli Chen, Zhaojian Li, Haihua Yang, Haifeng Liu, Feng Lin, Tao Peng, Xin Liu, Guang Shi

机构 * ByteDance(字节跳动) Tsinghua University(清华大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01326 2024-01-17 cs.CL cs.AI cs.LG 62%

An Autoregressive Text-to-Graph Framework for Joint Entity and Relation Extraction

Urchade Zaratiana, Nadi Tomeh, Pierre Holat, Thierry Charnois

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments AAAI 2024 (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07715 2023-11-15 cs.CL cs.AI cs.IR cs.LG 62%

PolyIE: A Dataset of Information Extraction from Polymer Material Scientific Literature

Jerry Junyang Cheung, Yuchen Zhuang, Yinghao Li, Pranav Shetty, Wantian Zhao, Sanjeev Grampurohit, Rampi Ramprasad, Chao Zhang

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01306 2023-01-26 cs.IR cs.AI cs.CL cs.DB cs.LG 62%

Long-tail Relation Extraction via Knowledge Graph Embeddings and Graph Convolution Networks

Ningyu Zhang, Shumin Deng, Zhanlin Sun, Guanying Wang, Xi Chen, Wei Zhang, Huajun Chen

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments To be published in NAACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06841 2023-01-18 cs.CL cs.AI cs.LG 62%

Syntactically Robust Training on Partially-Observed Data for Open Information Extraction

Ji Qi, Yuxiang Chen, Lei Hou, Juanzi Li, Bin Xu

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13365 2021-11-02 cs.LG cs.AI stat.ML 62%

Bringing Light Into the Dark: A Large-scale Evaluation of Knowledge Graph Embedding Models Under a Unified Framework

Mehdi Ali, Max Berrendorf, Charles Tapley Hoyt, Laurent Vermue, Mikhail Galkin, Sahand Sharifzadeh, Asja Fischer, Volker Tresp, Jens Lehmann

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13807 2021-07-30 cs.CV cs.AI 62%

FREE: Feature Refinement for Generalized Zero-Shot Learning

Shiming Chen, Wenjie Wang, Beihao Xia, Qinmu Peng, Xinge You, Feng Zheng, Ling Shao

专题命中 数据集与评测 :action model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06702 2020-10-21 cs.LG cs.AI 62%

Learning Generalized Relational Heuristic Networks for Model-Agnostic Planning

Rushang Karia, Siddharth Srivastava

专题命中 数据集与评测 :action model(abstract);分类 cs.AI、cs.LG

Comments Submitted to AAAI-21

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11881 2020-09-16 cs.CV cs.RO eess.IV stat.ML 62%

Context Model for Pedestrian Intention Prediction using Factored Latent-Dynamic Conditional Random Fields

Satyajit Neogi, Michael Hoy, Kang Dang, Hang Yu, Justin Dauwels

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.CV

Comments Accepted by IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06165 2026-08-26 cs.SD cs.AI cs.MM 版本更新 57%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26) 2026-08-25: Edit to drop TeX commands in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 57%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 57%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28625 2026-07-31 cs.CV 新提交 57%

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

ACE-Data-0:以人为中心的环境捕获作为具身数据引擎

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) ACE Robotics(ACE机器人公司)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.CV

AI总结 本研究提出以人为中心的具身数据引擎ACE,构建含150小时数据的ACE-Data-0数据集,引入分层基准,暴露现有方法缺陷,为具身AI等领域提供基础。

Comments Project Page: https://ace-data-engine.github.io/ACE-Data-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12894 2026-07-15 cs.CV 新提交 57%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 数据集与评测 :embodied foundation model(abstract);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00726 2026-07-02 cs.CV cs.SD 新提交 57%

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

AV-SyncBench:音视频时间与语义同步的解耦基准测试

Tianhong Zhou, Mingyang Han, Boyu Li, Yuxuan Jiang, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Kunpeng Wang, Jun Song, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 提出AV-SyncBench,首个完全分离音视频时间与语义一致性评估的基准,涵盖语音、音乐和声音三大类10个场景5项挑战任务,基于野外视频构建并人工验证,用于量化特征提取模型的对齐质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31993 2026-07-01 cs.RO 新提交 57%

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

OopsieVerse: 一个具有损伤感知仿真的机器人操作安全基准

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数据集与评测 :vision language action(abstract);分类 cs.RO

AI总结 提出OopsieVerse框架,通过DamageSim检测和量化接触力、温度等损伤信号,在OmniGibson和RoboCasa仿真器中实现损伤感知,用于安全策略学习与评估。

Comments Project website: https://robin-lab.cs.utexas.edu/oopsieverse/. The first two authors contributed equally; order decided by dice roll. Accepted to Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18723 2026-06-30 cs.RO 57%

Eval-Actions: Fine-Grained Execution Quality Evaluation for Robotic Manipulation

Eval-Actions: 针对机器人操作的细粒度执行质量评估

Mengyuan Liu, Juyi Sheng, Peiming Li, Ziyi Wang, Tianming Xu, Tiantian Xu, Hong Liu

专题命中 数据集与评测 :VLA(abstract);分类 cs.RO

AI总结 本文提出Eval-Actions方法,通过专家评分、排名引导标签和思维链注释,对机器人操作策略的执行质量进行细粒度评估,包含13000+真实机器人片段,验证了其在任务完成中的有效性。

Comments Project Website at https://eval-actions.github.io/. Code is available at https://github.com/LogSSim/TERM-Bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏