arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2511.23186 2025-12-01 cs.RO cs.AI cs.CV 62%

Obstruction reasoning for robotic grasping

机器人抓取中的障碍物推理

Runyu Jiao, Matteo Bortolon, Francesco Giuliari, Alice Fasoli, Sergio Povoli, Guofeng Mei, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞勒基金会) University of Trento(特伦托大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UNOGrasp通过视觉-语言模型提升机器人抓取中障碍物推理能力,结合监督与强化学习微调,实现更高效的路径规划和抓取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI 62%

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22903 2025-12-01 cs.CV cs.AI 62%

Leveraging Textual Compositional Reasoning for Robust Change Captioning

利用文本组合推理实现鲁棒的变更描述

Kyu Ri Park, Jiyoung Park, Seong Tae Kim, Hong Joo Lee, Jung Uk Kim

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 CORTEX通过整合文本线索和组合推理,提升图像变化描述的鲁棒性与准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22532 2025-12-01 cs.CV cs.AI 62%

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21982 2025-12-01 cs.CV cs.AI 62%

DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

DialBench: 通过大基础模型实现指针表盘读数的准确识别

Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang

机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 62%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 62%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG 62%

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19417 2025-11-25 cs.CL cs.AI cs.LG 62%

Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration

Be My Eyes: 通过多智能体协作扩展大型语言模型到新模态

James Y. Huang, Sheng Zhang, Qianchu Liu, Guanghui Qin, Tinghui Zhu, Tristan Naumann, Muhao Chen, Hoifung Poon

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI、cs.LG

AI总结 BeMyEyes通过多智能体协作扩展LLMs到多模态推理,利用高效VLMs与强大LLMs的互补优势,实现轻量级开源解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15986 2025-11-25 cs.CV cs.CY cs.LG 62%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 62%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 62%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 62%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13970 2025-11-19 cs.AI cs.CV 62%

Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios

Sanjay Acharjee, Abir Khan Ratul, Diego Patino, Md Nazmus Sakib

机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14153 2025-11-19 cs.CV cs.AI 62%

LENS: Learning to Segment Anything with Unified Reinforced Reasoning

Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, Xinggang Wang

机构 * vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Code is released at https://github.com/hustvl/LENS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11704 2025-11-18 cs.LG cs.CV 62%

Simple Vision-Language Math Reasoning via Rendered Text

Matvey Skripkin, Elizaveta Goncharova, Andrey Kuznetsov

机构 * FusionBrain Lab(融合脑实验室) HSE University(俄罗斯高等经济学院) Innopolis University(因诺波利斯大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07250 2025-11-14 cs.CV cs.AI 62%

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

Tianhao Peng, Haochen Wang, Yuanxing Zhang, Zekun Wang, Zili Wang, Gavin Chang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Steven Huang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Kuaishou Technology(快手科技) M-A-P

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07429 2025-11-12 cs.CV cs.AI 62%

Knowledge-Guided Textual Reasoning for Explainable Video Anomaly Detection via LLMs

Hari Lee

机构 * Hari Lee

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06805 2025-11-11 cs.AI cs.LG 62%

MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning

Jinhao Chen, Zhen Yang, Jianxin Shi, Tianyu Wo, Jie Tang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06722 2025-11-11 cs.CV cs.AI cs.CL 62%

Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View

Jianyu Qi, Ding Zou, Wenrui Yan, Rui Ma, Jiaxu Li, Zhijie Zheng, Zhiguo Yang, Rongchang Zhao

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accpeted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21861 2025-11-06 cs.LG cs.AI cs.CL 62%

The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems

Bentley DeVilling

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 2 figures. Category: cs.LG. Code and data: https://github.com/Course-Correct-Labs/mirror-loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02834 2025-11-06 cs.AI cs.CL cs.LG 62%

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao, Wei Wang, Ravender Pal Singh

机构 * Amazon(亚马逊公司) Rochester Institute of Technology(罗切斯特理工学院) University of Rochester(罗切斯特大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 7 figures, 14 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20241 2025-11-05 cs.LG cs.AI 62%

DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning

Qi Cao, Ruiyi Wang, Ruiyi Zhang, Sai Ashish Somayajula, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 10 figures, to appear in NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00362 2025-11-04 cs.CV cs.AI cs.GR 62%

Oitijjo-3D: Generative AI Framework for Rapid 3D Heritage Reconstruction from Street View Imagery

Momen Khandoker Ope, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Md Rashedul Islam, Jungpil Shin

机构 * University of Rajshahi(拉贾沙希大学) Marshall University(马歇尔大学) University of Aizu(御所大学) University of Asia Pacific(亚洲太平洋大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 6 Pages, 4 figures, 2 Tables, Submitted to ICECTE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00110 2025-11-04 cs.CV cs.AI 62%

Chain of Time: In-Context Physical Simulation with Image Generation Models

YingQiao Wang, Eric Bigelow, Boyi Li, Tomer Ullman

机构 * Harvard University(哈佛大学) Sakana AI NTT Research(NTT研究所) UC Berkeley(伯克利大学) Nvidia Research(NVIDIA研究)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25933 2025-10-31 cs.AI cs.HC cs.LG cs.NE 62%

Humains-Junior: A 3.8B Language Model Achieving GPT-4o-Level Factual Accuracy by Directed Exoskeleton Reasoning

Nissan Yaron, Dan Bystritsky, Ben-Etzion Yaron

机构 * Humains AI Research(Humains人工智能研究) Inpris Ltd(Inpris公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25798 2025-10-31 cs.LG cs.AI cs.CL 62%

MemEIC: A Step Toward Continual and Compositional Knowledge Editing

Jin Seong, Jiyun Park, Wencke Liermann, Hongseok Choi, Yoonji Nam, Hyun Kim, Soojong Lim, Namhoon Lee

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电子电信研究院) POSTECH Sungkyunkwan University(全南大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025, 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17784 2025-10-31 cs.LG cs.AI 62%

Revealing Multimodal Causality with Large Language Models

Jin Li, Shoujin Wang, Qi Zhang, Feng Liu, Tongliang Liu, Longbing Cao, Shui Yu, Fang Chen

机构 * University of Technology Sydney(技术大学悉尼大学) Tongji University(同济大学) University of Melbourne(墨尔本大学) University of Sydney(悉尼大学) Macquarie University(麦考瑞大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04852 2025-10-31 cs.CV cs.LG 62%

CAUSAL3D: A Comprehensive Benchmark for Causal Learning from Visual Data

Disheng Liu, Yiran Qiao, Wuche Liu, Yiren Lu, Yunlai Zhou, Tuo Liang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Datasets link: https://huggingface.co/datasets/LLDDSS/Causal3D_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22118 2025-10-29 cs.CV cs.AI 62%

GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation

Karim Elmaaroufi, Liheng Lai, Justin Svegliato, Yutong Bai, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Models for Embodied and Spatial Harmony(具身与空间和谐模型)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

Comments 22 pages, 3 figures, 3 tables, project page: https://ke7.github.io/graid/

详情

展开后加载摘要…

URL PDF HTML 收藏