arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2511.15948 2025-11-26 cs.CV 57%

Click2Graph: Interactive Panoptic Video Scene Graphs from a Single Click

Click2Graph: 从单次点击生成交互式全景视频场景图

Raphael Ruschel, Hardikkumar Prajapati, Awsafur Rahman, B. S. Manjunath

机构 * UC Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 Click2Graph通过单次点击实现交互式全景视频场景图生成,结合视觉提示与语义推理,提升视频场景理解的可控性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05034 2025-11-26 cs.CV 57%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10007 2025-11-26 cs.AI 57%

Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning

深度隐式认知促进可靠推理链推理

Zijun Chen, Wenbo Hu, Richang Hong

机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。

Comments This paper has been accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV 57%

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18714 2025-11-25 cs.AI cs.CY 57%

MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation

MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成

Zhenyu Wu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 57%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 57%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18437 2025-11-25 cs.CV 57%

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 57%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17094 2025-11-24 cs.CV 57%

Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models

稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架

He Huang, Zixuan Hu, Dongxiao Li, Yao Xiao, Ling-Yu Duan

机构 * School of Computer Science Peking University(北京大学计算机科学学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 57%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 视觉推理 :visual language model(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 57%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08987 2025-11-21 cs.AI 57%

Towards Efficient Multimodal Unified Reasoning Model via Model Merging

通过模型合并实现高效的多模态统一推理模型

Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。

Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24709 2025-11-20 cs.CV 57%

IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?

Yang Chen, Minghao Liu, Yufan Shen, Yunwen Li, Tianyuan Huang, Xinyu Fang, Tianyu Zheng, Wenxuan Huang, Cheng Yang, Daocheng Fu, Jianbiao Mei, Rong Wu, Yunfei Zhao, Licheng Wen, Xuemeng Yang, Song Mao, Qunshu Lin, Zhi Yu, Yongliang Shen, Yu Qiao, Botian Shi

机构 * IWR-Bench Team(IWR-Bench团队)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14884 2025-11-20 cs.CV 57%

GeoSceneGraph: Geometric Scene Graph Diffusion Model for Text-guided 3D Indoor Scene Synthesis

Antonio Ruiz, Tao Wu, Andrew Melnik, Qing Cheng, Xuqin Wang, Lu Liu, Yongliang Wang, Yanfeng Zhang, Helge Ritter

机构 * Huawei Technologies(华为技术有限公司) Center for Cognitive Interaction Technology (CITEC), Bielefeld University(认知交互技术中心(CITEC),比勒菲尔德大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14777 2025-11-20 cs.AI 57%

The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs

Mahdi Samiei, Mahdi Mansouri, Mahdieh Soleymani Baghshah

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00261 2025-11-20 cs.CV cs.HC 57%

Spot The Ball: A Benchmark for Visual Social Inference

Neha Balamurugan, Sarah Wu, Adam Chun, Gabe Gaw, Cristobal Eyzaguirre, Tobias Gerstenberg

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12368 2025-11-18 cs.CV 57%

Fast Reasoning Segmentation for Images and Videos

Yiqing Shen, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02473 2025-11-18 cs.CV 57%

Generative Perception of Shape and Material from Differential Motion

Xinran Nicole Han, Ko Nishino, Todd Zickler

机构 * Harvard University(哈佛大学) Kyoto University(京都大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05456 2025-11-18 cs.CV 57%

SITE: towards Spatial Intelligence Thorough Evaluation

Wenqi Wang, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao, Boqing Gong

机构 * Boston University(波士顿大学) Microsoft Research(微软研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11434 2025-11-17 cs.CV 57%

WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation

Wei Chow, Jiachun Pan, Yongyuan Liang, Mingze Zhou, Xue Song, Liyu Jia, Saining Zhang, Siliang Tang, Juncheng Li, Fengda Zhang, Weijia Wu, Hanwang Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Maryland, College Park(马里兰大学学院公园分校) Zhejiang University(浙江大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11126 2025-11-17 cs.CL cs.CV 57%

Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion

Yi Shi, Wenlong Meng, Zhenyuan Guo, Chengkun Wei, Wenzhi Chen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10769 2025-11-17 cs.CV 57%

Unifying Segment Anything in Microscopy with Vision-Language Knowledge

Manyu Li, Ruian He, Zixian Zhang, Chenxi Ma, Weimin Tan, Bo Yan

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10648 2025-11-14 cs.CV 57%

Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling

Jiahao Wang, Weiye Xu, Aijun Yang, Wengang Zhou, Lewei Lu, Houqiang Li, Xiaohua Wang, Jinguo Zhu

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09067 2025-11-13 cs.CL cs.AI 57%

MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique

Gailun Zeng, Ziyang Luo, Hongzhan Lin, Yuchen Tian, Kaixin Li, Ziyang Gong, Jianxiong Guo, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) National University of Singapore(新加坡国立大学) Beijing Normal University(北京师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 28 pages, 14 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23990 2025-11-13 cs.AI 57%

Multi-RAG: A Multimodal Retrieval-Augmented Generation System for Adaptive Video Understanding

Mingyang Mao, Mariela M. Perez-Cabarcas, Utteja Kallakuri, Nicholas R. Waytowich, Xiaomin Lin, Tinoosh Mohsenin

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08024 2025-11-12 cs.AI 57%

Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning

Tianwen Lyu, Xiang Zhuang, Keyan Ding, Xinzhe Cao, Lei Liang, Wei Zhao, Qiang Zhang, Huajun Chen

机构 * The Polytechnic Institute, Zhejiang University(浙江大学Polytechnic学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) University of Oxford(牛津大学) Ant Group(蚂蚁集团) University of Aberdeen(阿伯丁大学) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07912 2025-11-12 cs.AI 57%

Neurophysiological Characteristics of Adaptive Reasoning for Creative Problem-Solving Strategy

Jun-Young Kim, Young-Seok Kweon, Gi-Hwan Shin, Seong-Whan Lee

机构 * Dept. of Artificial Intelligence(人工智能系) Korea University(韩国大学) Dept. of Brain and Cognitive Engineering(脑科学与认知工程系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 4 pages, 4 figures, 1 table,

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18905 2025-11-12 cs.AI 57%

How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective

Songsong Yu, Yuxin Chen, Hao Ju, Lianjie Jia, Fuxi Zhang, Shaofei Huang, Yuhan Wu, Rundi Cui, Binghao Ran, Zaibin Zhang, Zhedong Zheng, Zhipeng Zhang, Yifan Wang, Lin Song, Lijun Wang, Yanwei Li, Ying Shan, Huchuan Lu

机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06991 2025-11-11 cs.LG 57%

CoLM: Collaborative Large Models via A Client-Server Paradigm

Siqi Huang, Sida Huang, Hongyuan Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏