arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-12 至 2025-12-12 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 6 篇

2512.10300 2025-12-12 cs.AI 83%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10384 2025-12-12 cs.CV cs.AI 81%

Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies

基于大视觉语言模型的细粒度识别:基准测试与优化策略

Cong Pang, Hongtao Yu, Zixuan Chen, Lewei Lu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) Southeast University(东南大学) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :visual language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FROW基准测试和优化策略,通过马赛克数据和开放世界数据提升大视觉语言模型的细粒度识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 62%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08511 2025-12-12 cs.CV 57%

Thinking with Images via Self-Calling Agent

通过自我调用代理进行图像思考

Wenxi Yang, Yuzhong Zhao, Fang Wan, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。

Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 50%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 50%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision language model(abstract)

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏