arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2604.08333 2026-04-10 cs.CV cs.AI cs.LG 85%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07888 2026-03-10 cs.CV cs.AI cs.LG 85%

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03942 2026-03-05 cs.RO 85%

Lightweight Visual Reasoning for Socially-Aware Robots

轻量级视觉推理用于社交感知机器人

Alessio Galatolo, Ronald Cumbal, Alexandros Rouchitsas, Katie Winkle, Didem Gürdür Broo, Ginevra Castellano

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)

AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。

Comments ICRA26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG 85%

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24473 2025-11-20 cs.CV cs.AI cs.CL cs.LG 85%

Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks

Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) East China Normal University(华东师范大学) Zhengzhou University(郑州大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22146 2025-11-11 cs.CV cs.AI cs.LG 85%

Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs

Amirmohammad Izadi, Mohammad Ali Banayeeanzade, Fatemeh Askari, Ali Rahimiakbar, Mohammad Mahdi Vahedi, Hosein Hasani, Mahdieh Soleymani Baghshah

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14821 2025-08-06 cs.LG cs.AI cs.CV 85%

Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints

Sunil Kumar, Bowen Zhao, Leo Dirac, Paulina Varshavskaya

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19654 2025-04-01 cs.CV cs.AI cs.LG 85%

RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models

Mehdi Moshtaghi, Siavash H. Khajavi, Joni Pajarinen

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06514 2025-03-26 cs.CL cs.AI cs.CV cs.LG 85%

GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks

Haoqiang Kang, Enna Sachdeva, Piyush Gupta, Sangjae Bae, Kwonjoon Lee

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12952 2024-12-12 cs.CV cs.AI cs.LG 85%

Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models

Elaine Sui, Xiaohan Wang, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04810 2024-08-12 cs.CV cs.AI cs.LG 85%

UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling

Haider Al-Tahan, Quentin Garrido, Randall Balestriero, Diane Bouchacourt, Caner Hazirbas, Mark Ibrahim

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13311 2024-07-30 cs.CV cs.AI cs.LG 85%

ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models

Rohan Wadhawan, Hritik Bansal, Kai-Wei Chang, Nanyun Peng

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref PMLR 235:49733-49787, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18252 2024-06-18 cs.CV cs.AI cs.CL cs.LG cs.MM 85%

Beyond Embeddings: The Promise of Visual Table in Visual Reasoning

Yiwu Zhong, Zi-Yuan Hu, Michael R. Lyu, Liwei Wang

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://github.com/LaVi-Lab/Visual-Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02651 2024-05-24 cs.LG cs.AI cs.CV 85%

Vision-Language Models Provide Promptable Representations for Reinforcement Learning

William Chen, Oier Mees, Aviral Kumar, Sergey Levine

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10529 2024-01-26 cs.CV cs.AI cs.CL cs.LG 85%

Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences

Xiyao Wang, Yuhang Zhou, Xiaoyu Liu, Hongjin Lu, Yuancheng Xu, Feihong He, Jaehong Yoon, Taixi Lu, Gedas Bertasius, Mohit Bansal, Huaxiu Yao, Furong Huang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 27 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16395 2023-08-01 cs.CV cs.AI cs.CL cs.LG 85%

Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks

Kousik Rajesh, Mrigank Raman, Mohammed Asad Karim, Pranit Chawla

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.11524 2020-08-27 cs.LG cs.AI cs.CV cs.NE cs.SC stat.ML 85%

Neuro-Symbolic Visual Reasoning: Disentangling "Visual" from "Reasoning"

Saeed Amizadeh, Hamid Palangi, Oleksandr Polozov, Yichen Huang, Kazuhito Koishida

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published in Proceedings of the 37th International Conference on Machine Learning (ICML), Online, PMLR 119, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18151 2026-03-31 cs.DC cs.AR cs.CV cs.LG cs.NI 84%

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(国民大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。

Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11604 2025-06-30 cs.AI cs.CL cs.CV 84%

VLM@school -- Evaluation of AI image understanding on German middle school knowledge

René Peinl, Vincent Tischler

专题命中 视觉推理 :VLM(title,comments);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Peinl, René; Tischler, Vincent (2025): VLM@school - Evaluation of AI image understanding on German middle school knowledge. Future Technologies Conference (FTC) 2025, Munich, Germany 2025 (accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23354 2026-08-25 cs.RO cs.CV 新提交 84%

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

OptiSight:弥合具身导航中的语义推理与几何控制

Alperen Avan, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人学与工业信息研究所(西班牙国家研究委员会-加泰罗尼亚理工大学))

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出OptiSight混合框架,结合VLM推理与确定性视觉伺服,在8GB VRAM预算下,于AI Habitat中实现了多种室内场景下的可靠零样本具身导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19807 2026-08-21 cs.LG 新提交 84%

Answer-Level Trust Selection for Physical Vision-Language Reasoning

面向物理视觉-语言推理的答案级信任选择

Rongyu Yu, Ke Niu, Fengxiang He

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG

AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 84%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 84%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14756 2026-07-17 cs.AI 新提交 84%

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

人工智能与人类专家推理:基于街景图像评估建筑类型预测中的一致性

Zahratu Shabrina, Muhammad Asa, Jin Rui, Lu Yin, Stephen Law

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型从街景图像推断建筑类型的潜力,将其预测与人类专家比较,评估多种VLM,发现思维链提示性能更稳定,通过分析关键词概率研究推理过程,表明VLM能逼近专家能力,为城市分析提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新 84%

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 84%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10120 2026-07-14 cs.CV 新提交 84%

WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

WeaveEarth:用于免训练超高分辨率遥感理解的结构化证据构建与推理

Xianzhi Ma, Shujun Wang, Xiaohan Li, Hao Liu, Changhua Pei, Jianhui li

机构 * School of Frontier Sciences, Nanjing University(南京大学前沿科学学院) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对UHR遥感图像理解,提出免训练框架WeaveEarth,通过全局感知证据构建选最小支持证据集,经结构化证据推理增强VLM全局-局部联合推理能力,在多基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新 84%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交 84%

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04779 2026-07-07 cs.CV 新提交 84%

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

DGSeg:用于推理分割的语义-空间引导预测的动态门控

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏