arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-27 至 2026-02-27 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 10 篇

2602.22623 2026-02-27 cs.LG cs.AI cs.CL 76%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 视觉推理 :MLLM(title);分类 cs.AI、cs.LG

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19060 2026-02-27 cs.CV cs.AI cs.CL 73%

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina Elster Pantalony, Mohit Bansal, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The National Gallery of Art(国家艺术馆) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PoSh通过利用场景图引导LLM-as-a-Judge,提供了一种更准确的详细图像描述评估方法,并展示了其在新数据集DOCENT中的优越表现。

Comments Accepted at ICLR 2026. 26 pages, 9 figures. Metric/benchmark available at https://github.com/amith-ananthram/posh

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23351 2026-02-27 cs.CL cs.CV 70%

Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning

规模无法克服语用学:报告偏差对视觉-语言推理的影响

Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Samaya AI(Samaya人工智能) Mistral AI(Mistral人工智能) Allen Institute for AI(人工智能研究所)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文指出视觉-语言模型在推理能力上的不足源于训练数据中的报告偏差,通过实验表明单纯扩大数据规模无法提升推理技能,但专门收集隐含信息的注释能有效改善模型表现。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22278 2026-02-27 cs.IR cs.LG 70%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03467 2026-02-27 cs.CV 70%

ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing

ThinkRL-Edit: 基于强化学习的图像编辑推理框架

Hengjia Li, Liming Jiang, Qing Yan, Yizhi Song, Hao Kang, Zichuan Liu, Xin Lu, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 ThinkRL-Edit通过引入链式推理和无偏奖励策略,提升图像编辑的推理能力,实现更精准和稳定的编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 57%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22703 2026-02-27 cs.LG 57%

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

通过翻译引导强化学习增强VLMs的几何感知

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 通过翻译引导强化学习提升VLMs的几何感知能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV 57%

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22408 2026-02-27 cs.AI q-bio.NC 57%

Exploring Human Behavior During Abstract Rule Inference and Problem Solving with the Cognitive Abstraction and Reasoning Corpus

探索抽象规则推理和问题解决中的人类行为:认知抽象与推理语料库

Caroline Ahn, Quan Do, Leah Bakst, Michael P. Pascale, Joseph T. McGuire, Michael E. Hasselmo, Chantal E. Stern

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 CogARC通过研究人类在抽象规则推理中的行为,揭示了人们在不确定性下的策略适应与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏