arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 19 篇

2510.02240 2026-02-24 cs.CV cs.AI 86%

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。

Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 85%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19615 2026-02-24 cs.CV 83%

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Department of Computer Science, University of Memphis(密苏里大学计算机科学系)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV 83%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 81%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 81%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15950 2026-02-24 cs.CV cs.LG 81%

Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

视觉-语言模型能识别正方形吗?文本识别在三种模型家族中介导空间推理

Yuval Levental

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究发现视觉-语言模型在处理非文本视觉元素时存在空间定位能力缺陷,文本识别性能显著优于其本机视觉路径。

Comments 9 pages, 3 figures, 2 tables. Workshop-length paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07543 2026-02-24 cs.CV cs.CL 79%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 79%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 视觉推理 :MLLM(title);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI 73%

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 70%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19516 2026-02-24 cs.CE 67%

Pixel2Phys: Distilling Governing Laws from Visual Dynamics

Pixel2Phys: 从视觉动态中提炼 governing laws

Ruikun Li, Jun Yao, Yingfan Hua, Shixiang Tang, Biqing Qi, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。

Comments CVPR2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13742 2026-02-24 cs.CV cs.AI 62%

DL$^3$M: A Vision-to-Language Framework for Expert-Level Medical Reasoning through Deep Learning and Large Language Models

DL$^3$M: 一种通过深度学习和大语言模型实现专家级医学推理的视觉-语言框架

Md. Najib Hasan, Imran Ahmad, Sourav Basak Shuvo, Md. Mahadi Hasan Ankon, Sunanda Das, Nazmul Siddique, Hui Wang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 DL$^3$M通过结合深度学习和大语言模型,实现专家级医学推理,但当前LLMs在高风险医疗决策中仍不可靠。

Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13444 2026-02-24 cs.CV cs.AI 62%

VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning

VideoMind: 一种用于时序 grounded 视频推理的链式 LoRA 代理

Ye Liu, Kevin Qinghong Lin, Chang Wen Chen, Mike Zheng Shou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 VideoMind 提出了一种基于角色的链式 LoRA 机制,用于提升视频时序 grounded 推理的效率与灵活性。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19359 2026-02-24 cs.RO cs.LG 57%

Vid2Sid: Videos Can Help Close the Sim2Real Gap

Vid2Sid: 视频可以帮助缩小仿真到现实的差距

Kevin Qiu, Yu Zhang, Marek Cygan, Josie Hughes

专题命中 视觉推理 :VLM(abstract);分类 cs.LG

AI总结 Vid2Sid通过视频驱动的系统识别方法,结合基础模型感知与VLM循环优化器,实现仿真到现实的物理参数校准,提供可解释的推理并提升校准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19063 2026-02-24 cs.CV 57%

Direction-aware 3D Large Multimodal Models

具有方向感知的3D大多模态模型

Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-02-24 cs.CV 57%

A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18806 2026-02-24 cs.CL cs.AI 57%

Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models

Think$^{2}$: 大语言模型中的 grounded 元认知推理

Abraham Paul Elenjical, Vivek Hruday Kavuri, Vasudeva Varma

机构 * IIIT Hyderabad(IIIT海得拉尔)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 Think$^{2}$通过引入基于心理理论的元认知框架,提升大语言模型的自我诊断与纠正能力,显著提高推理准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13614 2026-02-24 cs.CL 50%

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

MemoTime: 带记忆的时序知识图增强大语言模型推理

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW Data61(新南威尔士大学Data61) CSIRO(澳大利亚联邦科学与工业研究组织) UNSW Sydney Australia(新南威尔士大学悉尼分校) Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织)

专题命中 视觉推理 :grounding(abstract)

AI总结 MemoTime通过带记忆的时序知识图框架提升LLM的时序推理能力,解决多跳推理、多实体同步、运算符适应和经验重用等挑战,实现先进性能。

Comments Accepted by The Web Conference 2026 (WWW, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏