arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4507 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 75%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 视觉推理 :vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21037 2026-01-30 cs.LG cs.AI cs.CL cs.CV 75%

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

基于框架的思考:视觉上下文和测试时扩展如何增强视频推理

Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) Hong Kong University of Science(香港科学大学) University of California San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。

Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 75%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01006 2026-01-05 cs.CV cs.AI cs.LG 75%

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Haochen Li, Jiale Zhu, Jiali Chen, Jiaxing Xu, Jiazheng Xu, Jing Chen, Jinghao Lin, Jinhao Chen, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Ruiliang Lyu, Shangqin Tu, Sheng Yang, Shengbiao Meng, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wei Jia, Wenkai Li, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyu Zhang, Xinyue Fan, Xuancheng Huang, Yadong Xue, Yanfeng Wang, Yanling Wang, Yanzi Wang, Yifan An, Yifan Du, Yiheng Huang, Yilin Niu, Yiming Shi, Yu Wang, Yuan Wang, Yuanchang Yue, Yuchen Li, Yusen Liu, Yutao Zhang, Yuting Wang, Yuxuan Zhang, Zhao Xue, Zhengxiao Du, Zhenyu Hou, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07148 2025-12-17 cs.CV cs.AI cs.CL cs.LG 75%

MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models

MM-PoE:通过多模态模型的排除过程进行多选推理

Sayak Chakrabarty, Souradip Pal

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 75%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17773 2025-12-05 cs.CV cs.AI cs.CL cs.LG 75%

KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models

KiVA:儿童启发的视觉类比用于测试大多模态模型

Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko

机构 * University of California, Berkeley(加州大学伯克利分校) Boston University(波士顿大学) Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 视觉推理 :LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 KiVA通过4300个日常物体视觉转换测试大模型的类比推理能力,发现儿童和成人表现优于现有模型,尤其在复杂任务上存在显著差距。

Comments 10 pages. Project website: https://ey242.github.io/kiva.github.io/. Benchmark and code: https://github.com/ey242/KiVA

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22633 2025-11-25 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

Spatial Knowledge Graph-Guided Multimodal Synthesis

基于空间知识图的多模态合成

Yida Xue, Zhen Bi, Jinnan Yang, Jungang Lou, Kehai Chen, Min Zhang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Science and Technology(南京理工大学) Huzhou University(湖州大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26474 2025-10-31 cs.CV cs.AI cs.CL cs.LG 75%

Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing

Xin Guo, Zhiheng Xi, Yiwen Ding, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03441 2025-10-07 cs.CV cs.AI cs.LG 75%

Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning

Chashi Mahiul Islam, Oteo Mamo, Samuel Jacob Chacko, Xiuwen Liu, Weikuan Yu

机构 * Florida State University(佛罗里达州立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 75%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00855 2025-10-02 cs.CV cs.AI cs.CL cs.LG 75%

Can World Models Benefit VLMs for World Dynamics?

Kevin Zhang, Kuangzhi Ge, Xiaowei Chi, Renrui Zhang, Shaojun Shi, Zhen Dong, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://dyva-worldlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21113 2025-09-03 cs.CV cs.AI cs.LG 75%

R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning

Qi Yang, Bolin Ni, Shiming Xiang, Han Hu, Houwen Peng, Jie Jiang

机构 * Tencent Hunyuan Team(腾讯文言团队) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 20 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24878 2025-06-02 cs.AI cs.CL cs.CV cs.LG 75%

Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents

Yaxin Luo, Zhaoyi Li, Jiacheng Liu, Jiacheng Cui, Xiaohan Zhao, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(VILA实验室,MBZUAI) MetaAgentX

专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code at: https://github.com/MetaAgentX/OpenCaptchaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16832 2025-05-29 cs.AI cs.CL cs.CV cs.LG 75%

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

Haonian Ji, Shi Qiu, Siyang Xin, Siwei Han, Zhaorun Chen, Dake Zhang, Hongyi Wang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Rutgers University(罗格斯大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10886 2025-03-17 cs.CV cs.AI cs.IR cs.LG q-bio.PE 75%

Taxonomic Reasoning for Rare Arthropods: Combining Dense Image Captioning and RAG for Interpretable Classification

Nathaniel Lesperance, Sujeevan Ratnasingham, Graham W. Taylor

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06978 2025-03-11 cs.CV cs.AI cs.LG cs.RO 75%

Lightweight Multimodal Artificial Intelligence Framework for Maritime Multi-Scene Recognition

Xinyu Xi, Hua Yang, Shentai Zhang, Yijie Liu, Sijin Sun, Xiuju Fu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 19 pages, 4 figures, submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09132 2025-02-28 cs.LG cs.AI cs.CV 75%

When Graph meets Multimodal: Benchmarking and Meditating on Multimodal Attributed Graphs Learning

Hao Yan, Chaozhuo Li, Jun Yin, Zhigang Yu, Weihao Han, Mingzheng Li, Zhengxin Zeng, Hao Sun, Senzhang Wang

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02302 2025-01-22 cs.CV cs.AI cs.LG 75%

Beyond Specialization: Assessing the Capabilities of MLLMs in Age and Gender Estimation

Maksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04998 2024-11-08 cs.CV cs.AI cs.LG 75%

HourVideo: 1-Hour Video-Language Understanding

Keshigeyan Chandrasegaran, Agrim Gupta, Lea M. Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, Li Fei-Fei

专题命中 视觉推理 :LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15680 2024-07-23 cs.CV cs.AI cs.LG cs.MM 75%

HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning

Zhecan Wang, Garrett Bingham, Adams Yu, Quoc Le, Thang Luong, Golnaz Ghiasi

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a main conference paper at ECCV 2024 (https://github.com/google/haloquest)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02544 2024-07-17 cs.CV cs.AI cs.LG 75%

LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model

Dilxat Muhtar, Zhenshi Li, Feng Gu, Xueliang Zhang, Pengfeng Xiao

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 36 pages, 10 figures. Github https://github.com/NJU-LHRS/LHRS-Bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15610 2024-06-14 cs.CL 75%

Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning

Tejas Srinivasan, Jack Hessel, Tanmay Gupta, Bill Yuchen Lin, Yejin Choi, Jesse Thomason, Khyathi Raghavi Chandu

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);LLaVA(abstract)

Comments Accepted to ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18775 2023-12-01 cs.CV cs.AI cs.CL cs.LG cs.SD eess.AS 75%

CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation

Zineng Tang, Ziyi Yang, Mahmoud Khademi, Yang Liu, Chenguang Zhu, Mohit Bansal

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Page: https://codi-2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09241 2023-11-17 cs.CV cs.AI cs.LG 75%

Chain of Images for Intuitively Reasoning

Fanxu Meng, Haotong Yang, Yiding Wang, Muhan Zhang

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05973 2023-11-03 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li, Jiajun Wu, Li Fei-Fei

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15296 2024-12-10 cs.CV cs.AI cs.CL 74%

MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs

Chaoyou Fu, Yi-Fan Zhang, Shukang Yin, Bo Li, Xinyu Fang, Sirui Zhao, Haodong Duan, Xing Sun, Ziwei Liu, Liang Wang, Caifeng Shan, Ran He

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI;LLaVA(comments)

Comments Produced by MME+MMBench+LLaVA Teams. Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 74%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11534 2026-08-13 cs.CL cs.CV 新提交 74%

CT-$Δ$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models

CT-ΔBench:基于视觉语言模型的纵向3D医学影像差异报告基准

Kegeng Tang, Jingbo Wang, Shaogang Ren, Zihao Wang

机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 本文针对现有医学基础模型缺乏纵向影像差异处理能力的问题,构建了专用基准CT-ΔBench,开发感知变化指标与医师验证流程,对比不同推理方式并提出基线模型DeltaMed,为时间感知医学基础模型奠定基础。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 74%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 视觉推理 :vision-language model(title);分类 cs.LG

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏