arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-07 至 2026-01-07 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 8 篇

2601.02422 2026-01-07 cs.CV cs.AI 86%

Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning

拓宽视野并深入思考:协作式跨模态链式推理用于复杂视觉推理

Wenting Lu, Didi Zhu, Tao Shen, Donglin Zhu, Ayong Ye, Chao Wu

机构 * Fujian Normal University(福建师范大学) Zhejiang University(浙江大学) Zhejiang Normal University(浙江师范大学)

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CoCoT通过动态多区域定位和关系感知推理,提升复杂视觉推理性能,在多个基准测试中实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI 79%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 70%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20100 2026-01-07 cs.LG cs.AI cs.CL cs.CV 67%

MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations

MIRAGE:农业专家引导对话中多模态信息检索与推理的基准

Vardhan Dongre, Chi Gui, Shubham Garg, Hooshang Nayyeri, Gokhan Tur, Dilek Hakkani-Tür, Vikram S. Adve

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MIRAGE是一个用于农业专家引导对话中多模态信息检索与推理的基准,通过真实用户-专家交互数据,提供高保真的多模态推理评估平台。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19542 2026-01-07 cs.CV 57%

CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning

CVBench: 多视频协同推理的基准测试

Nannan Zhu, Yonghao Dong, Teng Wang, Xueqian Li, Shengjun Deng, Yijia Wang, Zheng Hong, Tiantian Geng, Guo Niu, Hanyan Huang, Xiongfei Yao, Shuaiwei Jiao

机构 * Sun Yat-sen University(中山大学) University of Hong Kong(香港大学) Foshan University(佛山大学) University of Birmingham(伯明翰大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 CVBench通过跨视频关系推理基准测试,揭示多模态大语言模型在跨视频时空推理中的性能差距及架构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 57%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17417 2026-01-07 cs.LG 57%

Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?

顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?

Mingyuan Wu, Meitang Li, Jingcheng Yang, Jize Jiang, Kaizhuo Yan, Zhaoheng Li, Hanchao Yu, Minjia Zhang, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Meta

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。

Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 57%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏