arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-02 至 2025-12-02 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2511.12263 2025-12-02 cs.CV cs.AI 81%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22625 2025-12-02 cs.CV 70%

ReasonEdit: Towards Reasoning-Enhanced Image Editing Models

ReasonEdit: 向推理增强的图像编辑模型迈进

Fukun Yin, Shiyu Liu, Yucheng Han, Zhibo Wang, Peng Xing, Rui Wang, Wei Cheng, Yingming Wang, Aojie Li, Zixin Yin, Pengtao Chen, Xiangyu Zhang, Daxin Jiang, Xianfang Zeng, Gang Yu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ReasonEdit通过引入思考和反思机制,提升图像编辑模型的推理能力,实现更准确的编辑效果。

Comments code: https://github.com/stepfun-ai/Step1X-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 70%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 70%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00736 2025-12-02 cs.LG cs.AI cs.CV 67%

REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories

REM:通过多帧轨迹评估大语言模型的具身空间推理

Jacob Thompson, Emiliano Garcia-Lopez, Yonatan Bisk

机构 * Department of Computer Science(计算机科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。

Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00194 2025-12-02 cs.CV cs.LG eess.IV q-bio.QM 62%

AutocleanEEG ICVision: Automated ICA Artifact Classification Using Vision-Language AI

AutocleanEEG ICVision:利用视觉-语言AI实现自动化ICA噪声分类

Zag ElSayed, Grace Westerkamp, Gavin Gammoh, Yanchen Liu, Peyton Siekierski, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 奥地利辛辛那提大学 美国俄亥俄州)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 ICVision通过视觉-语言AI实现自动化EEG ICA噪声分类,达到专家级准确度并提供可解释结果。

Comments 6 pages, 8 figures

Journal ref Conference ICMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV 57%

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07867 2025-12-02 cs.CV 57%

Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models

持续感知至关重要:多模态模型中时间整合失败的诊断

Zeyu Wang, Zhenzhen Weng, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出CP-Bench,通过简单任务揭示多模态模型在持续感知中的时间整合缺陷,指出现有模型无法有效跨时间积累证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00729 2025-12-02 cs.AI cs.CL 57%

Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens

探查大型推理模型的“心理”:通过人类视角理解

Yuxiang Chen, Zuohan Wu, Ziwei Wang, Xiangning Yu, Xujia Li, Linyi Yang, Mengyue Yang, Jun Wang, Lei Chen

机构 * University College London London United Kingdom The Hong Kong University of Science Tianjin University Tianjin China Southern University of Science University of Bristol Bristol United Kingdom University College London AI Lab, the Yangtze River Delta, China Tianjin University University of Bristol

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文通过引入分类体系和CAPO框架,从人类视角深入分析大型推理模型,揭示其推理过程中的不足,并提出改进方向。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00582 2025-12-02 cs.CV 57%

SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension

SatireDecoder: 视觉级联解耦以增强讽刺图像理解

Yue Jiang, Haiwei Xue, Minghao Han, Mingcheng Li, Xiaolu Hou, Dingkang Yang, Lihua Zhang, Xu Zheng

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 SatireDecoder通过视觉级联解耦和不确定性分析策略,提升讽刺图像理解的准确性和语义层次。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15607 2025-12-02 cs.RO 50%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏