arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-06 至 2025-11-06 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 8 篇

2506.21448 2025-11-06 eess.AS cs.CV cs.SD 79%

ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing

Huadai Liu, Kaicheng Luo, Jialei Wang, Wen Wang, Qian Chen, Zhou Zhao, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港理工大学) Tongyi Fun Team, Alibaba Group(阿里云团队) Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04220 2025-11-06 cs.CV 77%

Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs

Fangrui Zhu, Hanhui Wang, Yiming Xie, Jing Gu, Tianye Ding, Jianwei Yang, Huaizu Jiang

机构 * Northeastern University(东北大学) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2025, code link: https://github.com/neu-vi/struct2d

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04201 2025-11-06 cs.CV cs.AI 73%

ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs

Ben Zhang, LuLu Yu, Lei Gao, QuanJiang Guo, Jing Liu, Hui Gao

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03206 2025-11-06 cs.CV cs.AI cs.LG 67%

QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models

Kuei-Chun Kao, Hsu Tzu-Yin, Yunqi Hong, Ruochen Wang, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21861 2025-11-06 cs.LG cs.AI cs.CL 62%

The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems

Bentley DeVilling

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 2 figures. Category: cs.LG. Code and data: https://github.com/Course-Correct-Labs/mirror-loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02834 2025-11-06 cs.AI cs.CL cs.LG 62%

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao, Wei Wang, Ravender Pal Singh

机构 * Amazon(亚马逊公司) Rochester Institute of Technology(罗切斯特理工学院) University of Rochester(罗切斯特大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 7 figures, 14 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03471 2025-11-06 cs.AI cs.HC 57%

Towards Scalable Web Accessibility Audit with MLLMs as Copilots

Ming Gu, Ziwei Wang, Sicen Lai, Zirui Gao, Sheng Zhou, Jiajun Bu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 15 pages. Accepted by AAAI 2026 AISI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 50%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :MLLM(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏