arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-18 至 2025-11-18 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 19 篇

2510.06067 2025-11-18 cs.CV cs.AI 86%

Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA

Python Song, Luke Tenyi Chang, Yun-Yun Tsai, Penghui Li, Junfeng Yang

机构 * Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 14pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12365 2025-11-18 cs.CV 85%

Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning

Yiqing Shen, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13378 2025-11-18 cs.DL cs.AI cs.LG cs.MM 84%

Moving Pictures of Thought: Extracting Visual Knowledge in Charles S. Peirce's Manuscripts with Vision-Language Models

Carlo Teo Pedretti, Davide Picca, Dario Rodighiero

机构 * Department of Classics, University Sapienza of Rome(罗马大学萨皮恩扎文学院) Department of Language and Communication Sciences, University of Lausanne(洛桑大学语言与沟通科学系) Campus Fryslân, University of Groningen(格罗宁根大学弗里斯兰校区)

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11751 2025-11-18 cs.CV cs.AI cs.MA 84%

Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Zhenghao He, Aidong Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments AAAI 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12008 2025-11-18 cs.AI cs.CV cs.LG 82%

Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models

Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin

机构 * Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部) Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部) Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部) Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系) Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11831 2025-11-18 cs.AI cs.CV cs.LG 82%

TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models

Wenhao Zhou, Hao Zheng, Rong Zhao

机构 * Center for Brain-Inspired Computing Research (CBICR)(脑启发计算研究中心) Department of Precision Instruments(精密仪器系) IDG/McGovern Institute for Brain Research(IDG/麦戈文脑研究学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11916 2025-11-18 cs.AI 79%

An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR

Sinan Urgun, Seçkin Arı

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00844 2025-11-18 cs.CV cs.LG 79%

PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks

Abdelrahman Elskhawy, Mengze Li, Nassir Navab, Benjamin Busam

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12868 2025-11-18 cs.CV cs.AI 73%

Video Finetuning Improves Reasoning Between Frames

Ruiqi Yang, Tian Yun, Zihan Wang, Ellie Pavlick

机构 * Brown University(布朗大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at CogInterp @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15222 2025-11-18 cs.AI cs.CV cs.MA 73%

See it. Say it. Sorted: Agentic System for Compositional Diagram Generation

Hantao Zhang, Jingyang Liu, Ed Li

机构 * Yale University(耶鲁大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12027 2025-11-18 cs.CV cs.AI 73%

GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory

Jeong Hun Yeo, Sangyun Chung, Sungjune Park, Dae Hoe Kim, Jinyoung Moon, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13054 2025-11-18 cs.CV 70%

ViSS-R1: Self-Supervised Reinforcement Video Reasoning

Bo Fang, Yuxin Song, Qiangqiang Wu, Haoyuan Sun, Wenhao Wu, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) The University of Sydney(悉尼大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Our paper was initially titled "Video-SSR1: Self-Supervised Reinforcement Video Reasoning." Upon noticing its close resemblance to the title of a recently released paper, we have decided to rename our work as "ViSS-R1."

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12371 2025-11-18 cs.CV 70%

Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models

Yiqing Shen, Chenxiao Fan, Chenjia Li, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02329 2025-11-18 cs.CV 70%

VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions

Ziteng Wang, Siqi Yang, Limeng Qiao, Lin Ma

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11704 2025-11-18 cs.LG cs.CV 62%

Simple Vision-Language Math Reasoning via Rendered Text

Matvey Skripkin, Elizaveta Goncharova, Andrey Kuznetsov

机构 * FusionBrain Lab(融合脑实验室) HSE University(俄罗斯高等经济学院) Innopolis University(因诺波利斯大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12368 2025-11-18 cs.CV 57%

Fast Reasoning Segmentation for Images and Videos

Yiqing Shen, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02473 2025-11-18 cs.CV 57%

Generative Perception of Shape and Material from Differential Motion

Xinran Nicole Han, Ko Nishino, Todd Zickler

机构 * Harvard University(哈佛大学) Kyoto University(京都大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05456 2025-11-18 cs.CV 57%

SITE: towards Spatial Intelligence Thorough Evaluation

Wenqi Wang, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao, Boqing Gong

机构 * Boston University(波士顿大学) Microsoft Research(微软研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13327 2025-11-18 cs.RO 50%

ZeroDexGrasp: Zero-Shot Task-Oriented Dexterous Grasp Synthesis with Prompt-Based Multi-Stage Semantic Reasoning

Juntao Jian, Yi-Lin Wei, Chengjie Mou, Yuhao Lin, Xing Zhu, Yujun Shen, Wei-Shi Zheng, Ruizhen Hu

机构 * Shenzhen University(深圳大学) Sun Yat-sen University(中山大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏