arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 16 篇

2510.10052 2025-10-14 cs.CV cs.AI 89%

Think Twice to See More: Iterative Visual Reasoning in Medical VLMs

Kaitao Chen, Shaohao Rui, Yankai Jiang, Jiamin Wu, Qihao Zheng, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Rutgers University(罗格斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

Comments 25 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11718 2025-10-14 cs.CV cs.AI 86%

CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images

Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu

机构 * HKU(香港大学) Meituan(美团) CUHK(香港中文大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10991 2025-10-14 cs.CV cs.AI cs.CL 84%

A Survey on Agentic Multimodal Large Language Models

Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Research Institute of Big Data, China(大数据研究 institute) Sun Yat-sen University, China(中山大学) City University of Hong Kong, China(香港城市大学) Communication University of China, China(通信大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11012 2025-10-14 cs.CV 83%

COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11631 2025-10-14 cs.CV cs.AI cs.NE 81%

EvoCAD: Evolutionary CAD Code Generation with Vision Language Models

Tobias Preintner, Weixuan Yuan, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * Institute of Advanced Computer Science, Leiden University, Leiden, The Netherlands(先进计算机科学研究所,莱顿大学,莱顿,荷兰)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to IEEE ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24138 2025-10-14 cs.LG cs.AI 81%

AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits

Yichen Shi, Ze Zhang, Hongyang Wang, Zhuofu Tao, Zhongyi Li, Bingyu Chen, Yaxin Wang, Zhen huang, Xuhua Liu, Quan Chen, Zhiping Yu, Ting-Jung Lin, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(美国加州大学洛杉矶分校) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10117 2025-10-14 cs.AI 79%

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

Comments EMNLP 2025 Wordplay (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10973 2025-10-14 cs.CV cs.LG 73%

Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning

Sanchit Sinha, Oana Frunza, Kashif Rasul, Yuriy Nevmyvaka, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Morgan Stanley(摩根士丹利)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12661 2025-10-14 cs.LG cs.CL cs.CV 73%

VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization

Menglan Chen, Xianghe Pang, Jingjing Dong, WenHao Wang, Yaxin Du, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11606 2025-10-14 cs.CV 70%

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Yicheng Xu, Yue Wu, Jiashuo Yu, Ziang Yan, Tianxiang Jiang, Yinan He, Qingsong Zhao, Kai Chen, Yu Qiao, Limin Wang, Manabu Okumura, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Institute of Science Tokyo(东京科学研究所) Nanjing University(南京大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Data & Code: https://github.com/OpenGVLab/ExpVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09282 2025-10-14 cs.CV 70%

VideoAds for Fast-Paced Video Understanding

Zheyuan Zhang, Monica Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong

机构 * Northwestern University(西北大学) Boston University(波士顿大学)

专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01181 2025-10-14 cs.AI cs.CV cs.MM cs.SD eess.AS 62%

Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

Zhiyuan Han, Beier Zhu, Yanlong Xu, Peipei Song, Xun Yang

机构 * University of Science and Technology of China(科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ACM Multimedia 2025 Oral Code: https://github.com/ZhiyuanHan-Aaron/MoSEAR Project Page: https://zhiyuanhan-aaron.github.io/MoSEAR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10976 2025-10-14 cs.AI 57%

Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph

Wentao Wang, Heqing Zou, Tianze Luo, Rui Huang, Yutian Zhao, Zhuochen Wang, Hansheng Zhang, Chengwei Qin, Yan Wang, Lin Zhao, Huaijian Zhang

机构 * ByteDance(字节跳动) NUS(国立大学新加坡) HKUST(GZ)(香港科技大学(珠海)) THU(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18673 2025-10-14 cs.CL cs.AI cs.MM 57%

Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum

Xinglong Yang, Quan Feng, Zhongying Pan, Xiang Chen, Yu Tian, Wentong Li, Shuofei Qiao, Yuxia Geng, Xingyu Zhao, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hunan Vanguard Group Corporation Co., Ltd.(湖南 Vanguard集团有限公司) Huaneng Information Technology Co., Ltd.(华能信息技术有限公司) Tsinghua University(清华大学) Zhejiang University(浙江大学) PowerChina Huadong Engineering Co., Ltd.(中国电建华东工程有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08540 2025-10-14 cs.CV 57%

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

Xiangyu Zhao, Junming Lin, Tianhao Liang, Yifan Zhou, Wenhao Chai, Yuzhe Gu, Weiyun Wang, Kai Chen, Gen Luo, Wenwei Zhang, Junchi Yan, Hua Yang, Haodong Duan, Xue Yang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01773 2025-10-14 cs.CL 50%

Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas

Shiqi Chen, Tongyao Zhu, Ruochen Zhou, Jinghan Zhang, Siyang Gao, Juan Carlos Niebles, Mor Geva, Junxian He, Jiajun Wu, Manling Li

机构 * City University of Hong Kong(香港城市大学) National University of Singapore(新加坡国立大学) Hong Kong University of Science(香港科学大学) Stanford University(斯坦福大学) Salesforce Research(Salesforce研究) Tel Aviv University(特拉维夫大学) Northwestern University(西北大学)

专题命中 视觉推理 :vision language model(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏