arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2509.11645 2025-10-14 cs.AI 79%

Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework

Zhaolong Wu, Pu Luo, Nan Meng, Jason Pui Yin Cheung, Teng Zhang

机构 * Department of Orthopaedics and Traumatology, The University of Hong Kong(骨科与创伤外科部,香港大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted by MICCAI 2025 MLLMCP Workshop

Journal ref Lecture Notes in Computer Science 16147 (2026) 280-289

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04479 2025-10-14 cs.CV 77%

VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery

Nonghai Zhang, Zeyu Zhang, Jiazi Wang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) Beijing Jiaotong University(北京交通大学) La Trobe University(拉特罗布大学)

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11096 2025-10-14 cs.CV 70%

CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization

Fengling Zhu, Boshi Liu, Jingyu Hua, Sheng Zhong

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10880 2025-10-14 cs.CV 70%

Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales

Zhaofang Qian, Hardy Chen, Zeyu Wang, Li Zhang, Zijun Wang, Xiaoke Huang, Hui Liu, Xianfeng Tang, Zeyu Zheng, Haoqin Tu, Cihang Xie, Yuyin Zhou

机构 * University of Central Florida(中央佛罗里达大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Columbia University(哥伦比亚大学) Amazon Research(亚马逊研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05996 2025-10-14 cs.AI 70%

Mediator-Guided Multi-Agent Collaboration among Open-Source Models for Medical Decision-Making

Kaitao Chen, Mianxin Liu, Daoming Zong, Chaoyue Ding, Shaohao Rui, Yankai Jiang, Mu Zhou, Xiaosong Wang

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23590 2025-10-14 cs.CV cs.AI cs.CL 62%

Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles

Zifu Wang, Junyi Zhu, Bo Tang, Zhiyu Li, Feiyu Xiong, Jiaqian Yu, Matthew B. Blaschko

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 16 篇

2510.10052 2025-10-14 cs.CV cs.AI 89%

Think Twice to See More: Iterative Visual Reasoning in Medical VLMs

Kaitao Chen, Shaohao Rui, Yankai Jiang, Jiamin Wu, Qihao Zheng, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Rutgers University(罗格斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

Comments 25 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11718 2025-10-14 cs.CV cs.AI 86%

CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images

Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu

机构 * HKU(香港大学) Meituan(美团) CUHK(香港中文大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10991 2025-10-14 cs.CV cs.AI cs.CL 84%

A Survey on Agentic Multimodal Large Language Models

Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Research Institute of Big Data, China(大数据研究 institute) Sun Yat-sen University, China(中山大学) City University of Hong Kong, China(香港城市大学) Communication University of China, China(通信大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11012 2025-10-14 cs.CV 83%

COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11631 2025-10-14 cs.CV cs.AI cs.NE 81%

EvoCAD: Evolutionary CAD Code Generation with Vision Language Models

Tobias Preintner, Weixuan Yuan, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * Institute of Advanced Computer Science, Leiden University, Leiden, The Netherlands(先进计算机科学研究所,莱顿大学,莱顿,荷兰)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to IEEE ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24138 2025-10-14 cs.LG cs.AI 81%

AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits

Yichen Shi, Ze Zhang, Hongyang Wang, Zhuofu Tao, Zhongyi Li, Bingyu Chen, Yaxin Wang, Zhen huang, Xuhua Liu, Quan Chen, Zhiping Yu, Ting-Jung Lin, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(美国加州大学洛杉矶分校) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10117 2025-10-14 cs.AI 79%

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

Comments EMNLP 2025 Wordplay (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10973 2025-10-14 cs.CV cs.LG 73%

Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning

Sanchit Sinha, Oana Frunza, Kashif Rasul, Yuriy Nevmyvaka, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Morgan Stanley(摩根士丹利)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12661 2025-10-14 cs.LG cs.CL cs.CV 73%

VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization

Menglan Chen, Xianghe Pang, Jingjing Dong, WenHao Wang, Yaxin Du, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11606 2025-10-14 cs.CV 70%

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Yicheng Xu, Yue Wu, Jiashuo Yu, Ziang Yan, Tianxiang Jiang, Yinan He, Qingsong Zhao, Kai Chen, Yu Qiao, Limin Wang, Manabu Okumura, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Institute of Science Tokyo(东京科学研究所) Nanjing University(南京大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Data & Code: https://github.com/OpenGVLab/ExpVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09282 2025-10-14 cs.CV 70%

VideoAds for Fast-Paced Video Understanding

Zheyuan Zhang, Monica Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong

机构 * Northwestern University(西北大学) Boston University(波士顿大学)

专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01181 2025-10-14 cs.AI cs.CV cs.MM cs.SD eess.AS 62%

Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning

Zhiyuan Han, Beier Zhu, Yanlong Xu, Peipei Song, Xun Yang

机构 * University of Science and Technology of China(科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ACM Multimedia 2025 Oral Code: https://github.com/ZhiyuanHan-Aaron/MoSEAR Project Page: https://zhiyuanhan-aaron.github.io/MoSEAR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10976 2025-10-14 cs.AI 57%

Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph

Wentao Wang, Heqing Zou, Tianze Luo, Rui Huang, Yutian Zhao, Zhuochen Wang, Hansheng Zhang, Chengwei Qin, Yan Wang, Lin Zhao, Huaijian Zhang

机构 * ByteDance(字节跳动) NUS(国立大学新加坡) HKUST(GZ)(香港科技大学(珠海)) THU(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18673 2025-10-14 cs.CL cs.AI cs.MM 57%

Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum

Xinglong Yang, Quan Feng, Zhongying Pan, Xiang Chen, Yu Tian, Wentong Li, Shuofei Qiao, Yuxia Geng, Xingyu Zhao, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hunan Vanguard Group Corporation Co., Ltd.(湖南 Vanguard集团有限公司) Huaneng Information Technology Co., Ltd.(华能信息技术有限公司) Tsinghua University(清华大学) Zhejiang University(浙江大学) PowerChina Huadong Engineering Co., Ltd.(中国电建华东工程有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08540 2025-10-14 cs.CV 57%

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

Xiangyu Zhao, Junming Lin, Tianhao Liang, Yifan Zhou, Wenhao Chai, Yuzhe Gu, Weiyun Wang, Kai Chen, Gen Luo, Wenwei Zhang, Junchi Yan, Hua Yang, Haodong Duan, Xue Yang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01773 2025-10-14 cs.CL 50%

Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas

Shiqi Chen, Tongyao Zhu, Ruochen Zhou, Jinghan Zhang, Siyang Gao, Juan Carlos Niebles, Mor Geva, Junxian He, Jiajun Wu, Manling Li

机构 * City University of Hong Kong(香港城市大学) National University of Singapore(新加坡国立大学) Hong Kong University of Science(香港科学大学) Stanford University(斯坦福大学) Salesforce Research(Salesforce研究) Tel Aviv University(特拉维夫大学) Northwestern University(西北大学)

专题命中 视觉推理 :vision language model(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2510.10011 2025-10-14 cs.CV 88%

MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output

Yanyuan Chen, Dexuan Xu, Yu Huang, Songkun Zhan, Hanpin Wang, Dongxue Chen, Xueping Wang, Meikang Qiu, Hang Li

机构 * School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Computer Science, Peking University(计算机学院,北京大学) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Peking University Sixth Hospital(北京大学第六医院) Augusta University(奥古斯塔大学) Peking University First Hospital(北京大学第一医院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06427 2025-10-14 cs.CV 83%

When Language Model Guides Vision: Grounding DINO for Cattle Muzzle Detection

Rabin Dulal, Lihong Zheng, Muhammad Ashad Kabir

机构 * School of Computing, Mathematics and Engineering(计算数学与工程学院) Charles Sturt University(查尔斯·斯特劳特大学) Gulbali Institute for Agriculture, Water and Environment(古尔巴利农业、水与环境研究所) Food Agility CRC Ltd(食品敏捷性CRC有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

Journal ref Australasian Joint Conference on Artificial Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10587 2025-10-14 cs.CV 79%

A Simple and Better Baseline for Visual Grounding

Jingchao Wang, Wenlong Zhang, Dingjiang Huang, Hong Wang, Yefeng Zheng

机构 * School of Data Science(数据科学学院) Engineering East China Normal University Shanghai, China(工程 东华师范大学 上海中国) OpenScience Lab Shanghai AI Laboratory Shanghai, China(OpenScience Lab 上海AI实验室 上海中国) School of Life Science(生命科学学院) Technology Xi'an Jiaotong University Xi'an, China(技术 西安交通大学 西安中国) Medical Artificial Intelligence Laboratory Westlake University Hangzhou, China(医学人工智能实验室 西湖大学 杭州中国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10426 2025-10-14 cs.CV cs.AI 79%

Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs

Suyang Xi, Chenxi Yang, Hong Ding, Yiqing Ni, Catherine C. Liu, Yunhao Liu, Chengqi Zhang

机构 * Emory University(埃默里大学) University of Electronic Science and Technology of China(电子科技大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10560 2025-10-14 cs.CL cs.AI cs.CV 73%

BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices

Euhid Aman, Esteban Carlin, Hsing-Kuo Pao, Giovanni Beltrame, Ghaluh Indah Permata Sari, Yie-Tarng Chen

机构 * NTUST(国立台湾科技大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 6 pages, BabyLM Workshop, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10264 2025-10-14 cs.CV cs.AI 73%

MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs

Haonan Ge, Yiwei Wang, Ming-Hsuan Yang, Yujun Cai

机构 * Department of Computer Science and Engineering, University of California at Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15818 2025-10-14 cs.CV 70%

InstructSAM: A Training-Free Framework for Instruction-Oriented Remote Sensing Object Recognition

Yijie Zheng, Weijie Wu, Qingyun Li, Xuehui Wang, Xu Zhou, Aiai Ren, Jun Shen, Long Zhao, Guoqing Li, Xue Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) University of Wollongong(沃林戈大学) SAIS, Shanghai Jiao Tong University(上海交通大学国际关系学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18111 2025-10-14 cs.LG cs.AI cs.CV 67%

Prompt Optimization Meets Subspace Representation Learning for Few-shot Out-of-Distribution Detection

Faizul Rakib Sayem, Shahana Ibrahim

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏