arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-24 至 2025-09-24 共收录 41 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2509.18763 2025-09-24 cs.CV 89%

Bi-VLM: Pushing Ultra-Low Precision Post-Training Quantization Boundaries in Vision-Language Models

Xijun Wang, Junyun Huang, Rayyan Abdalla, Chengyuan Zhang, Ruiqi Xian, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11101 2025-09-24 cs.CL 67%

Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学工业技术研究所) Beijing Institute of Technology(北京理工大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)

Comments I need to modify the content of the article

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2509.19003 2025-09-24 cs.CV 79%

Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards

Honghao Chen, Xingzhou Lou, Xiaokun Feng, Kaiqi Huang, Xinlong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18425 2025-09-24 cs.CV 79%

Losing the Plot: How VLM responses degrade on imperfect charts

Philip Wootaek Shin, Jack Sampson, Vijaykrishnan Narayanan, Andres Marquez, Mahantesh Halappanavar

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 视觉推理 :VLM(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18682 2025-09-24 cs.MM 78%

Harnessing Multimodal Large Language Models for Personalized Product Search with Query-aware Refinement

Beibei Zhang, Yanan Lu, Ruobing Xie, Zongyi Li, Siyuan Xing, Tongwei Ren, Fen Lin

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18282 2025-09-24 cs.RO cs.AI cs.LG 62%

PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies

Jesse Zhang, Marius Memmel, Kevin Kim, Dieter Fox, Jesse Thomason, Fabio Ramos, Erdem Bıyık, Abhishek Gupta, Anqi Li

机构 * University of Washington(华盛顿大学) NVIDIA(NVIDIA公司) University of Southern California(南加州大学) Allen Institute for AI(人工智能研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19274 2025-09-24 cs.CL cs.MM 50%

DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture

Arijit Maji, Raghvendra Kumar, Akash Ghosh, Anushka, Nemil Shah, Abhilekh Borah, Vanshika Shah, Nishant Mishra, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳巴分校) Banasthali Vidyapeeth University(班纳萨利大学) Pandit Deendayal Energy University(德英德能源大学) Manipal University Jaipur(马哈拉施特拉邦大学贾伊普尔分校) Dwarkadas J. Sanghvi College of Engineering(德瓦尔卡斯J.桑格维工程学院)

专题命中 视觉推理 :vision-language model(abstract)

Comments EMNLP MAINS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2509.18405 2025-09-24 cs.CV cs.AI 88%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17537 2025-09-24 cs.CV 70%

SimToken: A Simple Baseline for Referring Audio-Visual Segmentation

Dian Jin, Yanghao Zhou, Jinxing Zhou, Jiaqi Ma, Ruohao Guo, Dan Guo

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://github.com/DianJin-HFUT/SimToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19017 2025-09-24 cs.LG cs.AI 62%

Fully Learnable Neural Reward Machines

Hazem Dewidar, Elena Umili

机构 * La Sapienza University of Rome(拉维亚大学罗马分校) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18733 2025-09-24 cs.CV 57%

Knowledge Transfer from Interaction Learning

Yilin Gao, Kangyi Chen, Zhongxing Peng, Hengjie Lu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05023 2025-09-24 cs.CV 57%

Split Matching for Inductive Zero-shot Semantic Segmentation

Jialei Chen, Xu Zheng, Dongyue Li, Chong Yi, Seigo Ito, Danda Pani Paudel, Luc Van Gool, Hiroshi Murase, Daisuke Deguchi

机构 * Graduate School of Informatics, Nagoya University (NU)(名古屋大学信息研究生院) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou) (HKUST (GZ))(香港科学与技术大学(广州)人工智能推进部) Institute for Computer Science, Artificial Intelligence and Technology (INSAIT), Sofia University, St. Kliment Ohridski(索菲亚大学计算机科学、人工智能与技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15794 2025-09-24 cs.AI cs.LO 57%

Finite Groundings for ASP with Functions: A Journey through Consistency

Lukas Gerlach, David Carral, Markus Hecher

机构 * Knowledge-Based Systems Group, TU Dresden(图腾大学达姆施塔特分校知识系统小组) LIRMM, Inria, University of Montpellier, CNRS(里尔毫米研究所、法国国家信息与自动化技术研究院、蒙彼利埃大学、国家科学研究中心) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments to be published at IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18509 2025-09-24 cs.CY 50%

Developing a Decolonial Mindset for Indigenising Computing Education (CE)

Jianhua Li, Yin Paradies, Trina Myers, Robin Doss, Armita Zarnegar, Jack Reis

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2509.18189 2025-09-24 cs.CV cs.AI 81%

Qianfan-VL: Domain-Enhanced Universal Vision-Language Models

Daxiang Dong, Mingming Zheng, Dong Xu, Bairong Zhuang, Wenyu Zhang, Chunhua Luo, Haoran Wang, Zijian Zhao, Jie Li, Yuxuan Li, Hanjun Zhong, Mengyue Liu, Jieting Chen, Shupeng Li, Lun Tian, Yaping Feng, Xin Li, Donggang Jiang, Yong Chen, Yehua Xu, Duohao Qin, Chen Feng, Dan Wang, Henghua Zhang, Jingjing Ha, Jinhui He, Yanfeng Zhai, Chengxin Zheng, Jiayi Mao, Jiacheng Chen, Ruchang Yao, Ziye Yuan, Jianmin Wu, Guangjun Xie, Dou Shen

机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)

专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2509.18592 2025-09-24 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 75%

VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation

Neel P. Bhatt, Yunhao Yang, Rohan Siva, Pranay Samineni, Daniel Milan, Zhangyang Wang, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Codebase, datasets, and videos for VLN-Zero are available at: https://vln-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18230 2025-09-24 cs.AI cs.LG 62%

Towards General Computer Control with Hierarchical Agents and Multi-Level Action Spaces

Zihan Dong, Xinyu Fan, Zixiang Tang, Yunqing Li

机构 * The University of Tokyo(东京大学) Lenovo US(联想美国) Advanced AI Technology Center(高级人工智能技术中心)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18672 2025-09-24 cs.HC cs.AI 57%

NaviSense: A Multimodal Assistive Mobile application for Object Retrieval by Persons with Visual Impairment

Ajay Narayanan Sridhar, Fuli Qiao, Nelson Daniel Troncoso Aldas, Yanpei Shi, Mehrdad Mahdavi, Laurent Itti, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究者) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18610 2025-09-24 cs.RO 50%

SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones

Maximilian Adang, JunEn Low, Ola Shorinwa, Mac Schwager

机构 * Department of Aeronautics and Astronautics, Stanford University(航空与航天系,斯坦福大学) Department of Mechanical Engineering, Stanford University(机械工程系,斯坦福大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 7 篇

2507.13255 2025-09-24 cs.CL cs.AI cs.IR cs.LG cs.MM 84%

Automating Steering for Safe Multimodal Large Language Models

Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2025-09-24 cs.CL cs.AI 83%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments A lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19070 2025-09-24 cs.CV cs.CL 79%

ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?

Zijian Ling, Han Zhang, Yazhuo Zhou, Jiahao Cui

机构 * Apply U United Kingdom(英国Apply大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the Open Science for Foundation Models (SCI-FM) Workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15389 2025-09-24 cs.CL cs.CR cs.CV 79%

Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study

DongGeon Lee, Joonwon Jang, Jihae Jeong, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14257 2025-09-24 cs.CV 79%

Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) Zhongguancun Academy(中关村学院) Southeast Academy of Information Technology, Beijing Institute of Technology(信息技术东南学院,北京理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19203 2025-09-24 cs.CV 57%

Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions

Ioanna Ntinou, Alexandros Xenos, Yassine Ouali, Adrian Bulat, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王大学) Samsung AI Centre(三星人工智能中心) Technical University of Iași(伊阿苏技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18998 2025-09-24 math.AP cs.LG q-bio.CB q-bio.QM 57%

Bayesian Calibration and Model Assessment of Cell Migration Dynamics with Surrogate Model Integration

Christina Schenk, Jacobo Ayensa Jiménez, Ignacio Romero

机构 * IMDEA Materials Institute(IMDEA材料研究所) Universidad Politécnica de Madrid(马德里理工大学) Aragón Institute of Engineering Research (I3A)(阿伦工程技术研究所(I3A))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments 31 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 14 篇

2501.13707 2025-09-24 cs.CV cs.AI 88%

EventVL: Understand Event Streams via Multimodal Large Language Model

Pengteng Li, Yunfan Lu, Pinghao Song, Wuyang Li, Huizai Yao, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) KU Leuven(根特大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Carleton University(卡尔顿大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);VLM(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18839 2025-09-24 cs.CV 83%

Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

机构 * Gianmarco Spinaci Department of Classical Philology and Italian Studies, University of Bologna, Italy Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Gianmarco Spinaci 文艺复兴研究系,博洛尼亚大学,意大利 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利) Lukas Klic Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Lukas Klic 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利) Giovanni Colavizza Department of Classical Philology and Italian Studies, University of Bologna, Italy Department of Communication, University of Copenhagen, Denmark(Giovanni Colavizza 文艺复兴研究系,博洛尼亚大学,意大利 传播系,哥本哈根大学,丹麦)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision language model(abstract);分类 cs.CV

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01346 2025-09-24 cs.CV cs.CL 79%

Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability

Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du

机构 * Northwestern University(西北大学) New Jersey Institute of Technology(新泽西理工学院) University of Bristol(布里斯托大学) Cisco Research(思科研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18179 2025-09-24 cs.CV cs.AI 76%

The Describe-Then-Generate Bottleneck: How VLM Descriptions Alter Image Generation Outcomes

Sai Varun Kodathala, Rakesh Vunnam

机构 * Sports Vision, Inc.(体育视觉公司) Vizworld, Inc.(Vizworld公司)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

Comments 13 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏