arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-03 至 2025-10-03 共收录 31 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2507.14497 2025-10-03 cs.CV cs.CL 81%

Efficient Whole Slide Pathology VQA via Token Compression

Weimin Lyu, Qingqiao Hu, Kehan Qi, Zhan Shi, Wentao Huang, Saumya Gupta, Chao Chen

机构 * Stony Brook University(石溪大学)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2510.01582 2025-10-03 cs.CV cs.LG 81%

ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16162 2025-10-03 cs.CV cs.CL 79%

Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning

Yihong Tang, Ao Qu, Zhaokai Wang, Dingyi Zhuang, Zhaofeng Wu, Wei Ma, Shenhao Wang, Yunhan Zheng, Zhan Zhao, Jinhua Zhao

机构 * McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Florida(佛罗里达大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 75%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01530 2025-10-03 cs.AI 74%

LOGicalThought: Logic-Based Ontological Grounding of LLMs for High-Assurance Reasoning

Navapat Nananukul, Yue Zhang, Ryan Lee, Eric Boxer, Jonathan May, Vibhav Giridhar Gogate, Jay Pujara, Mayank Kejriwal

专题命中 视觉推理 :grounding(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01681 2025-10-03 cs.CV cs.AI 73%

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning

Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(北京智感科技有限公司) HKU(香港大学) HKUST(香港科技大学) NTU(国立台湾大学) PKU(北京大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01236 2025-10-03 cs.CL cs.LG 70%

GRPO++: Enhancing Dermatological Reasoning under Low Resource Settings

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments Will be submitted at IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15596 2025-10-03 cs.CV 70%

EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery

Gui Wang, Yang Wennuo, Xusen Ma, Zehao Zhong, Zhuoru Wu, Ende Wu, Rong Qu, Wooi Ping Cheah, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) Wenzhou Medical University(温州医科大学) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Strong accept by NeurIPS2025 Reviewers and AC

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2510.02155 2025-10-03 cs.CV cs.AI 84%

Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting

Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Maincode GE Research(通用电气研究)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, video anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01954 2025-10-03 cs.CV 77%

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

Yongyi Su, Haojie Zhang, Shijie Li, Nanqing Liu, Jingyi Liao, Junyi Pan, Yuan Liu, Xiaofen Xing, Chong Sun, Chen Li, Nancy F. Chen, Shuicheng Yan, Xulei Yang, Xun Xu

机构 * South China University of Technology(华南理工大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究所(I 2 R),A*STAR) WeChat Vision, Tencent Inc.(微信视觉,腾讯公司) Foshan University(佛山大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 24 pages, 12 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05288 2025-10-03 cs.CV cs.AI cs.RO 62%

PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes

Ahmed Abdelreheem, Filippo Aleotti, Jamie Watson, Zawar Qureshi, Abdelrahman Eldesokey, Peter Wonka, Gabriel Brostow, Sara Vicente, Guillermo Garcia-Hernando

机构 * Niantic Spatial KAUST(科威特科学与技术研究中心) UCL(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025. Project page: https://nianticlabs.github.io/placeit3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14073 2025-10-03 stat.ML cs.AI cs.LG math.PR 62%

Neural Network Parameter-optimization of Gaussian pmDAGs

Mehrzad Saremi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02273 2025-10-03 cs.CV 57%

RS-OOD: A Vision-Language Augmented Framework for Out-of-Distribution Detection in Remote Sensing

Chenhao Wang, Yingrui Ji, Yu Meng, Yunjian Zhang, Yao Zhu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02044 2025-10-03 cs.CL cs.SD eess.AS 50%

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

Siddhant Arora, Haidar Khan, Kai Sun, Xin Luna Dong, Sajal Choudhary, Seungwhan Moon, Xinyuan Zhang, Adithya Sagar, Surya Teja Appini, Kaushik Patnaik, Sanat Sharma, Shinji Watanabe, Anuj Kumar, Ahmed Aly, Yue Liu, Florian Metze, Zhaojiang Lin

机构 * Meta Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2510.02178 2025-10-03 cs.RO cs.CV 57%

DisCo-Layout: Disentangling and Coordinating Semantic and Physical Refinement in a Multi-Agent Framework for 3D Indoor Layout Synthesis

Jialin Gao, Donghao Zhou, Mingjian Liang, Lihao Liu, Chi-Wing Fu, Xiaowei Hu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Monash University(墨尔本大学) Amazon(亚马逊) South China University of Technology(华南理工大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2510.02204 2025-10-03 cs.CL 78%

Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents

Lingzhong Dong, Ziqi Zhou, Shuaibo Yang, Haiyue Sheng, Pengzhou Cheng, Zongru Wu, Zheng Wu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01388 2025-10-03 cs.RO cs.CV 77%

VENTURA: Adapting Image Diffusion Models for Unified Task Conditioned Navigation

Arthur Zhang, Xiangyun Meng, Luca Calliari, Dong-Ki Kim, Shayegan Omidshafiei, Joydeep Biswas, Ali Agha, Amirreza Shaban

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2508.04677 2025-10-03 cs.CV 74%

Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise

Yansheng Gao, Yufei Zheng, Shengsheng Wang

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(计算机科学与技术学院、教育部符号计算与知识工程重点实验室、吉林大学) College of Software, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(软件学院、教育部符号计算与知识工程重点实验室、吉林大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00015 2025-10-03 cs.CL 71%

Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

专题命中 幻觉与鲁棒性 :multimodal large language model(title)

Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01649 2025-10-03 cs.LG cs.AI 62%

Source-Free Cross-Domain Continual Learning

Muhammad Tanzil Furqon, Mahardhika Pratama, Igor Škrjanc, Lin Liu, Habibullah Habibullah, Kutluyil Dogancay

机构 * STEM, University of South Australia(南澳大利亚大学STEM学院) Faculty of Electrical and Computer Engineering, University of Ljubljana(卢布尔雅那大学电气与计算机工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01929 2025-10-03 cs.CL 50%

Inverse Language Modeling towards Robust and Grounded LLMs

Davide Gabrielli, Simone Sestito, Iacopo Masi

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) OmnAI Lab(OmnAI实验室)

专题命中 幻觉与鲁棒性 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 7 篇

2510.02292 2025-10-03 cs.CL cs.CV 88%

From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens

Hala Sheta, Eric Huang, Shuyu Wu, Ilia Alenabi, Jiajun Hong, Ryker Lin, Ruoxi Ning, Daniel Wei, Jialin Yang, Jiawei Zhou, Ziqiao Ma, Freda Shi

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 System Demonstration | Code: https://github.com/compling-wat/vlm-lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01454 2025-10-03 cs.CV cs.LG 84%

Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories

Nilay Naharas, Dang Nguyen, Nesihan Bulut, Mohammadhossein Bateni, Vahab Mirrokni, Baharan Mirzasoleiman

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Google Research(谷歌研究)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Comments 30 pages, 10 figures, 5 tables, link: https://bigml-cs-ucla.github.io/XMAS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01546 2025-10-03 cs.CV cs.LG 73%

Growing Visual Generative Capacity for Pre-Trained MLLMs

Hanyu Wang, Jiaming Han, Ziyan Yang, Qi Zhao, Shanchuan Lin, Xiangyu Yue, Abhinav Shrivastava, Zhenheng Yang, Hao Chen

机构 * University of Maryland, College Park(马里兰大学学院公园分校) CUHK MMLab(香港大学MMLab) ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Project page: https://hywang66.github.io/bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00577 2025-10-03 cs.AI 70%

A Flexible Method for Behaviorally Measuring Alignment Between Human and Artificial Intelligence Using Representational Similarity Analysis

Mattson Ogg, Ritwik Bose, Jamie Scharf, Christopher Ratto, Michael Wolmetz

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02270 2025-10-03 cs.CV cs.AI 62%

microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification

Sathira Silva, Eman Ali, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) Alexandria University(亚历山大大学) IIT Delhi(德里理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00320 2025-10-03 cs.CV 57%

TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models

Hao Zhang, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01051 2025-10-03 cs.CV 57%

Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization

Tao Zhang, Cheng Da, Kun Ding, Huan Yang, Kun Jin, Yan Li, Tingting Gao, Di Zhang, Shiming Xiang, Chunhong Pan

机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) Kuaishou Technology(快手科技) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 3 篇

2510.01576 2025-10-03 cs.CV cs.AI cs.HC 84%

Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations

Ricardo Gonzalez Penuela, Felipe Arias-Russi, Victor Capriles

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17551 2025-10-03 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion

Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏