arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-28 至 2025-08-28 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2508.19887 2025-08-28 cs.CL cs.CV 79%

Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement

Mohammed Rakibul Hasan, Rafi Majid, Ahanaf Tahmid

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16652 2025-08-28 cs.CV 70%

Do VLMs Have Bad Eyes? Diagnosing Compositional Failures via Mechanistic Interpretability

Ashwath Vaithinathan Aravindan, Abha Jha, Mihir Kulkarni

机构 * University of Southern California(南加州大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments To be published in Explainable Computer Vision: Quo Vadis? workshop at ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19357 2025-08-28 cs.CL 50%

Context-Adaptive Synthesis and Compression for Enhanced Retrieval-Augmented Generation in Complex Domains

Peiran Zhou, Junnan Zhu, Yichen Shen, Ruoxi Yu

机构 * Kunming Medical University(昆明医科大学)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2508.19967 2025-08-28 cs.CV 79%

Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models

Oliver Grainge, Sania Waheed, Jack Stilgoe, Michael Milford, Shoaib Ehsan

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to AAAI Fall Symposium 2025 on AI Trustworthiness and Risk Assessment for Challenging Contexts (ATRACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01777 2025-08-28 cs.CL cs.CV 79%

NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision

Xiang Li, Wenyue Hua, Kaijie Zhu, Lingyao Li, Haoyang Ling, Jinkui Chi, Qi Dou, Jindong Wang, Yongfeng Zhang, Xin Ma, Lizhou Fan

机构 * Shandong University, School of Control Science Rutgers University, Department of Computer Science 110 Frelinghuysen Road Piscataway New Brunswick NJ USA 08854 University of California, Santa Barbara 1210 Cheadle Hall Santa Barbara California USA 93106 University of Michigan, School of Information 500 S State St Ann Arbor Michigan USA 48109 The Chinese University of Hong Kong, Department of Computer Science The College of William \& Mary, School of Computing, Data Sciences \& Physics 200 Stadium Dr Williamsburg Virginia USA 23185 The Chinese University of Hong Kong, Department of Psychiatry 9 Chuen On Rd Tai Po New Territories Hong Kong SAR, China 999077 Rutgers University, Department of Computer Science University of California, Santa Barbara University of Michigan, School of Information The College of William \& Mary, School of Computing, Data Sciences \& Physics The Chinese University of Hong Kong, Department of Psychiatry

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 25 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20068 2025-08-28 cs.CL cs.CV cs.LG 73%

11Plus-Bench: Demystifying Multimodal LLM Spatial Reasoning with Cognitive-Inspired Analysis

Chengzu Li, Wenshan Wu, Huanyu Zhang, Qingtao Li, Zeyu Gao, Yan Xia, José Hernández-Orallo, Ivan Vulić, Furu Wei

机构 * Microsoft Research(微软研究院) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Oncology, University of Cambridge(癌症部门,剑桥大学) Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能中心,剑桥大学) VRAIN, Universitat Politècnica de València(VRAIN,巴塞罗那理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 9 pages, 4 figures (22 pages, 7 figures, 7 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07998 2025-08-28 cs.CL cs.AI cs.CV 62%

PyVision: Agentic Vision with Dynamic Tooling

Shitian Zhao, Haoquan Zhang, Shaoheng Lin, Ming Li, Qilong Wu, Kaipeng Zhang, Chen Wei

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 26 Pages, 10 Figures, Technical report, Fix Typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18265 2025-08-28 cs.CV 57%

InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency

Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, Zhaokai Wang, Zhe Chen, Hongjie Zhang, Ganlin Yang, Haomin Wang, Qi Wei, Jinhui Yin, Wenhao Li, Erfei Cui, Guanzhou Chen, Zichen Ding, Changyao Tian, Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Yuchen Duan, Xuehui Wang, Zhi Hou, Haoran Hao, Tianyi Zhang, Songze Li, Xiangyu Zhao, Haodong Duan, Nianchen Deng, Bin Fu, Yinan He, Yi Wang, Conghui He, Botian Shi, Junjun He, Yingtong Xiong, Han Lv, Lijun Wu, Wenqi Shao, Kaipeng Zhang, Huipeng Deng, Biqing Qi, Jiaye Ge, Qipeng Guo, Wenwei Zhang, Songyang Zhang, Maosong Cao, Junyao Lin, Kexian Tang, Jianfei Gao, Haian Huang, Yuzhe Gu, Chengqi Lyu, Huanze Tang, Rui Wang, Haijun Lv, Wanli Ouyang, Limin Wang, Min Dou, Xizhou Zhu, Tong Lu, Dahua Lin, Jifeng Dai, Weijie Su, Bowen Zhou, Kai Chen, Yu Qiao, Wenhai Wang, Gen Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19271 2025-08-28 cs.CL cs.AI 57%

Rethinking Reasoning in LLMs: Neuro-Symbolic Local RetoMaton Beyond ICL and CoT

Rushitha Santhoshi Mamidala, Anshuman Chhabra, Ankur Mali

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19283 2025-08-28 cs.CR 50%

Rethinking Denial-of-Service: A Conditional Taxonomy Unifying Availability and Sustainability Threats

Mark Dorsett, Scott Man, Tim Koussas

专题命中 视觉推理 :grounding(abstract)

Comments 7 pages, 3 figures, 3 tables,

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 3 篇

2508.20029 2025-08-28 cs.CV 57%

Segmentation Assisted Incremental Test Time Adaptation in an Open World

Manogna Sreenivas, Soma Biswas

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20020 2025-08-28 cs.CV 57%

GS: Generative Segmentation via Label Diffusion

Yuhao Chen, Shubin Chen, Liang Lin, Guangrun Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19517 2025-08-28 cs.HC cs.AI 57%

Orchid: Orchestrating Context Across Creative Workflows with Generative AI

Srishti Palani, Gonzalo Ramos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2508.19289 2025-08-28 cs.CV cs.AI 62%

Seeing Like a Designer Without One: A Study on Unsupervised Slide Quality Assessment via Designer Cue Augmentation

Tai Inui, Steven Oh, Magdeline Kuan

机构 * Waseda University(早稻田大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2508.20018 2025-08-28 cs.AI cs.CL cs.CV cs.MA 62%

SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control

Quanfeng Lu, Zhantao Ma, Shuai Zhong, Jin Wang, Dahai Yu, Michael K. Ng, Ping Luo

机构 * The University of Hong Kong(香港大学) Hong Kong Baptist University(香港 Baptist 大学) TCL Corporate Research (Hong Kong) Co., Ltd(TCL 香港研究院)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2504.11195 2025-08-28 cs.LG cs.CR cs.CV 81%

R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning

Lijun Sheng, Jian Liang, Zilei Wang, Ran He

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments CVPR 2025 (Corrected the results on the Aircraft dataset)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19322 2025-08-28 eess.IV cs.AI cs.CV 62%

AT-CXR: Uncertainty-Aware Agentic Triage for Chest X-rays

Xueyang Li, Mingze Jiang, Gelei Xu, Jun Xia, Mengzhao Jia, Danny Chen, Yiyu Shi

机构 * University of Notre Dame(诺丁汉大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 8 篇

2508.19376 2025-08-28 cs.LG cs.AI cs.CV hep-ex 85%

Fine-Tuning Vision-Language Models for Neutrino Event Analysis in High-Energy Physics Experiments

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊文斯顿分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19639 2025-08-28 cs.MM 82%

FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter

Junxi Wang, Yaxiong Wang, Lechao Cheng, Zhun Zhong

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19295 2025-08-28 cs.CV cs.LG 76%

Large VLM-based Stylized Sports Captioning

Sauptik Dhar, Nicholas Buoncristiani, Joe Anakata, Haoyu Zhang, Michelle Munson

机构 * Eluvio AI Labs(Eluvio AI实验室)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01824 2025-08-28 cs.CV cs.AI cs.LG cs.MM 75%

X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models

Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(创新香港科技促进会) MThreads AI

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments code: https://github.com/SunzeY/X-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19298 2025-08-28 cs.CV cs.AI 73%

DemoBias: An Empirical Study to Trace Demographic Biases in Vision Foundation Models

Abu Sufian, Anirudha Ghosh, Debaditya Barman, Marco Leo, Cosimo Distante

机构 * CNR-ISASI(意大利那不勒斯) Visva-Bharati(维斯瓦-巴哈蒂)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 4 figures, 13th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19254 2025-08-28 cs.CV cs.AI cs.HC 62%

Real-Time Intuitive AI Drawing System for Collaboration: Enhancing Human Creativity through Formal and Contextual Intent Integration

Jookyung Song, Mookyoung Kang, Nojun Kwak

机构 * SNU(首尔国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 4 figures, NeurIPS Creative AI Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19527 2025-08-28 cs.CV 57%

MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment

Zhiting Gao, Dan Song, Diqiong Jiang, Chao Xue, An-An Liu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18634 2025-08-28 cs.CV 57%

OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward

Chunlin Zhong, Qiuxia Hou, Zhangjun Zhou, Shuang Hao, Haonan Lu, Yanhao Zhang, He Tang, Xiang Bai

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments 9 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 1 篇

2411.19930 2025-08-28 cs.CL cs.CV cs.LG 84%

On Domain-Adaptive Post-Training for Multimodal Large Language Models

Daixuan Cheng, Shaohan Huang, Ziyu Zhu, Xintong Zhang, Wayne Xin Zhao, Zhongzhi Luan, Bo Dai, Zhenliang Zhang

机构 * BIGAI BUAA(北京航空航天大学) THU(清华大学) BIT(北京理工大学) RUC(中国人民大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.LG

Comments EMNLP 2025 Findings, Project Page: https://huggingface.co/AdaptLLM/Adapt-MLLM-to-Domains

详情

展开后加载摘要…

URL PDF HTML 收藏