arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-10 至 2025-10-10 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 9 篇

2510.08470 2025-10-10 cs.AI cs.CL cs.LG 84%

Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling

Bianca-Mihaela Ganescu, Suchir Salhan, Andrew Caines, Paula Buttery

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to the EMNLP 2025 BabyLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08132 2025-10-10 cs.LG cs.AI 84%

Approximate Domain Unlearning for Vision-Language Models

Kodai Kawamura, Yuta Goto, Rintaro Yanagi, Hirokatsu Kataoka, Go Irie

机构 * Tokyo University of Science(东京科学大学) National University of Singapore(新加坡国立大学) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08565 2025-10-10 cs.CV 83%

NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints

Changyao Tian, Hao Li, Gen Luo, Xizhou Zhu, Weijie Su, Hanming Deng, Jinguo Zhu, Jie Shao, Ziran Zhu, Yunpeng Liu, Lewei Lu, Wenhai Wang, Hongsheng Li, Jifeng Dai

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Sensetime Research(商汤科技研究院) Nanjing University(南京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. 22 pages, link: https://github.com/OpenGVLab/NaViL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06092 2025-10-10 cs.CV 79%

Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation

Yachun Mi, Yu Li, Yanting Li, Chen Hui, Tong Zhang, Zhixuan Li, Chenyue Song, Wei Yang Bryan Lim, Shaohui Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 79%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23663 2025-10-10 cs.CV 70%

HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score

Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Peter A. Beerel

机构 * University of Southern California(美国南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15130 2025-10-10 cs.CV 70%

TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba

Xiuwei Chen, Wentao Hu, Xiao Dong, Sihao Lin, Zisheng Chen, Meng Cao, Yina Zhuang, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong Polytechnic University(香港理工大学) Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区) University of Adelaide(阿德莱德大学) Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16460 2025-10-10 cs.CL cs.AI 57%

T-VEC: A Telecom-Specific Vectorization Model with Enhanced Semantic Understanding via Deep Triplet Loss Fine-Tuning

Vignesh Ethiraj, Ashwath David, Sidhanth Menon, Divya Vijay, Vidhyakshaya Kannan

机构 * NetoAI

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16592 2025-10-10 cs.CL cs.MM 50%

What Media Frames Reveal About Stance: A Dataset and Study about Memes in Climate Change Discourse

Shijia Zhou, Siyao Peng, Simon M. Luebke, Jörg Haßler, Mario Haim, Saif M. Mohammad, Barbara Plank

机构 * MaiNLP & MCML, LMU Munich, Germany(LMU慕尼黑媒体与传播系) Department of Media and Communication, LMU Munich, Germany(LMU慕尼黑媒体与传播系) National Research Council Canada, Ottawa, Canada(加拿大国家研究委员会)

专题命中 VLM训练与架构 :LLaVA(abstract)

Comments 20 pages, 9 figures, EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏