arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2506.00479 2025-06-03 cs.CL cs.CV cs.LG 81%

EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models

Zekun Wang, Minghua Ma, Zexin Wang, Rongchuan Mu, Liping Shan, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Du Xiaoman Science Technology Co., Ltd(杜祥曼科技有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15210 2025-06-02 cs.LG cs.AI cs.CL 81%

PairBench: Are Vision-Language Models Reliable at Comparing What They See?

Aarash Feizi, Sai Rajeswar, Adriana Romero-Soriano, Reihaneh Rabbany, Valentina Zantedeschi, Spandana Gella, João Monteiro

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21061 2025-05-28 cs.CV cs.AI 81%

LPOI: Listwise Preference Optimization for Vision Language Models

Fatemeh Pesaran Zadeh, Yoojin Oh, Gunhee Kim

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract);分类 cs.CV、cs.AI

Comments ACL 2025 Main. Code is released at https://github.com/fatemehpesaran310/lpoi

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19235 2025-05-27 cs.LG cs.CV 81%

CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models

Qinsi Wang, Hancheng Ye, Ming-Yu Chung, Yudong Liu, Yueqian Lin, Martin Kuo, Mingyuan Ma, Jianyi Zhang, Yiran Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14728 2025-05-22 cs.CV cs.AI cs.CL cs.CY cs.MM 81%

MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models

Xiao Lin, Zhining Liu, Ze Yang, Gaotang Li, Ruizhong Qiu, Shuke Wang, Hui Liu, Haotian Li, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12359 2025-05-20 cs.LG cs.CV 81%

STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference

Yichen Guo, Hanze Li, Zonghao Zhang, Jinhao You, Kai Tang, Xiande Huang

机构 * De Artificial Intelligence Lab(人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07864 2025-05-14 cs.AI cs.CL cs.CV 81%

Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding

Takamitsu Omasa, Ryo Koshihara, Masumi Morishige

机构 * Galirage Inc.(加里拉格公司)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 1 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02056 2025-05-06 cs.CV cs.LG 81%

Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin

Yuchen Wang, Xuefeng Bai, Xiucheng Li, Weili Guan, Liqiang Nie, Xinyang Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15929 2025-04-25 cs.CV cs.AI 81%

Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models

Saban Ozturk, Melih B. Yilmaz, Muti Kara, M. Talat Yavuz, Aykut Koç, Tolga Çukur

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14123 2025-04-22 cs.AI cs.CL cs.CV 81%

Bayesian Principles Improve Prompt Learning In Vision-Language Models

Mingyu Kim, Jongwoo Ko, Mijung Park

机构 * UBC CS(不列颠哥伦比亚大学计算机科学系) KAIST AI(韩国科学技术院人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments AISTATS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06298 2025-04-10 cs.CV cs.LG 81%

Ternarization of Vision Language Models for use on edge devices

Ben Crulis, Cyril De Runz, Barthelemy Serres, Gilles Venturini

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18278 2025-04-01 cs.CV cs.AI 81%

TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model

Cheng Yang, Yang Sui, Jinqi Xiao, Lingyi Huang, Yu Gong, Chendi Li, Jinghua Yan, Yu Bai, Ponnuswamy Sadayappan, Xia Hu, Bo Yuan

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12523 2025-03-31 cs.CV cs.AI 81%

Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models

Jiaqi Li, Qianshan Wei, Chuanyi Zhang, Guilin Qi, Miaozeng Du, Yongrui Chen, Sheng Bi, Fan Liu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18013 2025-03-25 cs.CV cs.AI 81%

Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Yufei Zhan, Yousong Zhu, Shurong Zheng, Hongyin Zhao, Fan Yang, Ming Tang, Jinqiao Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Project in development. Github: https://github.com/jefferyZhan/Griffon/tree/master/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03871 2025-03-24 cs.CV cs.AI cs.ET cs.IR cs.MM 81%

CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance

Chu Myaet Thwal, Ye Lin Tun, Minh N. H. Nguyen, Eui-Nam Huh, Choong Seon Hong

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02032 2025-03-18 cs.CV cs.AI 81%

Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models

Fushuo Huo, Wenchao Xu, Zhong Zhang, Haozhao Wang, Zhicheng Chen, Peilin Zhao

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11609 2025-03-17 cs.CV cs.LG cs.MM 81%

Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages

Matteo Farina, Massimiliano Mancini, Giovanni Iacca, Elisa Ricci

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Camera-ready version for CVPR 2025 (w/ SuppMat, 23 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11241 2025-03-17 cs.CV cs.AI 81%

Compound Expression Recognition via Large Vision-Language Models

Jun Yu, Xilong Lu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14717 2025-03-11 cs.LG cs.CL cs.CV 81%

FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data

Binqian Xu, Xiangbo Shu, Haiyang Mei, Guosen Xie, Basura Fernando, Jinhui Tang

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13085 2025-03-04 cs.LG cs.CL cs.CV 81%

MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models

Peng Xia, Kangyu Zhu, Haoran Li, Tianze Wang, Weijia Shi, Sheng Wang, Linjun Zhang, James Zou, Huaxiu Yao

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04734 2025-02-26 cs.LG cs.CL cs.CV 81%

TLDR: Token-Level Detective Reward Model for Large Vision Language Models

Deqing Fu, Tong Xiao, Rui Wang, Wang Zhu, Pengchuan Zhang, Guan Pang, Robin Jia, Lawrence Chen

专题命中 VLM训练与架构 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14834 2025-02-21 cs.CV cs.AI cs.CL 81%

LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models

Shangqing Tu, Yucheng Wang, Daniel Zhang-Li, Yushi Bai, Jifan Yu, Yuhao Wu, Lei Hou, Huiqin Liu, Zhiyuan Liu, Bin Xu, Juanzi Li

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14504 2025-02-21 cs.CV cs.AI 81%

PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models

Yu Meng, Kaiyuan Li, Chenran Huang, Chen Gao, Xinlei Chen, Yong Li, Xiaoping Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06823 2025-02-13 cs.LG cs.CV cs.GR cs.IR 81%

CTR-Driven Advertising Image Generation with Multimodal Large Language Models

Xingye Chen, Wei Feng, Zhenbang Du, Weizhen Wang, Yanyin Chen, Haohan Wang, Linkai Liu, Yaoyu Li, Jinyuan Zhao, Yu Li, Zheng Zhang, Jingjing Lv, Junjie Shen, Zhangang Lin, Jingping Shao, Yuanjie Shao, Xinge You, Changxin Gao, Nong Sang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05591 2025-02-11 cs.CV cs.CL cs.LG 81%

Linear Alignment of Vision-language Models for Image Captioning

Fabian Paischer, Markus Hofmarcher, Sepp Hochreiter, Thomas Adler

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 9 pages (+ references and appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14204 2025-01-27 cs.CV cs.AI 81%

Dynamic Token Reduction during Generation for Vision Language Models

Xiaoyu Liang, Chaofeng Guan, Jiaying Lu, Huiyao Chen, Huan Wang, Haoji Hu

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08443 2025-01-20 cs.CV cs.LG 81%

Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models

Xu Li, Yi Zheng, Haotian Chen, Xiaolei Chen, Yuxuan Liang, Chenghang Lai, Bin Li, Xiangyang Xue

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07769 2025-01-15 cs.LG cs.CV 81%

BMIP: Bi-directional Modality Interaction Prompt Learning for VLM

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Ming Yang, Lan-Zhe Guo

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16777 2024-12-24 cs.CV cs.LG 81%

HyperCLIP: Adapting Vision-Language models with Hypernetworks

Victor Akinwande, Mohammad Sadegh Norouzzadeh, Devin Willmott, Anna Bair, Madan Ravi Ganesh, J. Zico Kolter

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10455 2024-12-17 cs.CV cs.AI cs.CG 81%

Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning

Shihao Xu, Yiyang Luo, Wei Shi

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏