arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2603.16987 2026-03-19 cs.CV cs.AI 84%

Empirical Recipes for Efficient and Compact Vision-Language Models

高效紧凑视觉-语言模型的实证配方

Jiabo Huang, Zhizhong Li, Sina Sajadmanesh, Weiming Zhuang, Lingjuan Lyu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过实证分析识别了紧凑视觉-语言模型的瓶颈,提出优化配方显著降低延迟并保持精度,同时引入ArgusVLM模型家族在多种基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL 84%

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16781 2026-03-18 cs.CV cs.AI 84%

IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans

IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型

Huimin Xiong, Zijie Meng, Tianxiang Hu, Chenyi Zhou, Yang Feng, Zuozhu Liu

机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13389 2026-03-17 cs.CV cs.LG 84%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 84%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13108 2026-03-13 cs.CV cs.AI cs.RO 84%

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型

Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。

Comments Accepted at ICRA 2026; 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 84%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03850 2026-03-12 cs.HC cs.AI cs.CV 84%

WebAccessVL: Violation-Aware VLM for Web Accessibility

WebAccessVL: 为网页可访问性而设计的违反意识VLM

Amber Yijia Zheng, Jae Joong Lee, Bedrich Benes, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 WebAccessVL通过基于违规的VLM自动修正网页HTML,显著减少可访问性违规,提升网页可访问性与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03351 2026-03-09 cs.CV cs.AI cs.CL 84%

VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models

VLMQ:基于令牌显著性的后训练量化用于视觉-语言模型

Yufei Xue, Yushi Huang, Jiawei Shao, Lunjie Zhu, Chi Zhang, Xuelong Li, Jun Zhang

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 VLMQ通过显著性驱动的后训练量化方法,针对视觉-语言模型的激活特性优化量化过程,实现低比特下的高性能压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06415 2026-03-05 cs.CV cs.AI cs.CL 84%

Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models

保持索引的轻量级标记修剪用于视觉-语言模型中的高效文档理解

Jaemin Son, Sujin Choi, Inyong Yun

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级标记修剪方法,通过过滤非信息性背景区域来降低视觉-语言模型在文档理解任务中的计算成本,同时保持较高的准确性。

Comments Accepted to ICLR 2026 Workshop MM Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02700 2026-02-27 cs.CV cs.LG 84%

VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm

VLM-Pruner: 为高效VLM离心令牌剪枝范式中的空间稀疏性引入缓冲

Zhenkai Wu, Xiaowen Ma, Zhenliang Ni, Dengming Zhang, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Technologies(华为技术)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 VLM-Pruner通过平衡冗余与空间稀疏性,提升VLMs的效率和性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22144 2026-02-26 cs.CV cs.AI cs.CL 84%

NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors

NoLan: 通过动态抑制语言先验来缓解大视觉-语言模型中的对象幻觉

Lingfeng Ren, Weihao Yu, Runpeng Yu, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学) Peking University Shenzhen Graduate School, China(北京大学深圳研究生院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 NoLan通过动态抑制语言先验缓解大视觉-语言模型中的对象幻觉问题,有效提升模型准确性。

Comments Code: https://github.com/lingfengren/NoLan

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27623 2026-02-24 cs.AI cs.CL cs.CV 84%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 84%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09425 2026-02-11 cs.CV cs.LG 84%

Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification

弥合道路激光雷达的模态差距:一种无需训练的视觉-语言模型框架用于车辆分类

Yiqiao Li, Bo Shang, Jie Wei

机构 * Department of Civil Engineering, City College of New York(城市学院土木工程系) Department of Computer Science, City College of New York(城市学院计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种无需训练的视觉-语言模型框架,用于解决道路激光雷达中稀疏点云与密集图像之间的模态差距问题,实现细粒度车辆分类。

Comments 12 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08099 2026-02-10 cs.CV cs.AI 84%

VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval

VidVec:解锁视频MLLM嵌入用于视频-文本检索

Issar Tzachor, Dvir Samuel, Rami Ben-Ari

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VidVec通过利用预训练MLLM的中间层嵌入和校准头部,实现无需训练的视频-文本检索,超越现有方法,达到最佳性能。

Comments Project page: https://iyttor.github.io/VidVec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10273 2026-02-09 cs.CV cs.AI 84%

Probing Perceptual Constancy in Large Vision-Language Models

探测大型视觉-语言模型中的知觉恒常性

Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) Emory University(埃默里大学) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了大型视觉-语言模型在颜色、大小和形状恒常性任务中的表现,发现模型在不同任务上的性能存在显著差异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05729 2026-02-06 cs.CV cs.LG 84%

Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification

自适应全局与细粒度感知融合用于兼容硬负样本放大的人脸嵌入

Lexiang Hu, Youze Xue, Dian Li, Gang Liu, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AGFF-Embed方法,通过自适应融合全局和细粒度语义信息,提升多模态嵌入在一般和细粒度理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03815 2026-02-04 cs.CV cs.LG 84%

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 84%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00505 2026-02-03 cs.CV cs.AI 84%

Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models

稀疏快捷键:促进多模态大语言模型中的高效融合

Jingrui Zhang, Feng Liang, Yong Zhang, Wei Wang, Runhao Zeng, Xiping Hu

机构 * Guangdong-Hong Kong-Macao Joint Laboratory for Emotion Intelligence and Pervasive Computing, Artificial Intelligence Research Institute, Shenzhen MSU-BIT University, Shenzhen(粤港澳大湾区情感智能与 pervasive 计算联合实验室,人工智能研究院,深圳MSU-BIT大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SparseCut通过稀疏快捷连接和多粒度特征融合模块,提升多模态大语言模型在跨模态融合中的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01148 2026-02-03 cs.CV cs.AI 84%

SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models

SocialFusion: 解决预训练视觉-语言模型中的社会退化问题

Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SocialFusion通过统一框架解决预训练视觉-语言模型中的社会退化问题,实现跨社会任务的正迁移并提升整体性能。

Comments 22 pages, 10 figures. Published in Transactions on Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 84%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 VLM训练与架构 :LLaVA(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22020 2026-01-30 cs.LG cs.CV 84%

Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning

多模态大语言模型去敏中的视觉引导关键标记正则化

Chengyi Cai, Zesheng Ye, Peike Li, Bo Han, Jianzhong Qi, Feng Liu

机构 * The University of Melbourne(墨尔本大学) Google Research(谷歌研究) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出视觉引导的关键标记正则化方法,用于多模态大语言模型的去敏,通过信息熵定义关键标记并利用梯度重新加权提升去敏效果,实验表明能有效减少遗忘并保持响应一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14780 2026-01-28 cs.CL cs.AI cs.CV 84%

ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting

ReVision:一个用于隐私保护任务导向视觉指令重写的数据集和基线VLM

Abhijit Mishra, Mingda Li, Hsiang Fu, Richard Noh, Minji Kim

机构 * School of Information(信息学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学) School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReVision提出一个数据集和基线VLM,通过将多模态指令转换为纯文本命令,实现轻量级设备端指令重写,提升隐私保护的多模态AI应用能力。

Comments In Proceedings of the IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-01-14 cs.CV cs.AI 84%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16925 2026-01-08 cs.CV cs.AI cs.IR cs.MA 84%

V-Agent: An Interactive Video Search System Using Vision-Language Models

V-Agent:一种利用视觉-语言模型的交互式视频搜索系统

SunYoung Park, Jong-Hyeon Lee, Youngjune Kim, Daegyu Sung, Younghyun Yu, Young-rok Cha, Jeongho Ju

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 V-Agent通过多智能体协作和视觉-语言模型提升视频搜索性能,实现多模态交互与零样本性能。

Comments CIKM 2025 MMGENSR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23073 2025-12-30 cs.LG cs.CV 84%

Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models

重新思考微调:解锁视觉-语言模型中的隐藏能力

Mingyuan Zhang, Yue Bai, Yifan Wang, Yiyang Huang, Yun Fu

机构 * College of Engineering, Northeastern University(东北大学工程学院) Khoury College of Computer Science, Northeastern University(东北大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于MFT的结构重参数化方法,通过重新组织VLMs内部子网络实现高效微调,超越LoRA和全微调,无需改变骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21529 2025-12-29 cs.CV cs.AI 84%

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18747 2025-12-23 cs.CV cs.AI 84%

IPCV: Information-Preserving Compression for MLLM Visual Encoders

IPCV:信息保留的多模态大语言模型视觉编码器压缩

Yuan Chen, Zichen Wen, Yuzhou Wu, Xuyang Liu, Shuang Chen, Junpeng Ma, Weijia Li, Conghui He, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) CityU(城市大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sheffield(谢菲尔德大学) SCU(上海科技大学) FDU(福建大学) SYSU(南方科技大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 IPCV通过邻居引导重建和注意力稳定化技术,实现无需训练的多模态大语言模型视觉编码器高效压缩,有效降低计算成本并提升性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏