arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 112 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2601.19199 2026-02-03 cs.AI 57%

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理

Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 17 篇

2602.00414 2026-02-03 cs.CV cs.LG 84%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00523 2026-02-03 cs.CV 83%

SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding

SAGE:通过熵引导的自适应推测解码加速视觉-语言模型

Yujia Tong, Tian Zhang, Yunyang Wan, Kaiwei Lin, Jingling Yuan, Chuang Hu

机构 * School of Computer Science(计算机科学学院) Artificial Intelligence, Wuhan University of Technology, Hubei 430070, China(人工智能,武汉科技大学,湖北430070,中国) School of Computer Science, Wuhan University, Hubei 430072, China(计算机科学学院,武汉大学,湖北430072,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 SAGE通过熵引导的自适应推测解码方法,动态调整树结构以提高视觉-语言模型的解码速度,实现高达3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV 82%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01037 2026-02-03 cs.CV cs.AI 81%

VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models

VEQ: 适用于MoE视觉-语言模型的模态自适应量化

Guangshuo Qin, Zhiteng Li, Zheng Chen, Weihang Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VEQ通过模态自适应量化方法提升MoE视觉-语言模型的压缩性能,实现更高的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00559 2026-02-03 cs.CV cs.AI 81%

Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models

在视频多模态大语言模型中学习对抗组合性幻觉

Wenbin Xing, Quanxing Zha, Lizheng Zu, Mengran Li, Ming Li, Junchi Yan

机构 * Sun Yat-sen University(中山大学) Huaqiao University(华侨大学) Shenzhen University(深圳大学) Guangming Laboratory(光明实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11325 2026-02-03 cs.CV cs.AI 81%

Robust MLLM Unlearning via Visual Knowledge Distillation

通过视觉知识蒸馏实现鲁棒的多模态大语言模型去学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Haichang Gao, Gang Hua

机构 * Xidian University, China(西安电子科技大学) XJTU University, China(西安交通大学) Amazon.com, USA(亚马逊公司)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过视觉知识蒸馏实现多模态大语言模型的鲁棒去学习,有效保留文本知识并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12706 2026-02-03 cs.CV cs.AI 81%

NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models

NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调

Jiaming Zhang, Xin Wang, Xingjun Ma, Lingyu Qiu, Yu-Gang Jiang, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00420 2026-02-03 cs.CV cs.AI cs.CR 81%

Text is All You Need for Vision-Language Model Jailbreaking

文本就是视觉-语言模型劫持所需

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00247 2026-02-03 cs.CV cs.LG 81%

CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models

CAPA:面向高效大视觉-语言模型的贡献感知剪枝与FFN近似

Samyak Jha, Junho Kim

机构 * Indian Institute of Technology (ISM) Dhanbad, India(印度理工学院(ISM)达翰巴德分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 CAPA通过贡献感知剪枝和FFN近似,提升大视觉-语言模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00993 2026-02-03 cs.RO cs.AI 79%

HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving

HERMES: 一种集成端到端风险感知多模态具身系统,用于长尾自动驾驶

Weizhe Tang, Junwei You, Jiaxi Liu, Zhaoyi Wang, Rui Gan, Zilin Huang, Feng Wei, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(土木与环境工程系,威斯康星大学麦迪逊分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 HERMES通过整合视觉-语言模型和多模态感知,提升自动驾驶在长尾混合交通场景中的风险感知和轨迹规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 73%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 67%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02004 2026-02-03 cs.CV cs.AI 62%

ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning

ClueTracer: 问题到视觉线索追踪用于无训练 hallucination 抑制在多模态推理

Gongli Xi, Kun Wang, Zeming Gao, Huahui Yi, Haolang Lu, Ye Tian, Wendong Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) West China Biomedical Big Data Center(西京生物大数据中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ClueTracer通过问题到视觉线索追踪,无训练抑制多模态推理中的幻觉,提升推理和非推理任务性能。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07114 2026-02-03 cs.CV 57%

Semantically Guided Dynamic Visual Prototype Refinement for Compositional Zero-Shot Learning

语义引导的动态视觉原型精炼用于组合零样本学习

Zhong Peng, Yishi Xu, Gerong Wang, Wenchao Chen, Bo Chen, Jing Zhang, Hongwei Liu

机构 * National Key Laboratory of Radar Signal Processing, Xidian University(雷达信号处理国家级重点实验室,西安电子科技大学) Research Institute of Systems Engineering, Academy of Military Science(系统工程研究所,军事科学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 Duplex通过动态视觉原型精炼和双原型学习,提升组合零样本学习中语义判别性和泛化能力。

Comments Accepted for publication in Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL 57%

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00621 2026-02-03 cs.CV 57%

Towards Interpretable Hallucination Analysis and Mitigation in LVLMs via Contrastive Neuron Steering

通过对比神经元引导实现大型视觉语言模型中幻觉分析与缓解

Guangtao Lyu, Xinyi Cheng, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University, Xi'an, China(西安电子科技大学计算机科学与技术学院) College of Computer and Information, Hohai University, Nanjing, China(河海大学计算机与信息学院) Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 通过对比神经元引导方法,分析并缓解大型视觉语言模型中的幻觉问题,提升视觉表示的稳健性和语义基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14391 2026-02-03 cs.CL cs.AI 57%

Hallucination-Resistant Relation Extraction via Dependency-Aware Sentence Simplification and Two-tiered Hierarchical Refinement

通过依赖感知句子简化和双层级层次精炼实现抗幻觉的关系抽取

Yupei Yang, Fan Feng, Lin Yang, Wanxi Deng, Lin Qu, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 DEPTH通过依赖感知句子简化和双层级层次精炼提升关系抽取的准确性,将幻觉率降低至7.9%,F1分数提升9.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 28 篇

2510.04217 2026-02-03 cs.LG cs.AI 86%

MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering

MLLMEraser: 通过激活引导在多模态大语言模型中实现测试时遗忘

Chenlu Ding, Jiancan Wu, Leheng Sheng, Fan Zhang, Yancheng Yuan, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 MLLMEraser通过激活引导实现多模态大语言模型的测试时遗忘,无需训练且有效降低计算成本,同时保持保留知识的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 84%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00505 2026-02-03 cs.CV cs.AI 84%

Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models

稀疏快捷键:促进多模态大语言模型中的高效融合

Jingrui Zhang, Feng Liang, Yong Zhang, Wei Wang, Runhao Zeng, Xiping Hu

机构 * Guangdong-Hong Kong-Macao Joint Laboratory for Emotion Intelligence and Pervasive Computing, Artificial Intelligence Research Institute, Shenzhen MSU-BIT University, Shenzhen(粤港澳大湾区情感智能与 pervasive 计算联合实验室,人工智能研究院,深圳MSU-BIT大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SparseCut通过稀疏快捷连接和多粒度特征融合模块,提升多模态大语言模型在跨模态融合中的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01148 2026-02-03 cs.CV cs.AI 84%

SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models

SocialFusion: 解决预训练视觉-语言模型中的社会退化问题

Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SocialFusion通过统一框架解决预训练视觉-语言模型中的社会退化问题,实现跨社会任务的正迁移并提升整体性能。

Comments 22 pages, 10 figures. Published in Transactions on Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 84%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 VLM训练与架构 :LLaVA(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 83%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 83%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV 83%

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00108 2026-02-03 cs.CV cs.AI 81%

SITUATE -- Synthetic Object Counting Dataset for VLM training

SITUATE -- 合成物体计数数据集用于视觉语言模型训练

René Peinl, Vincent Tischler, Patrick Schröder, Christian Groth

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 SITUATE是一个用于训练视觉语言模型计数任务的数据集,通过控制遮挡和空间组成,提升模型对非分布图像的泛化能力。

Comments accepted at 21st International Conference on Computer Vision Theory and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01901 2026-02-03 cs.CV 79%

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型

Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 79%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00135 2026-02-03 cs.CV 79%

LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models

LLaVA-FA: 通过傅里叶近似压缩大型多模态模型

Pengcheng Zheng, Chaoning Zhang, Jiarong Mo, GuoHui Li, Jiaquan Zhang, Jiahao Zhang, Sihan Cao, Sheng Zheng, Caiyan Qin, Guoqing Wang, Yang Yang

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

AI总结 LLaVA-FA通过频域联合低秩和量化近似,实现高效压缩大型多模态模型,采用极坐标量化和对角校准方案,提升压缩效果与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏