arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2509.25249 2026-03-02 cs.RO cs.AI 83%

BEV-VLM: Trajectory Planning via Unified BEV Abstraction

BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划

Guancheng Chen, Sheng Yang, Tong Zhan, Jian Wang

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 83%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 83%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18140 2026-02-24 cs.CV 83%

See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis

See-in-Pairs: 用于医学诊断的参考图像引导的比较视觉-语言模型

Ruinan Jin, Gexin Huang, Xinwei Shen, Qiong Zhang, Yan Shuo Tan, Xiaoxiao Li

机构 * Electrical and Computer Engineering Department, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) Vector Institute(向量研究所) ETH Zurich(苏黎世联邦理工学院) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 See-in-Pairs通过引入参考图像引导的比较机制,提升医学视觉-语言模型的诊断性能,增强样本效率和视觉-文本对齐。

Comments 25 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 83%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07849 2026-02-18 cs.AI 83%

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

LQA: 一种轻量级量化自适应框架,用于边缘设备上的视觉-语言模型

Xin Wang, Hong Jia, Hualin Zhou, Sheng Guang Wang, Yu Zhang, Ting Dang, Tao Gu

机构 * School of Computing(计算机学院) Information Systems, University of Melbourne, Melbourne, Australia(信息系统学院,墨尔本大学,澳大利亚墨尔本) Faculty of Science, Auckland, New Zealand(科学学院,新西兰奥克兰) School of Computing, University of Macquarie, Sydney, Australia(计算机学院,麦考瑞大学,澳大利亚悉尼)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 LQA提出了一种轻量级量化自适应框架,用于在边缘设备上高效部署视觉-语言模型,通过选择性混合量化和无梯度适应机制,提升适应性能并降低内存使用。

Comments 15 pages, 9 figures ,9 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 83%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01096 2026-02-16 cs.CV cs.CL 83%

Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages

评估用于低资源语言放射报告生成的视觉语言模型适应

Marco Salmè, Rosa Sicilia, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究评估了低资源语言中视觉语言模型在放射报告生成中的适应性,发现语言特定模型和领域特定训练能显著提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12002 2026-02-13 cs.CV 83%

Can Local Vision-Language Models improve Activity Recognition over Vision Transformers? -- Case Study on Newborn Resuscitation

局部视觉-语言模型能否在视觉转换器上提高活动识别?——新生儿复苏案例研究

Enrico Guerriero, Kjersti Engan, Øyvind Meinich-Bache

机构 * University of Stavanger, Dept. of electrical eng. and computer science(斯塔万格大学电气工程与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究探讨了局部视觉-语言模型在新生儿复苏视频活动识别中的应用,通过LoRA微调提升性能,达到0.91的F1分数,优于TimeSFormer基线。

Comments Presented at the Satellite Workshop on Workshop 15: Generative AI for World Simulations and Communications & Celebrating 40 Years of Excellence in Education: Honoring Professor Aggelos Katsaggelos, IEEE International Conference on Image Processing (ICIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09411 2026-02-11 cs.CV 83%

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

K-Sort Eval: 通过校正VLM作为评判者实现视觉生成的高效偏好评估

Zhikai Li, Jiatong Li, Xuewen Liu, Wangbo Zhao, Pan Du, Kaicheng Zhou, Qingyi Gu, Yang You, Zhen Dong, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 K-Sort Eval通过后验校正和动态匹配策略,实现高效可靠的视觉生成模型偏好评估。

Comments ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15831 2026-02-11 cs.CV 83%

UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment

UniFit: 向基于多模态大语言模型引导的语义对齐的通用虚拟试衣迈进

Wei Zhang, Yeying Jin, Xin Li, Yan Zhang, Xiaofeng Cong, Cong Wang, Fengcai Qiao, zhichao Lian

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniFit通过多模态大语言模型引导的语义对齐模块,解决虚拟试衣中语义差距和数据稀缺问题,实现通用且高性能的试衣框架。

Comments accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04864 2026-02-10 cs.CV 83%

When LLaVA Meets Objects: Token Composition for Vision-Language-Models

当LLaVA遇见物体:用于视觉-语言模型的标记组成

Soumya Jahagirdar, Walid Bousselham, Anna Kukleva, Hilde Kuehne

机构 * Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学院,SIC) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Mask-LLaVA框架,通过结合多级视觉特征,实现更高效的视觉语言模型,减少标记数量的同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 83%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 83%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 83%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI 83%

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23592 2026-02-05 cs.CV 83%

Same or Not? Enhancing Visual Perception in Vision-Language Models

相同还是不同?提升视觉语言模型的视觉感知能力

Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 TWIN通过引入大规模图像对数据集提升视觉语言模型的细粒度视觉感知能力,显著提高在艺术、动物等未见领域识别性能。

Comments Project webpage: https://glab-caltech.github.io/twin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17440 2026-02-05 cs.CV 83%

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击

Hefei Mei, Zirui Wang, Shen You, Minjing Dong, Chang Xu

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02961 2026-02-04 cs.AI 83%

Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth

生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架

Faye Zhang, Qianyu Cheng, Jasmine Wan, Vishwakarma Singh, Jinfeng Rao, Kofi Boakye

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 83%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00946 2026-02-03 cs.CV 83%

ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models

ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率

Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV 83%

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14957 2026-02-02 cs.CV 83%

DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection

DF-LLaVA: 通过知识注入和冲突驱动的自我反思解锁MLLMs用于合成图像检测

Zhuokang Shen, Kaisen Zhang, Bohan Jia, Heming Jia, Yuan Fang, Zhou Yu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Sanming University(三明大学) The 27th Research Institute of CETC(中国电子科技集团第27研究所)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 DF-LLaVA通过知识注入和冲突驱动的自我反思,提升MLLMs在合成图像检测中的准确性和可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09071 2026-02-02 cs.CV 83%

BlindSight: Harnessing Sparsity for Efficient Vision-Language Models

BlindSight: 利用稀疏性提升视觉-语言模型的效率

Tharun Adithya Srikrishnan, Deval Shah, Timothy Hein, Ahmed Hasssan, Stephen Youn, Steven K. Reinhardt

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 BlindSight通过引入输入模板感知的注意力稀疏性掩码,显著提升了视觉-语言模型的推理效率,同时保持较高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22654 2026-02-02 cs.CV cs.CL 83%

VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models

VScan:重新思考视觉标记减少以提高高效的大视觉-语言模型

Ce Zhang, Kaixin Ma, Tianqing Fang, Wenhao Yu, Hongming Zhang, Zhisong Zhang, Haitao Mi, Dong Yu

机构 * Carnegie Mellon University(卡内基梅隆大学) Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 VScan通过两阶段视觉标记减少框架提升大视觉-语言模型的推理效率,实现2.91倍预填充加速和10倍FLOPs减少,性能损失仅0.6%

Comments Accepted at TMLR 2026. Project page: https://zhangce01.github.io/VScan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19228 2026-01-28 cs.CV 83%

Towards Pixel-Level VLM Perception via Simple Points Prediction

通过简单的点预测实现像素级VLM感知

Tianhui Song, Haoyu Lu, Hao Yang, Lin Sui, Haoning Wu, Zaida Zhou, Zhiqi Huang, Yiping Bao, Y. Charles, Xinyu Zhou, Limin Wang

专题命中 VLM训练与架构 :VLM(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05344 2026-01-27 cs.CV 83%

Coding the Visual World: From Image to Simulation Using Vision Language Models

将视觉世界编码:通过视觉语言模型从图像到模拟

Sagi Eppel

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型通过Im2Sim方法从图像生成模拟的能力,发现其在复杂系统建模上表现优异,但对细节复制能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 83%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17807 2026-01-19 cs.CV 83%

Attention Debiasing for Token Pruning in Vision Language Models

视觉语言模型中用于标记剪枝的注意力去偏

Kai Zhao, Wubang Yuan, Yuchen Lin, Liting Ruan, Xiaofeng Lu, Deng-Ping Fan, Ming-Ming Cheng, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(通信与信息工程学院,上海大学) School of Computer Science and Engineering, Shanghai University(计算机科学与工程学院,上海大学) School of Computer Science and Engineering, Nankai University(计算机科学与工程学院,南开大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出两种轻量有效的注意力去偏技术,用于改进视觉语言模型中基于注意力的标记剪枝,以提升计算效率和模型性能。

Comments https://github.com/intcomp/attention-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16148 2026-01-15 cs.CV 83%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏