arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-28 至 2026-08-28 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2608.26143 2026-08-28 cs.CL cs.AI 新提交 89%

Beyond Accuracy: A Qualitative Analysis of Vision-Language Models for Hate Speech Detection in Memes

超越准确率:对用于表情包仇恨言论检测的视觉-语言模型的定性分析

Muhammad Jawad Chowdhury, Adiba Hasan, Ishrak Hossain, Shahriar Ivan, Sabbir Ahmed

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 本研究通过定性分析LLaVA-7B等四个VLMs在零样本、少样本设置下的表现,揭示其检测仇恨表情包时忽略关键语境线索的问题,为优化模型提供了更深入的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27206 2026-08-28 cs.CV cs.AI 新提交 86%

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE:用于快速视觉语言模型推理的统一压缩-提取范式

Junjie Liu, Shengyuan Ye, Xu Chen

机构 * Sun Yat-sen University(中山大学) Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型推理成本随视觉 token 增多而上升的问题,提出无需训练的 PACE 框架,集成到 Qwen2.5-VL-7B 后仅用 10% 视觉 token 保留 93.8% 原性能,TTFT 加速 3.1 倍。

Comments 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-08-28 cs.CV cs.AI 版本更新 86%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26806 2026-08-28 cs.CV 新提交 85%

Multi-Image Visual Token Pruning in Large Visual Language Models

多图像视觉语言模型中的多图像视觉令牌剪枝

Rongyang Zhang, Chengqiang Lu, Cong Li, Hongchao Gu, Tingjia Shen, Xuyang Zhi, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书科技有限公司)

专题命中 VLM训练与架构 :visual language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 本文针对现有LVLMs多图像剪枝方法的局限,提出无需训练的AVTP框架,在多类LVLMs上实现显著推理加速,同时保持较高准确率,部分模型性能甚至优于基线。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交 84%

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27154 2026-08-28 cs.CV 新提交 81%

ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction

ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限性

Bojun Zhang, Junhong Liang, Feifei Zhai, Fengxian Ji, Yu Zhou

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhongke Fanyu Technology Co., Ltd(中科梵语科技有限公司)

专题命中 VLM训练与架构 :vision language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出ReViCo基准,以视觉文本纠错任务评估VLMs,发现其与人类存在显著性能差距,为开发更优文本感知VLMs提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-08-28 cs.CV 新提交 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26820 2026-08-28 cs.CV 新提交 77%

LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

LLaVAFlow:用于参数高效多模态微调的潜在对齐流保留方法

Muyao Yuan, Muyan Jiao, Jiangyong Ying, Weizhan Zhang, Yuanhong Zhang, Lan Ma, Yuan Gao, Haipeng Du

机构 * MOEKLINNS China Telecom(中国电信)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型微调的灾难性遗忘问题,本文提出即插即用的LLaVAFlow框架,通过信息论蒸馏保留跨模态对齐流,提升下游任务性能与泛化能力。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 77%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27417 2026-08-28 cs.CV 新提交 70%

Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information

检索头与视觉结合:揭示视觉语言模型如何定位和提取视觉信息

Chanho Park, Daehyeon Choi, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究发现视觉语言模型(VLMs)中存在视觉检索头(VRHs),其占注意力头的1.7%-2.6%,负责将文本描述与图像区域建立因果关联,屏蔽前20个VRHs可使定位准确率降低多达80个百分点,且VRHs具备泛化性、功能特异性与架构共享性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-08-28 cs.CV 新提交 70%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 70%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-28 cs.CV cs.AI 版本更新 62%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-08-28 cs.CL cs.AI cs.LG 版本更新 62%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26632 2026-08-28 cs.CV 新提交 57%

Who Remains, What Changes: Identity Anchored Composed Gait Retrieval

谁留存,什么改变:基于身份锚定的组合步态检索

Jingchen Fei, Zengbin Wang, Yukun Liu, Muyi Sun, Shibiao Xu, Man Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出组合步态检索(CoGR)新任务,构建了首批步态-语言数据集,提出基于身份锚定的ComposeGait框架,在两个基准上取得最优R@1,为CoGR提供强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26141 2026-08-28 cs.CL cs.LG 新提交 57%

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking

AdaThinking-E:用于自适应思考的单token熵调控

Zining Wang, Tongkun Guan, Boming Chen, Zhentao Guo, Jianqiang Liu, Chao Jin, Chen Duan, Kai Zhou, Pengfei Yan, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) AI Institute(人工智能研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-28 cs.CV cs.CL 版本更新 57%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at this https URL (https://github.com/Labyrinth0419/ET-Prune)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新 50%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )

详情

展开后加载摘要…

URL PDF HTML 收藏