Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);分类 cs.CV、cs.AI、cs.LG
基于视觉语言模型的证据门控任务与运动规划
机构 * Waseda University(早稻田大学) ; Flinders University(弗林德斯大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。
Hi-Token:用于生成式视觉定位的分层坐标分词
专题命中 VLM训练与架构 :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。
Comments 15 pages, 7 figures, 15 tables
利用视觉语言模型推进Web规模搜索的相关性测量
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.LG
AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。
Comments RecSys'26 Industry track
TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈
机构 * Beihang University(北京航空航天大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV
AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。
GOTS:用于高分辨率视觉语言模型的贪婪正交令牌选择
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);InternVL(abstract);分类 cs.AI
AI总结 研究高分辨率视觉语言模型中令牌减少问题。提出GOTS方法,通过所选跨度互补性,无训练且与查询无关,每步选正交最大剩余能量令牌。在多主干和基准测试中性能优,还减少模型端首次令牌时间。
所有个体层都有帮助吗?视觉-语言模型中任务干扰层的实证研究
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Harbin Institute of Technology(哈尔滨工业大学) ; Southeast University(东南大学) ; Central South University(中南大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州))
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.AI
AI总结 研究通过层干预发现部分层阻碍下游任务,提出任务自适应层剔除方法提升性能,揭示预训练VLM的意外模块化特性。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 9597-9607
基于注意力的MLLM选择器在测试时对长视频进行高效帧选择
机构 * ZJU(浙江大学) ; NJU(南京大学) ; CSU(中南大学) ; Microsoft(微软公司) ; NJUST(南京理工大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。
MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; Guizhou University(贵州大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。
fARfetch: 利用VLM驱动的AR内容适配实现大型视觉多样环境中的协同人机协作
机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 提出fARfetch系统,通过共享语义环境映射、上下文微缩世界表示和VLM驱动的AR视图管理,在大型室外环境中保持AR内容可读性,实验表明任务完成时间减少66%,工作负荷显著降低。
Comments Accepted to the 2026 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN). Author accepted manuscript
零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Magna International(麦格纳国际)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV
AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。
Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026
SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线
机构 * Technische Universität Darmstadt(达姆施塔特工业大学) ; Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)
专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV
AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。
Comments 19 pages, 9 figures, 2 tables
视觉语言模型作为价值检测器
机构 * IDLab-AIRO, Ghent University – imec, Belgium(IDLab-AIRO、根特大学 – imec、比利时)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision language model(title);分类 cs.CV
AI总结 本文研究了先进LLM与人类标注者在家庭环境场景中检测相关元素的对齐情况,发现LLaVA 34B表现最佳但仍需改进,表明LLM在检测图像中价值元素方面有潜力。
Comments 13 pages, 2 figures
Journal ref Value Engineering in Artificial Intelligence (VALE 2024) (LNAI,volume 15356)
TGV-KV:面向视觉语言模型的文本引导KV驱逐方法
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV
AI总结 针对视觉语言模型中视觉信息冗余导致的KV缓存内存消耗问题,提出基于文本引导的KV驱逐方法TGV-KV,通过文本-视觉预算分配、文本加权排序和文本优先保留策略,在保持高精度的同时显著提升推理吞吐量。
Comments Accepted by ICML-2026
通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型
机构 * University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院) ; Kobe University(Kobe大学) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; Zurich University of Applied Sciences(苏黎世应用科学大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV
AI总结 本文提出一种无需权重更新的解码时残差引导方法,通过每token稀疏自编码器(SAE)对医学视觉语言模型进行干预,抑制幻觉并提升报告质量,在多个模型上取得显著改进。
TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率
机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) ; School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) ; Intellifusion(智融科技)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract);分类 cs.CV
AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。
弥合时空:解耦的时空对齐用于视频定位
机构 * Shanghai Jiao Tong University(上海交通大学) ; ZTE Corporation(中兴通讯)
专题命中 VLM训练与架构 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。
通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Cornell University(康奈尔大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。
LLaVA$^3$:像立体主义画家一样表示3D场景以提升VLM的3D场景理解
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 LLaVA$^3$通过立体主义方法提升VLM对3D场景的理解能力,利用多视角2D图像无需微调实现更优的3D场景理解。
Comments Accepted at AAAI'26
专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract)
匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比
机构 * F-initiatives(F计划) ; Université Sorbonne Paris Nord(巴黎北索邦大学) ; Northwestern University(西北大学) ; IULM university(IULM大学)
专题命中 VLM训练与架构 :MLLM(title_cn,summary_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。
Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp
OSReward:为跨平台计算机使用奖励模型建立标准化评估
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考
Comments Work in progress
用于持续指令微调的渐进式多模态对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) ; Kyoto University(京都大学) ; Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。
Comments Accepted by ACM MM2026
CLASP: 基于语言驱动的机器人技能选择与组合,采用任务参数化学习
机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR),机器人与机电一体化研究所(RMC)) ; Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出CLASP架构,结合任务参数化核化运动基元(TP-KMP)与预训练视觉语言模型(VLM),通过自然语言命令实现技能选择、组合和主动学习,无需微调,在7自由度机械臂上达到73.3%-100%成功率。
Comments 23 pages, 11 figues, 4 tables, 1 listing
VLM-PAR:一种用于行人属性识别的视觉语言模型
机构 * Department of Innovation Engineering(创新工程系) ; University of Salento, Italy(意大利萨伦托大学) ; Institute of Applied Sciences and Intelligent Systems - CNR(应用科学与智能系统研究所 - CNR) ; University of the Basque Country UPV/EHU(巴斯克国家大学UPV/EHU) ; IKERBASQUE, Basque Foundation for Science(伊基塔斯克巴塞克基金会) ; Sorbonne University Abu Dhabi(索邦大学阿布扎比分校)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);分类 cs.CV、cs.AI
AI总结 VLM-PAR通过整合大规模视觉语言预训练与跨模态细化,提升行人属性识别在类别不平衡和泛化挑战中的性能。
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 VLM训练与架构 :MLLM(title,summary_cn)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
Mordal: 面向视觉语言模型的自动化预训练模型选择
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。
晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由
机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。
Comments 18 pages, 4 figures. Submitted to Pattern Recognition
几何感知蒸馏用于提示调优生物医学视觉-语言模型
机构 * Department of Machine Learning(机器学习系) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Omni-Geometry知识蒸馏(OGKD)框架,通过注入类别关系结构到教师模型,生成保留真实标签同时尊重类间几何的方向性目标,并设计全局几何感知蒸馏(GAD)和标签引导几何蒸馏(LGD)损失,在11个医学数据集上平均提升准确率1.7%-2.8%。
Comments Preprint. Code is available at https://github.com/tientrandinh/OGKD
通过视觉模态 jailbreak 视觉-语言模型
机构 * Warsaw University of Technology(华沙理工大学) ; NASK National Research Institute(波兰国家研究研究院) ; University of Liverpool(利物浦大学) ; Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。
Comments Accepted to ICML 2026