The CLEAR Benchmark: Continual LEArning on Real-World Imagery
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project site: https://clear-benchmark.github.io
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project site: https://clear-benchmark.github.io
评估热门好莱坞电影的多模态叙事理解能力
机构 * Bowdoin College(鲍登学院) ; UC Berkeley(加州大学伯克利分校)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究构建了符合票房受欢迎度与公有领域标准的好莱坞电影多模态数据集,建立了相关MCQ基准,发现多数视觉-语言模型表现接近随机,视听模型最高准确率61.1%,均低于人类水平。
MiniGPT-反向设计:利用MiniGPT-4预测图像调整
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。
Comments 8 pages, 7 figures
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
保持简洁:用于超长视频理解的多键情景记忆检索
机构 * Yonsei University(延世大学) ; Adobe Research(奥多比研究院)
专题命中 其他VLM :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。
Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/
面向连贯性的梦境场景可视化
机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。
Comments short paper accepted at ICCC 2026
SAGE:计算病理学中基于注意力的生存模型的语义可解释性
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出SAGE框架,可从ABMIL模型提取全局语义解释,在7个TCGA癌症队列的生存预测中恢复预后特征,揭示癌症特异性生物学,为病理学家解释模型行为提供支持。
Comments Proceedings of the MICCAI Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证
机构 * Università Politecnica delle Marche(马尔凯理工大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。
整体最优标签选择用于在部分标签下的鲁棒提示学习
机构 * Shandong University, Jinan, China(山东大学(济南,中国))
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Holistic Optimal Label Selection方法,通过局部密度过滤和全局最优传输策略,提升部分标签下的提示学习性能,实验表明其在八个基准数据集上表现优异。
Comments ECCV 2026
VEGAS:通过注视进行与人类对齐的视频字幕评估
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; AMD(超威半导体公司)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。
CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性
机构 * KAIST(韩国科学技术院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。
Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY
USE:一种用于测试时提示调整的统一自集成框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) ; Nanjing University(南京大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。
Comments ICML 2026
同一概念,不同方向:稀疏自编码器中的跨模态特征异质性
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。
CytoCLIP:利用对比语言图像预训练学习发育人类大脑的细胞架构特征
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CytoCLIP通过对比语言图像预训练框架学习人类大脑细胞架构特征,通过低分辨率和高分辨率模型变体实现区域分类和跨模态检索,实验表明其在整体区域和高分辨率图像分类中表现优异。
Journal ref Neuroinformatics, Volume 24, article number 38 (2026)
BOFA: 基于CLIP的类增量学习中的桥接层正交低秩融合
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出BOFA框架,通过将适应限制在CLIP的跨模态桥接层并使用正交低秩融合防止遗忘,无需额外参数或数据回放,实现高效类增量学习。
Comments Accepted by AAAI 2026
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(27): 22967-22975, 2026
稀疏性-存储-精度权衡在简约激活字典学习中的研究
机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) ; Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。
评估与增强遥感多模态大语言模型的否定理解能力
机构 * Peng Cheng Laboratory(鹏城实验室) ; Tsinghua University(清华大学) ; Central South University(中南大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。
Comments ECCV 2026 Accepted
HERMAN: 基于CLIP的类增量学习中的层次表示匹配
机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhongguancun Academy(中关村学院)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。
Comments 18 pages, 8 figures
超越API:探索多模态大语言模型在物理工具使用中的极限
机构 * Singapore Management University(新加坡管理大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。
SPACE: 面向多模态大语言模型的无源代理锚点概念擦除
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。
PhyWorldBench:文本到视频模型中物理真实性的全面评估
机构 * University of California, Santa Cruz(加州大学圣克ruz分校) ; NVIDIA Research(NVIDIA研究) ; Northeastern University(东北大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。
Comments 35 pages, 21 figures
Journal ref ICLR 2026 oral
MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型
机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。
图片胜过千言吗?基于视觉证据必要性的自适应多模态事实核查
机构 * School of AI Convergence, Soongsil University(顺斯利大学人工智能融合学院) ; MAUM AI Inc.(MAUM人工智能公司) ; Department of Intelligent Semiconductors, Soongsil University(顺斯利大学智能半导体系)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文挑战了多模态证据普遍提升性能的假设,提出AMuFC框架,通过分析和验证器模型自适应使用视觉证据,提升事实核查准确性。
Comments preprint, 18 pages
EPIC: 用于组合文本到图像生成的高效谓词引导推理控制
机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) ; Department of Computer Science & Engineering, POSTECH(计算机科学与工程系,POSTECH)
专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.LG
AI总结 EPIC通过谓词引导的搜索方法提升组合式文本到图像生成的准确性,减少计算成本,提升生成质量。
信息播种:利用大规模语言模型在图像生成中培养上下文一致性
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。
Comments Project page: https://pyh-129.github.io/SOW/
AnalogRetriever: 为模拟电路检索学习跨模态表示
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Cambridge(剑桥大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。
Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper
Evian:迈向可解释的视觉指令微调数据审计
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; ByteDance Seed(字节跳动种子)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。
Comments Accepted at ACL 2026
RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成
机构 * DEEPNOID Inc.(DEEPNOID公司) ; Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。
Comments ACL 2026, Findings of the Association for Computational Linguistics