Understanding Task Transfer in Vision-Language Models
理解视觉-语言模型中的任务迁移
机构 * Microsoft Research India(微软研究院印度)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。
Comments CVPR 2026 (Oral)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
理解视觉-语言模型中的任务迁移
机构 * Microsoft Research India(微软研究院印度)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。
Comments CVPR 2026 (Oral)
并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。
AICA-Bench:全面评估VLMs在情感图像内容分析中的能力
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。
Comments Accepted by Findings of ACL 2026
在线上下文蒸馏用于低资源视觉语言模型
机构 * Inria(法国国家信息与自动化研究所) ; Toyota Motor Europe(丰田汽车欧洲公司)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。
Firebolt-VL: 通过跨模态调制实现高效的视觉-语言理解
机构 * Aalto University(阿尔托大学) ; University of South Dakota(南达科他大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Firebolt-VL模型,通过替换Transformer解码器为液态基础模型解码器,并引入Token-Grid相关模块,提升视觉语义理解效率与精度。
Comments arXiv admin note: substantial text overlap with arXiv:2511.11177
扰动与恢复:用于从CLIP中有效移除后门的微调
机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) ; EPFL(瑞士联邦理工学院洛桑)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。
Comments CVPR 2026 Findings
基于空间加权的CLIP用于街景地理定位
机构 * School of Geospatial Engineering and Science, Sun Yat-Sen University(中山大学地理科学与规划学院) ; School of Geographical and Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院) ; School of System Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出空间加权CLIP(SW-CLIP),通过引入空间自相关增强视觉-语言对比学习,改进街景地理定位的准确性与空间一致性。
ATAC:基于增强的测试时间对抗修正用于CLIP
机构 * University of Szeged(塞格德大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出ATAC方法,通过在CLIP嵌入空间中计算增强诱导的漂移向量,修正嵌入以提高对抗鲁棒性,实验显示其鲁棒性显著优于现有方法。
Comments 16 pages
面向多样化脑部MRI任务的视觉指令微调语言模型
机构 * Sungkyunkwan University(成均馆大学) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; Department of Artificial Intelligence(人工智能系)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。
Comments ICPR 2026 accepted
Curia-2:用于放射学基础模型的自监督学习扩展
机构 * Raidium ; Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) ; Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。
通过知识引导的空间提示增强医学视觉 grounding
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) ; Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。
Comments 10 pages, 6 figures
通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。
Comments Accept to 2026 CVPR Findings
遥感持续视觉-语言学习:基准测试与分析
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。
Comments 23 pages, 7 figures, 9 tables
AceTone:连接词语与颜色的条件图像评分
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; ByteDance(字节跳动)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。
Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone
一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性
机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) ; Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference
通过概念解释CLIP零样本预测
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) ; Orbital ; DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) ; Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; MCML ; MDSI ; Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。
Comments Accepted to CVPR 2026
SegRGB-X: 通用RGB-X语义分割模型
机构 * Chair of Robotics, Artificial Intelligence and Real-time Systems, Technical University of Munich, Munich, Germany(慕尼黑工业大学机器人、人工智能与实时系统教席,德国慕尼黑)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出SegRGB-X模型,通过三种创新解决多模态语义分割问题,实现跨模态统一分割,实验显示其在五个不同互补模态数据集上达到65.03%的mIoU性能。
Comments Submitted to IEEE TITS
弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用
机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) ; Huawei(华为) ; HKUST (GZ)(香港科技大学(广州))
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。
Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}
MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。
Comments Accepted at CVPR 2026
ShotBench:视觉语言模型中的专家级电影叙事理解
机构 * Tongji University(同济大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
从预测到诊断:面向光伏缺陷检测的推理感知AI
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Argonne National Laboratory(阿贡国家实验室) ; Commonwealth Edison(联邦爱迪生公司) ; Drexel University(德雷塞尔大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出REVL-PV框架,通过融合电致发光、热成像和可见光图像,实现光伏缺陷的结构化诊断报告,提升检测准确性和可解释性。
Comments 34 pages, 5 figures
ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。
Comments 30 pages, 12 figures
一个补丁即可描述它们全部:一种统一的零样本描述框架
机构 * ISTI-CNR, Italy(意大利国家研究委员会信息科学与技术研究所) ; University of Pisa, Italy(比萨大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出一种统一的零样本描述框架,从图像中心转向补丁中心范式,使能描述任意区域而不需区域级监督。通过将单个补丁视为原子描述单元,实现对任意区域的描述,实验表明有意义的密集视觉特征对多区域描述任务至关重要。
Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: https://paciosoft.com/Patch-ioner/
人类与视觉-语言模型:叙事连贯性的一种统一衡量方法
机构 * University of Gothenburg(哥德堡大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。
Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures
BFMD:一款完整的羽毛球密集数据集用于密集击球标注
机构 * Nagoya Institute of Technology(名古屋工业大学) ; Nagoya University(名古屋大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出BFMD数据集,包含19场完整比赛,提供密集多模态标注,采用VideoMAE框架结合语义反馈机制提升击球标注质量。
Comments CVSports2026 accepted
视觉语言模型中的稀疏视觉思维电路
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。
释放视觉-语言语义以进行深度伪造视频检测
机构 * Singapore Management University(新加坡管理学院) ; The University of Warwick(沃里克大学) ; Nanyang Technological University(南洋理工大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。
Comments 14 pages, 7 figures, accepted by CVPR 2026
具有自适应深度的递归视觉-语言模型
机构 * Department of Computer Science(计算机科学系) ; University of Wollongong in Dubai(迪拜沃林戈大学) ; Dubai Knowledge Park(迪拜知识园区) ; Mohammed Bin Rashid School of Government(穆罕默德·本·拉希德政府学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出RVLM,通过迭代生成-执行循环和自适应迭代深度控制器,解决医学AI系统在可解释性和推理深度上的限制,实验证明其在脑部MRI和胸部X光中的有效性。
通过自批评推理框架提升视觉-语言模型的测试时鲁棒性
机构 * Tongji University(同济大学) ; Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) ; HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。
Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework
面向大视觉-语言模型的注意力感知推理优化
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Research(思科研究)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。