RISE: Reliable Improvement in Self-Evolving Vision-Language Models
RISE: 自进化视觉语言模型的可靠改进
机构 * AMAP, Alibaba Group(阿里集团AMAP实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉语言模型自进化中角色交替粗粒度、问题质量下降和类型坍缩问题,提出RISE框架,通过细粒度角色交替、质量监督器和技能感知动态平衡实现可靠自进化。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
RISE: 自进化视觉语言模型的可靠改进
机构 * AMAP, Alibaba Group(阿里集团AMAP实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉语言模型自进化中角色交替粗粒度、问题质量下降和类型坍缩问题,提出RISE框架,通过细粒度角色交替、质量监督器和技能感知动态平衡实现可靠自进化。
DETR-ViP:具有鲁棒判别性视觉提示的检测Transformer
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室) ; CCAI, Zhejiang University(浙江大学计算机辅助设计与智能交互研究院) ; Hikrobot Co., Ltd.(海康威视有限公司)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 提出DETR-ViP框架,通过全局提示集成和视觉-文本提示关系蒸馏学习可区分视觉提示,并采用选择性融合策略实现鲁棒检测,在多个数据集上显著提升视觉提示检测性能。
Comments Published as a conference paper at ICLR 2026
CLIP引导的SAM:用于可提示分割的参数高效语义条件
机构 * University of Regina, Regina, SK, Canada(里贾纳大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 提出CLIP-Guided SAM框架,通过轻量级多模态语义适配器将CLIP特征注入SAM图像编码器,实现内部语义条件化,在低标注数据下提升分割性能并支持手动和半自动两种模式。
基于文本驱动的攻击:提升编码器对抗迁移性以攻击大型视觉-语言模型
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学) ; Harbin Engineering University(哈尔滨工程大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出文本驱动攻击(GDA),通过将扰动优化与文本接地证据对齐,并采用接地感知扰动分配和接地中心证据破坏策略,显著提升编码器攻击在黑盒大型视觉-语言模型上的迁移性。
Comments Under review;
D2-V2X: 面向自动驾驶的深度驱动协同V2X推理
机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。
Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)
通过因果路由门控减轻大型视觉语言模型中的幻觉
机构 * Center of Statistical Research, School of Statistics and Data Science, Southwestern University of Finance and Economics, Chengdu, China.(统计研究中心,统计与数据科学学院,西南财经大学,成都,中国) ; Department of Biomedical Engineering, College of Design and Engineering, National University of Singapore, Singapore(生物医学工程系,设计与工程学院,新加坡国立大学,新加坡)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对大型视觉语言模型中因文本路径主导导致幻觉的问题,提出一种无训练、决策对齐的干预方法,通过分解注意力头为视觉和文本路由并抑制文本路由,有效减少幻觉错误。
Comments Accepted as a Spotlight Paper at ICML 2026. 33 pages, 8 figures
是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力
机构 * Incheon National University(延世国立大学) ; McGill University(麦吉尔大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。
Comments Accepted to CVPR 2026 Findings
Eyes on VLM: 视觉语言模型中注视跟随与社会性注视预测的基准测试
机构 * Idiap Research Institute(Idiap研究机构)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出EyeVLM评估框架,通过零样本和微调方式测试视觉语言模型在注视跟随(几何视觉处理)和社会性注视预测(社交推理)两个核心任务上的能力,发现当前VLM缺乏精确的注视理解能力。
Comments Under review
将嵌入概念化:面向视觉-语言模型的稀疏解缠
机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院) ; Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校) ; Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出CEDAR方法,通过稀疏解缠技术在不增加维度的情况下揭示预训练嵌入的组成结构,从而提升视觉-语言模型的可解释性和与人类感知的一致性。
图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预
机构 * Soongsil University(顺斯尔大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。
Comments 11 pages, 2 figures, 4 tables. Preprint
Thermo-VL:扩展视觉语言模型以适应热红外感知
机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。
Comments 18 pages, 11 figures
GeoX:通过自我对战和可验证奖励掌握地理空间推理
机构 * KAIST(韩国科学技术院) ; MPI-SP(马克斯·普朗克研究所) ; MPI-SWS(马克斯·普朗克研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出GeoX框架,通过自我对战和可验证奖励解决图像 grounded 的复杂空间问题,无需大规模人工标注数据,提升了基础视觉语言模型在地理空间理解上的性能。
Comments 26 pages,12 figures, 9 tables
SimGym:一种用于电子商务A/B测试模拟的框架,使用基于流量的VLM代理
机构 * Shopify
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出SimGym框架,通过基于流量的VLM代理模拟电子商务A/B测试,解决真实测试周期长、风险高等问题,验证结果显示其能快速准确预测用户行为变化。
PERL:在CLIP潜在空间中实现参数高效的推理
机构 * University of Catania(卡塔尼亚大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出PERL,一种在CLIP潜在空间中通过迭代潜在推理实现参数高效适应的框架,该方法在多个基准测试中表现出最佳的参数-性能权衡,仅需约6K可训练参数即可实现强的新型类别准确率和竞争性的迁移性能。
Comments Submitted to NeurIPS 2026
推理可移植性:引导MLLMs在RLVR时代的持续学习
机构 * Shenzhen Graduate School of Peking University(北京大学深圳研究生院) ; Centre for Artificial Intelligence and Robotics, HKISI, CAS(香港科学院人工智能与机器人研究中心) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种名为推理可移植性(RP)的机制,通过在持续学习中引入推理层面的约束,改进了多模态大语言模型在RLVR环境下的适应能力,实验表明RDB-CL在提升最后准确率方面优于基线方法。
INAR-VL:面向边缘-云视觉-语言推断的输入感知路由
机构 * TU Wien(维也纳技术大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出INAR-VL,一种轻量级的边缘-云路由系统,用于多模态推断的两级部署。该系统通过轻量级的图像和文本复杂度信号指导路由和模型选择,在本地执行简单查询,将复杂查询卸载到云端,从而在延迟、能耗和准确性之间取得平衡。
Comments 8 pages, 3 figures
ALIGN:一种通过地理空间神经推理进行高精度事故位置推断的视觉-语言框架
机构 * Department of Civil Engineering, Bangladesh University of Engineering and Technology(孟加拉工程与技术大学土木工程系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出ALIGN框架,通过视觉-语言模型整合文本和图像数据,以高精度推断事故位置,显著优于传统文本解析方法,实现了亚公里级的定位精度。
测试时提示法用于黑盒视觉-语言模型
机构 * AlaaLab(Alaa实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。
Res²CLIP:基于残差到残差对齐的少样本通用异常检测
机构 * Beihang University(北航) ; University of Science and Technology Beijing(北京科技大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 Res²CLIP通过残差到残差对齐解决少样本下类别泛化问题,消除细粒度特征差异和类特定偏差,提升跨类别泛化能力。
WeatherOcc3D: 借助VLM的恶劣天气感知3D语义占用预测
机构 * Department of Artificial Intelligence(人工智能系) ; Data Engineering Ozyegin University Istanbul, Türkiye(数据工程奥祖根大学伊斯坦布尔,土耳其)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种借助预训练CLIP隐空间的框架,通过语言环境线索指导多传感器融合,解决恶劣天气下传感器可靠性问题,提升3D语义占用预测的鲁棒性。
DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调
机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) ; University of Macau(澳门大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。
Comments Accepted by ICML 2026 Spotlight
EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测
机构 * China University of Geosciences(中国地质大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。
Comments 20 pages, 6 figures, 8tables
AGC:面向视觉-语言模型对抗鲁棒性的自适应测地修正
机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程研究中心与人工智能院,中国科学院) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出AGC,一种无需训练的防御机制,通过自适应步长修正输入特征,提升视觉-语言模型的对抗鲁棒性,实测在八个细粒度数据集上提升44.4%的鲁棒准确率,同时降低10倍推理延迟。
视觉组合调谐
机构 * Princeton University(普林斯顿大学) ; Meta AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。
Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)
TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率
机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) ; School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) ; Intellifusion(智融科技)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。
解锁基于CLIP的类增量学习中的补丁级特征
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。
通过超越128K上下文的泛化有效训练长上下文视觉-语言模型
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。
Comments work in progress
DeCo-DETR:解耦认知DETR用于高效的开放词汇目标检测
机构 * Jiangsu University(江苏大学) ; Brown University(布朗大学) ; Nanyang Technological University(南洋理工大学) ; MBZUAI ; University of New South Wales(新南威尔士大学) ; USC ; University of Toronto(多伦多大学) ; Data61 CSIRO
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 DeCo-DETR通过统一解耦范式解决开放词汇目标检测中的计算开销与训练目标冲突问题,构建层次化语义原型空间并解耦语义推理与定位,提升推理效率。
Comments Accepted at ICLR 2026
视觉语言模型中物体幻觉的双路径电路
机构 * UIUC(伊利诺伊大学香槟分校) ; UMich(密歇根大学) ; Stanford(斯坦福大学) ; HKUST(香港科技大学) ; PKU(北京大学) ; NUS(新加坡国立大学) ; Marquette(马quette大学) ; Southampton(南安普顿大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。
CRAFT:面向医学图像合成的临床对齐微调
机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) ; School of Medicine, Tulane University(路易斯安那大学医学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。