Is CLIP ideal? No. Can we fix it? Yes!
CLIP是否理想?不。我们能否修复它?是的!
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文分析了CLIP潜在空间的几何局限性,提出DCSM方法以解决其根本问题,提升了CLIP-like模型在多个基准上的性能。
Comments ICCV 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
CLIP是否理想?不。我们能否修复它?是的!
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文分析了CLIP潜在空间的几何局限性,提出DCSM方法以解决其根本问题,提升了CLIP-like模型在多个基准上的性能。
Comments ICCV 2025
UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。
多粒度视觉-语言对齐用于领域泛化的人员重识别
专题命中 图文多模态 :MLLM(abstract);分类 cs.CV
AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。
DCP-CLIP:一种面向开放词汇语义分割的粗到细框架
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出DCP-CLIP框架,通过动态生成文本特征和显式建模双交互,解决开放词汇语义分割中的跨模态通信不足和计算成本高的问题,提升分割精度和效率。
Comments 13 pages, 7 figures
基于视觉-语言的专家报告用于绘画认证和缺陷检测
机构 * organization= Khalifa University of Science ; Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates ; organization= National Research Tomsk Polytechnic University , country= Russia ; organization= Academy of Fine Arts of Naples , city= Naples , country= Italy ; organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy ; organization= Department of Industrial ; Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy ; organization= Advanced Research ; Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。
Comments Submitted to Journal of Cultural Heritage
为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法
机构 * King’s College London(伦敦国王学院) ; Queen Mary University of London(伦敦女王学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。
AVION:从离线教师到提示调优网络的空域视觉-语言指令
机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) ; The Ohio State University(俄亥俄州立大学) ; TerraSense Analytics(TerraSense分析)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。
Comments Accepted to CVPR 2026
PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。
GeoZero:从零开始激励地理空间场景的推理
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。
Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero
ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中
机构 * Great Bay University(大湾大学) ; Shenzhen University(深圳大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。
实时检测任意目标:从单提示分割到多类检测
机构 * Columbia University(哥伦比亚大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。
通过专用提示引导泛化视觉语言模型
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。
Comments Accepted to AAAI26
基于视觉-语言模型的点云地图定位
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。
Comments CVPR 2026
GeoAlignCLIP: 通过多粒度一致性学习增强遥感中的细粒度视觉-语言对齐
机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春130012,中国) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室,吉林大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 GeoAlignCLIP通过多粒度一致性学习提升遥感中细粒度视觉-语言对齐,构建RSFG-100k数据集并优于现有方法。
基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应
机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) ; Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。
Comments Fix order of authors
视觉-语言模型编码临床指南以实现基于概念的医学推理
机构 * Queen’s University(女王大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。
Comments CVPR 2026 Findings
通过稀疏最优传输实现局部-全局提示学习
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。
Comments 9 pages, 3 figures, 4 tables. Code available at GitHub
ODI-Bench: MLLMs能否理解沉浸式全向环境?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学) ; Tianjin University(天津大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。
SaiVLA-0:基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 SaiVLA-0提出基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作系统,通过模块化设计提升效率与稳定性,初步实验显示训练时间减少且成功率显著提升。
Comments 14 pages, 3 figures
DropVLA: 对视觉-语言-动作模型的行动级后门攻击
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) ; City University of Hong Kong(香港城市大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。
Comments 8 pages, 6 tables, 3 figures. Under review
SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型
机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; iFlytek Co., Ltd.(iFlytek公司) ; National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院) ; National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) ; Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。
Comments Accepted to IEEE TGRS
从机制解释学习概念瓶颈模型
机构 * Politecnico di Milano(米兰理工大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出机制CBM模型,通过从黑盒模型自身学习的概念构建瓶颈层,提升模型的可解释性和预测性能。
Comments ICLR 2026
Chart-RL: 通过可验证奖励的强化学习实现通用图表理解
机构 * Oracle AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。
从相位接地到智能手术叙述
机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术研究所)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出基于CLIP的多模态框架,通过自动创建手术时间线和叙述,减少手动标注的需要。
通过提问场景文本图像来实现有效的数据增强方法
机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出了一种基于问答的场景文本数据增强方法,通过生成字符级问题提升OCR模型的推理能力,实验表明在WordArt和Esposalles数据集上有效降低了CER和WER。
Comments Accepted to ICASSP 2026
视觉-语言模型的半监督少样本适应
机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。
Comments Code: https://github.com/jusiro/SS-Text-U
$β$-CLIP:多粒度视觉-语言对齐的文本条件对比学习
机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学科学与技术研究院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 $β$-CLIP通过多粒度文本条件对比学习提升视觉-语言对齐,实现从完整描述到短语的层次化对齐,改进细粒度和长文本检索性能。
PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性
机构 * Hokkaido University(北海道大学) ; CyberAgent
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。
Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP
Journal ref International Conference on Learning Representations (ICLR), 2026
视觉-语言特征对齐用于道路异常分割
机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。
MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型
机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) ; Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) ; Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) ; Research Computing, University of Florida(佛罗里达大学研究计算中心) ; AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。
Comments Technical report, work in progress