Delving into Spectral Clustering with Vision-Language Representations
深入探讨基于视觉-语言表示的谱聚类
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。
Comments ICLR26
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
深入探讨基于视觉-语言表示的谱聚类
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。
Comments ICLR26
VL-KGE:视觉-语言模型与知识图谱嵌入的结合
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。
Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material
Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)
医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成
机构 * NEC Laboratories America(NEC美洲实验室) ; University of California, Riverside(加州大学河滨分校)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。
UniCompress: 用于统一视觉-语言理解和生成的标记压缩
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。
VisualAD: 通过视觉变换器实现无语言零样本异常检测
机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) ; School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) ; College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。
Comments Accepted by CVPR 2026
通过跨模态对齐增强CLIP鲁棒性
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。
Comments NeurIPS 2025 Spotlight
JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航
机构 * Xi’an Jiaotong University(西安交通大学) ; Amap, Alibaba Group(阿里巴巴集团)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。
Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/
通过Cauchy-Schwarz散度进行分布式视觉语言对齐
机构 * University of Amsterdam(阿姆斯特丹大学) ; The Netherlands Cancer Institute(荷兰癌症研究所) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; The Arctic University of Norway(挪威北极大学) ; Singapore Management University(新加坡管理大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出CS-Aligner框架,通过整合Cauchy-Schwarz散度与互信息,实现更紧密的视觉语言分布对齐,提升跨模态生成与检索性能。
Comments Accepted by ICLR2026
面向医学影像的不确定性感知视觉-语言分割
机构 * VIT Bhopal(维特大学博帕尔分校) ; SAHE, Andhra Pradesh(安得拉邦SAHE) ; IIIT Delhi(德里印度理工学院) ; Tezpur University Assam(阿萨姆特兹普尔大学) ; IIT Kanpur(坎普尔印度理工学院)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种不确定性感知的多模态分割框架,通过引入SEU损失和MoDAB模块,提升医学影像分割的精度与效率。
Comments Accepted in WACV 2026
通过多粒度语言学习提升医学视觉理解
机构 * University of Washington(华盛顿大学) ; Duke University(杜克大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出MGLL框架,通过多粒度语言学习提升医学影像的视觉理解能力,改进多标签和跨粒度对齐,提升下游任务性能。
Comments Accepted by ICLR 2026. 40 pages
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
测试时适应用于触觉-视觉-语言模型
机构 * Shenzhen Technology University(深圳技术大学) ; New York University(纽约大学) ; Shenzhen University(深圳大学) ; Tsinghua University(清华大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。
文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要
机构 * National University of Defense Technology, China(国防科技大学) ; Beijing University of Posts and Telecommunications, China(北京邮电大学) ; University of the Chinese Academy of Sciences, China(中国科学院大学) ; Sichuan University, China(四川大学) ; Wuhan University, China(武汉大学) ; Chinese Academy of Science, China(中国科学院) ; Tsinghua University, China(清华大学) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) ; Renmin University of China, China(中国人民大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。
UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测
机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。
Comments Under Review. 12 pages, 2 figures
他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考
机构 * Macquarie University(麦考瑞大学) ; The University of Western Australia(西澳大学) ; Stanford University(斯坦福大学) ; Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) ; Rajiv Gandhi University(拉贾·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL
AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。
Comments Accepted at the The Web Conference 2026 (Research Track)
GLAD: 生成式语言辅助低语义模板视觉跟踪
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。
利用遥感图像和地理上下文引导的视觉变换器观察健康结果
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种结合地理空间信息的视觉变换器模型,通过引导注意力机制提升遥感图像处理效果,有效预测疾病流行率。
Comments Submitted to IEEE Transactions on Geoscience and Remote Sensing
稀疏CLIP:在对比学习中协同优化可解释性与性能
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 稀疏CLIP通过在对比学习中直接整合稀疏性,实现了可解释性与性能的协同优化,保留了多模态能力并提升了下游任务性能。
Docs2Synth: 一种用于扫描视觉丰富文档理解的合成数据训练检索框架
机构 * University of Western Australia(西澳大学) ; The University of Hong Kong(香港大学) ; Murdoch University(默多克大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.AI
AI总结 Docs2Synth通过合成监督框架实现私有和低资源领域文档理解,利用检索引导推理提升接地能力和领域泛化,无需人工标注。
Comments Accepted at WWW 2026 Demo Track
MedicalNarratives: 通过局部化叙述连接医学视觉与语言
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; Amazon(亚马逊)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。
MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型
机构 * HKUST(香港科技大学) ; JHU(约翰·霍普金斯大学) ; CUHKSZ(香港中文大学) ; NUS(新加坡国立大学) ; MUST(穆斯林大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。
Comments The project is available at https://charlescsyyy.github.io/MVT
MoIIE:多模态专家的混合模型用于大视觉语言模型
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institut(上海创新研究院) ; University of Southern California(南加州大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。
神经网络中的注意机制
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文系统阐述了神经网络中注意机制的理论基础、计算特性及应用,涵盖自然语言处理、计算机视觉和多模态学习等多个领域,分析了其可解释性及当前存在的限制。
基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。
Comments Accepted to AAAI 2026
迈向视觉-语言地理基础模型:一种综述
机构 * School of GeoAI(地理人工智能学院) ; Hindon STAI Institute(Hindon STAI研究所) ; Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室) ; East China Normal University(华东师范大学) ; School of AI(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; School of Automation and Intelligent Sensing(自动化与智能感知学院)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文综述了视觉-语言地理基础模型(VLGFMs),探讨其背景、核心技术和应用,旨在构建具备多样化地理感知能力的智能模型。
Comments 18 pages, 4 figures
AsyMoE:利用模态不对称性提升大视觉-语言模型专家专业化
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 AsyMoE通过三个专门专家组解决视觉-语言模态不对称问题,提升大模型专家专业化性能。
Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results
SELECT:在现实世界场景文本数据中检测标签错误
机构 * Yidun AI Lab, NetEase(网易异度人工智能实验室)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 SELECT通过多模态训练和SSLC方法有效检测现实世界场景文本数据中的标签错误,提升文本识别准确性。
Med3DVLM: 一种高效的视觉-语言模型用于3D医学图像分析
机构 * University of Florida(佛罗里达大学)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 Med3DVLM通过三个创新提出,实现了高效的3D医学图像分析,显著提升了图像-文本检索、报告生成和视觉问答的性能。
研究基于视觉-语言的图像质量评估中的低级视觉感知
机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文研究了基于视觉-语言模型的图像质量评估中低级视觉感知的问题,发现现有模型在检测基本失真时存在偏差,并通过改进视觉编码器对齐度提升失真识别准确率。
uCLIP: 无配对数据下多语言视觉语言模型的参数高效扩展
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 uCLIP通过无需配对数据的轻量级框架,在低资源语言中实现高效多语言视觉语言对齐。
Comments Our project page can be found at https://dinyudin203.github.io/uCLIP-project/
DEJIMA:一种新的大规模日语数据集用于图像描述和视觉问答
机构 * The University of Tokyo(东京大学) ; RIKEN(日本资源技术研究所)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 DEJIMA是首个大规模日语图像描述与视觉问答数据集,通过整合网络收集、目标检测和大语言模型优化,提升了日语语言和文化表现力,显著优于现有翻译或人工标注数据集。