End-to-end Image Captioning Exploits Multimodal Distributional Similarity
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Published in BMVC 2018
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Published in BMVC 2018
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul 06974, Republic of Korea(人工智能系,成均馆大学,韩国首尔)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)
Comments Multi-modal, Multi-modal Representation Learning, Missing Modality, Missing Modality Reconstruction, Speech and Multi-modality, Vision and Language
SARVLM:一种用于SAR图像语义理解的视觉语言基础模型
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Yuelushan Center for Industrial Innovation(岳麓山创新中心) ; School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。
Comments 13 pages, 13 figures
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)
Comments 18 pages
学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割
机构 * Seoul National University of Science and Technology(首尔科技大学) ; Chung-Ang University(中央大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。
Comments 14 pages
Journal ref Neurocomputing, 2026
通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉
机构 * Meta AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。
乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模
机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic ; University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic ; Centrum Wiskunde \& Informatic Leiden University University College London ; Vrije University of Amsterdam ; Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University ; Vrije University of Amsterdam Centrum Wiskunde \& Informatic
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。
Comments This version has been accepted by ICMI 2026 Conference
统一多模态模型用于脑MRI补全与理解
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。
Comments Early accepted to MICCAI 2026
SynIB: 多模态学习中最大化协同的信息瓶颈
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 提出SynIB方法,通过信息瓶颈理论直接优化多模态协同,在训练中屏蔽单模态时惩罚高置信度,提升跨模态推理能力,在合成和真实任务上准确率提升达7.8%。
临床视觉-语言模型中的跨模态链接风险
机构 * Lab for AI in Medicine(医学人工智能实验室) ; RWTH Aachen University(亚琛工业大学) ; Department of Diagnostic and Interventional Radiology(诊断与介入放射学部门)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究临床视觉-语言模型(VLM)在图像与报告分离场景下通过余弦相似度实现跨模态重链接的风险,并采用仅对投影头进行差分隐私微调的方法在保持图像效用同时显著降低重链接率。
使用多片段视频破解多模态大语言模型
机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) ; Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。
Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026
PRISM:免训练多模态数据选择的自剪枝内在选择方法
机构 * LMU Munich(慕尼黑大学) ; Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) ; METEOR ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。
Comments Accepted to ACL 2026 and selected for the Best Paper list; later desk-rejected due to an inadvertent manual bibliography-editing error. Previous versions are withdrawn due to an inadvertent manual bibliography-editing error; please refer to the latest corrected version
当图文推理遇上安全:什么决定了多模态越狱鲁棒性?
机构 * Independent Researcher(独立研究者) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Purdue University(普渡大学) ; Duke University(杜克大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。
Comments 17 pages, 6 figures, 7 tables
视觉引导的多模态推理策略优化
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; SYSU(南方科技大学) ; BUPT(北京邮电大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。
Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO
视觉-语言模型的终身学习:增强的EWC与跨模态知识保留
机构 * Sejong University, Computer Science Engineering(世宗大学,计算机科学工程) ; Technische Universität Ilmenau, Computer Engineering(伊门瑙技术大学,计算机工程)
专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract)
AI总结 本文提出一种结合增强EWC与参数高效微调的框架,有效减少视觉-语言模型在连续学习中的遗忘,通过多模态Fisher信息矩阵计算和跨模态一致性保留,实现78%的遗忘率降低,并在动态环境中提升多模态AI系统的适应能力。
Comments 8 pages, 5 figures, 1 table. Applications in autonomous driving, intelligent robotic assistants, and adaptive robotics systems
图片胜过千言吗?基于视觉证据必要性的自适应多模态事实核查
机构 * School of AI Convergence, Soongsil University(顺斯利大学人工智能融合学院) ; MAUM AI Inc.(MAUM人工智能公司) ; Department of Intelligent Semiconductors, Soongsil University(顺斯利大学智能半导体系)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文挑战了多模态证据普遍提升性能的假设,提出AMuFC框架,通过分析和验证器模型自适应使用视觉证据,提升事实核查准确性。
Comments preprint, 18 pages
M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用
机构 * DEEPNOID Inc.(DEEPNOID公司)
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。
Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025
人为区域适应于多模态视觉-语言模型
机构 * Cohere ; SEACrowd ; AI Singapore ; Universiti Teknologi PETRONAS ; Oracle ; Carnegie Mellon University(卡内基梅隆大学) ; Monash University, Indonesia(莫纳什大学(印尼)) ; King Mongkut’s University of Technology Thonburi(泰国孔敬大学) ; Nara Institute of Science and Technology(奈良科学技術大學) ; Stanford University(斯坦福大学) ; MBZUAI ; National University of Singapore(新加坡国立大学) ; Monash University, Australia(莫纳什大学(澳大利亚)) ; Brown University(布朗大学) ; University of Bath(巴斯大学) ; Mila - Quebec AI Institute(蒙特利尔AI研究所) ; Institut Teknologi Bandung(Bandung 工程技术大学) ; Ateneo de Manila University(马尼拉亚特内奥大学) ; Universitas Pelita Harapan(Pelita Harapan 大学) ; Seoul National University of Science and Technology(首尔科学技术大学) ; Thammasat University(泰国 Thammasat 大学) ; Independent(独立) ; University College London(伦敦大学学院) ; Nanyang Technological University(南洋理工大学) ; MiroMind AI ; University of Indonesia(印度尼西亚大学) ; University of New Haven(纽黑文大学) ; INTI International University and Colleges(INTI 国际大学和学院) ; Binus University(Binus 大学) ; National University Philippines(菲律宾国家大学) ; ThoughtFull
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。
穿透欺骗:在多模态新闻中揭示误导性创作者意图
机构 * National University of Singapore(新加坡国立大学) ; Yunnan University(云南大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。
Comments ICLR 2026
YOLOv10结合Kolmogorov-Arnold网络和视觉-语言基础模型用于可解释的目标检测和可信的多模态AI在计算机视觉感知
机构 * University of Bath(巴斯大学) ; Zhejiang University(浙江大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出一种基于Kolmogorov-Arnold网络和视觉-语言基础模型的YOLOv10框架,通过七种几何和语义特征提升目标检测的可解释性,并在模糊、遮挡或低纹理场景中实现可信的置信度估计。
Comments 14 pages, 23 Figures, 6 Tables
通过最优部分传输学习图像-文本匹配
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract)
AI总结 本文提出OMIT网络,利用最优传输理论和跨模态移动距离,高效计算图像与文本片段相似性,通过部分匹配消除冗余对齐,验证了其在Flickr30K和MS-COCO数据集上的优越性能。
Comments accepted by ICASSP2025
抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解
机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; Wuhan University(武汉大学) ; ByteDance(字节跳动)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。
Comments ICLR 2026 Camera Ready Version
MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练
机构 * LIONS, EPFL(EPFL 雷奥尼实验室)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)
AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。
TADS: 任务感知的数据选择用于多任务多模态预训练
机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) ; School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 TADS通过整合内在质量、任务相关性和分布多样性,提升多任务多模态预训练的数据效率,实现更高性能。
通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理
机构 * University of Adelaide(阿德莱德大学) ; Hohai University(河海大学) ; Amap
专题命中 图文多模态 :cross-modal(title);multimodal(abstract);image-text(abstract)
AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。
Router-Suggest: 动态路由用于视觉 grounded 对话中的多模态自动补全
机构 * IIT Kharagpur(印度IIT卡拉格浦大学) ; Microsoft(微软公司)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 Router-Suggest 通过动态路由选择文本模型和 VLMs,提升多模态对话中的自动补全效率和用户满意度。
Comments Accepted to EACL 2026 Industry Track, 12 pages, 6 figures
评估大型语言模型在多模态化学奥林匹克考试中的表现
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; iFLYTEK AI Research(iFLYTEK人工智能研究院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。
Comments Published at Communications Chemistry
Journal ref Commun. Chem. 8 (2025)
MM-PoE:通过多模态模型的排除过程进行多选推理
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。