Multimodal Attention for Neural Machine Translation
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
Comments 10 pages, under review COLING 2016
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
Comments 10 pages, under review COLING 2016
CCRC:面向图像变化描述与分割的变化感知描述与推理链
机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) ; Guangxi Minzu University, China(广西民族大学,中国) ; National University of Defense Technology, China(国防科学技术大学,中国)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。
通过细化文本嵌入缓解大型视觉语言模型中的幻觉
机构 * University of Maryland(马里兰大学) ; Dolby Laboratories(杜比实验室) ; Capital One
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对大型视觉语言模型因过度依赖文本先验而忽视视觉线索导致的幻觉问题,提出一种简单有效的视觉特征融入方法,通过学习视觉信息化的文本嵌入来平衡注意力分布,显著降低幻觉并提升多模态推理能力。
Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics
CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Anzhen Hospital(北京安贞医院) ; Beihang University(北航) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。
Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型
机构 * Concordia University(康科迪亚大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。
Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October
LoMo: 局部模态替换以实现更深的视觉-语言融合
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。
Infection-Reasoner: 一种用于伤口感染分类的紧凑视觉-语言模型,结合证据支撑的临床推理
机构 * Worcester Polytechnic Institute(沃斯特理工学院) ; UMass Chan Medical School(UMass Chan医学院)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Infection-Reasoner,一种紧凑的视觉-语言模型,通过两阶段训练提升伤口感染分类和推理生成的准确性与解释性,实验结果显示其在分类和推理质量上优于现有方法。
AD-Copilot:通过视觉上下文比较实现工业异常检测的视觉-语言助手
机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) ; Macau University of Science and Technology(澳门科技大学) ; Tencent YouTu Lab(腾讯YouTu实验室) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 AD-Copilot通过视觉上下文比较提升工业异常检测性能,采用新颖的数据筛选流程和比较编码器,在多个基准测试中取得优异成绩,超越人类专家水平。
Comments Code and models are released at https://github.com/jam-cc/AD-Copilot
将生成器转化为检索器:解锁多模态大语言模型用于自然语言引导的地理定位
机构 * Vermont Artificial Intelligence Lab, Department of Computer Science, University of Vermont(佛蒙特大学计算机科学系佛蒙特人工智能实验室) ; Intelligent Machines Lab, Department of Artificial Intelligence, Information Technology University(信息技术大学人工智能系智能机器实验室) ; Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种简单有效的框架,通过参数高效微调将多模态大语言模型应用于自然语言引导的地理定位,实现强大的跨模态对齐,取得GeoText-1652的SOTA结果,并在CVG-Text的5个子任务中表现优异。
Comments CVPRF
SmartCLIP: 基于识别保证的模块化视觉-语言对齐
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The University of Sydney(悉尼大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SmartCLIP,通过理论条件实现文本与视觉表征的灵活对齐,确保语义信息完整保留并解耦视觉表征,提升多任务性能。
Comments CVPR2025
DanQing:一个更新的大型中文视觉-语言预训练数据集
机构 * Glint Lab(光粒实验室)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出DanQing数据集,包含1亿张高质量图像-文本对,通过系统化流程提升数据质量,实验表明其在多种下游任务中表现优异,且具备更平衡的语义分布和更强的扩展能力。
Comments 19 pages, 11 figures, 7 tables
Uni-cot: 向跨文本和视觉的统一链式推理迈进
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。
Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/
PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。
基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷
机构 * Chengyin Hu(独立研究者) ; Xiang Chen(独立研究者) ; Zhe Jia(独立研究者) ; Weiwen Shi(独立研究者) ; Fengyu Zhang(独立研究者) ; Jiujiang Guo(独立研究者) ; Yiwei Wei(独立研究者)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。
跨模态细粒度对齐 via 粒度感知和区域不确定建模
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
AI总结 本文提出了一种基于粒度感知和区域不确定建模的跨模态细粒度对齐方法,通过显著性感知和不确定性建模提升对齐的鲁棒性和可解释性。
Comments 10 pages, 6 figures, accepted by AAAI 2026
机构 * University of Warsaw(华沙大学) ; Warsaw University of Technology(华沙理工大学) ; LMU Munich(慕尼黑大学) ; MCML ; DFKI(德累斯顿大学) ; Bielefeld University(比勒菲尔德大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2025. Code: https://github.com/hbaniecki/fixlip
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by NAACL2025 findings
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Center for Smart Health, School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院智能健康中心) ; Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Radiology, Zhongshan Hospital (Xiamen), Fudan University(复旦大学中山医院放射科) ; National Institute for Data Science in Health and Medicine(医学与数据科学国家研究院) ; Department of Computer Science, School of Informatics, Xiamen University(厦门大学信息学院计算机科学系)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments TMI 2025
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 18 pages, 7 figures, 6 tables
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments ICML 2024. Code: https://github.com/sdc17/CrossGET
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI'2024, 15 pages (with appendix), 7 figures, 10 tables
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2024
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI
Comments work in progress. Code and data will be available at https://github.com/hkust-vgd/MarineGPT
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Findings of the Association for Computational Linguistics: NAACL 2022, pages 1031-1041, Seattle, United States. Association for Computational Linguistics
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 4 figures. To appear at Conference on Empirical Methods in Natural Language Processing (EMNLP) 2022
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted at ICML2022
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted by ECCV 2020 as Spotlight