arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46352 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4682 篇

2606.17020 2026-08-04 cs.CV cs.AI 版本更新 81%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16442 2026-07-21 cs.CV cs.CL cs.CR 新提交 81%

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

一种模态遗忘一切:增强视觉语言模型中的跨模态遗忘

Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

机构 * University of South Florida(南佛罗里达大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究视觉语言模型中跨模态遗忘转移问题,通过对三种架构研究发现其不对称不完整。提出CrossInf策略,聚焦关键transformer块遗忘,减少转移差距,提升鲁棒性,经人工评估验证,还用CKA分析浅层遗忘。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05736 2026-07-15 q-bio.QM cs.CL cs.CV cs.LG 81%

Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications

通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)

Zhanliang Wang, Da Wu, Quan Nguyen, Zhuoran Xu, Kai Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02734 2026-07-07 cs.CL cs.AI 新提交 81%

Echoes of Unrest: A Multimodal NLP Framework for Early Warning of Fake News and Violence-Driven Mob Activity

动荡的回声:用于假新闻和暴力驱动的暴民活动早期预警的多模态NLP框架

Md. Maruf Bangabashi, Tahmid Hasan, Golam Mahmud, Md. Mostafijur Rahman, Md. Toufiqur Rahman, Jahanur Biswas

机构 * Department of Computer Science and Engineering, Dhaka International University(达卡国际大学计算机科学与工程系) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(孟加拉国工程技术大学计算机科学与工程系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对社交媒体上错误信息传播引发危害的问题,提出多语言、多模态NLP框架。通过融合多基准数据集创建数据集,集成多种技术进行多模态融合,实验显示该框架在早期错误信息检测中有效。

Comments Accepted for publication as a book chapter (Taylor & Francis, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01115 2026-07-02 cs.CL cs.AI 新提交 81%

Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

面向大学利益相关者的多模态聊天助手开发:基于RAG的方法

Md Abu Hanif Shaikh, Abdullah Al Shafi

机构 * Institute of Information and Communication Technology, Khulna University of Engineering & Technology(信息与通信技术研究所,库尔纳工程技术大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大学利益相关者获取信息困难的问题,提出基于检索增强生成的多模态聊天系统,结合大语言模型与语义检索,支持文本和图像查询,将幻觉率从31.7%降至6.6%。

Comments Accepted at 2025 28th International Conference on Computer and Information Technology (ICCIT)

Journal ref 2025 28th International Conference on Computer and Information Technology (ICCIT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02456 2026-06-30 cs.CV cs.CL 81%

See, Think, Learn: A Self-Taught Multimodal Reasoner

看见、思考、学习:一种自教的多模态推理器

Sourabh Sharma, Sonam Gupta, Sadbhawna

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出See-Think-Learn框架,通过自训练提升多模态推理能力,结合感知与推理生成结构化推理过程,增强模型区分正确与误导性回答的能力。

Comments Accepted at The Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL 81%

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 81%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29299 2026-06-23 cs.CV cs.AI 版本更新 81%

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

机构 * The University of Auckland, New Zealand(奥克兰大学) Shandong University, China(山东大学) The University of Melbourne, Australia(墨尔本大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 81%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01696 2026-06-16 cs.CV cs.AI 版本更新 81%

Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

跨模态身份映射:通过强化学习最小化模态转换中的信息损失

Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团(阿里巴巴)) The University of Hong Kong(香港大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出跨模态身份映射(CIM)框架,利用强化学习优化图像描述,通过检索一致性度量信息损失,无需额外标注,显著提升关系推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11200 2026-06-11 cs.CL cs.CV 新提交 81%

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

使用多模态语言模型检测社交媒体上的AI生成内容

Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对AI生成内容检测的泛化性差、单模态依赖和缺乏可解释性问题,提出基于多模态数据的紧凑视觉-语言模型,实现检测与解释,在公开基准和内部数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22276 2026-06-02 cs.CV cs.CL 81%

WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models

WAON:用于对比视觉语言模型文化适应的大规模日语图像-文本数据集

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(日本国家研究所语言模型中心) NII(日本国家研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学研究所)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

AI总结 提出WAON,一个从Common Crawl构建的包含约1.55亿样本的最大公开原生日语图像-文本数据集,并通过微调实验证明其在日语文化基准上优于翻译数据。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-06-01 cs.CV cs.CL 81%

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01456 2026-06-01 cs.CV cs.AI cs.LG 81%

Rethinking Multimodal Few-Shot 3D Point Cloud Segmentation: From Fused Refinement to Decoupled Arbitration

重新思考多模态少样本3D点云分割:从融合精炼到解耦仲裁

Wentao Bian, Fenglei Xu

机构 * Suzhou University of Science and Technology(苏州科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态少样本3D点云分割中“融合-精炼”范式的“可塑性-稳定性困境”和CLIP的语义盲区,提出解耦专家仲裁少样本分割网络(DA-FSS),通过解耦语义与几何路径并相互正则化梯度,实现更好的泛化性能。

Comments Accepted to IJCAI-ECAI 2026 (Main Track). 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01926 2026-06-01 cs.CV cs.AI 81%

Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

跨模态注意力校准用于LVLM幻觉缓解

Jiaming Li, Jiacheng Zhang, Zequn Jie, Lin Ma, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Meituan(美团) Inspur Database Technology(Inspur数据库技术) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种无需训练的跨模态注意力校准方法,通过设计模态间解码和位置校准模块,缓解大型视觉语言模型中的幻觉问题。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29380 2026-05-29 cs.LG cs.AI cs.CV 81%

TRACER: Persistent Regularization for Robust Multimodal Finetuning

TRACER: 用于鲁棒多模态微调的持久正则化

Hesam Asadollahzadeh, Feng Liu, Christopher Leckie, Sarah M. Erfani

机构 * School of Computing and Information Systems (CIS), Faculty of Engineering and IT (FEIT), University of Melbourne, Australia(墨尔本大学计算机科学与信息系统学院(CIS)、工程与信息技术学院(FEIT))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出TRACER方法,通过加权移动平均教师实现持久正则化,解决多模态对比微调中的灾难性遗忘和EMA坍缩问题,提升分布外鲁棒性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL 81%

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25708 2026-05-26 cs.CV cs.CL cs.ET 81%

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP: 面向多域任务增量学习的跨模态自适应提示

Sriram Mandalika

机构 * Hasso Plattner Institute(霍普斯·普拉特纳研究所)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多域任务增量学习,提出跨模态自适应提示方法,利用CLIP文本嵌入空间进行任务路由、置信度估计和编码器适应,在MTIL基准上超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03191 2026-05-26 cs.CV cs.AI cs.LG 81%

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

机构 * Hasso Plattner Institute(霍普夫纳研究所) MBZUAI(穆萨大学人工智能研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14184 2026-05-21 cs.CV cs.AI 81%

Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models

更深入的思考,更弱的目标:理解并缓解多模态大语言模型推理过程中感知障碍

Ruiying Peng, Xueyu Wu, Jing Lei, Lu Hou, Yuanzheng Ma, Xiaohui Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies(华为技术)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在推理过程中出现的视觉感知障碍问题,提出了一种无需训练的视觉区域引导注意力框架,通过选择和重新加权视觉头部来引导模型关注与问题相关区域,从而提高视觉定位和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17341 2026-05-19 cs.CV cs.AI 81%

Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment

通过跨模态语义对齐实现面向视觉-语言模型的单样本黑盒成员推断攻击

Jiaqing Li, Yajuan Lu, Xiaochuan Shi, Gang Wu, ZhongYuan Wang, Chao Liang

机构 * Wuhan University(武汉大学) Tarim University(塔里木大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于跨模态语义对齐的新型成员推断攻击框架,针对视觉-语言模型在单样本和黑盒场景下的数据安全风险进行评估,通过量化联合嵌入空间中的对齐程度,显著提升了攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08188 2026-05-12 cs.CV cs.AI 81%

Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers

受神经科学启发的多模态Transformer中视觉趣味性分析

Mathis Immertreu, Fitim Abdullahu, Thomas Kinfe, Helmut Grabner, Patrick Krauss, Achim Schilling

机构 * Cognitive Computational Neuroscience Group, Patter Recognition Lab, University Erlangen-Nürnberg(认知计算神经科学组、模式识别实验室、埃尔兰根-纽伦堡大学) IDS Institut für Data Science, ZHAW School of Engineering, Winterthur, Switzerland(IDS数据科学研究所、ZHAW工程学院、温特图尔,瑞士) Mannheim Center for Neuromodulation and Neuroprosthetics, University Hospital Mannheim, Heidelberg University(曼海姆神经调制与神经假体中心、曼海姆大学医院、海德堡大学) BGU Ludwigshafen, Germany(BGU路易斯港,德国) Physics and Cognition Group, MCNN, University Hospital Mannheim, Heidelberg University(物理与认知组、MCNN、曼海姆大学医院、海德堡大学) NeuroAI and BCI Group, MCNN, University Hospital Mannheim, Heidelberg University(神经AI与BCI组、MCNN、曼海姆大学医院、海德堡大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究通过多模态视觉语言模型Qwen3-VL-8B探讨视觉趣味性编码机制,发现CI信息可从最终层嵌入中线性解码,揭示了无监督下视觉趣味性的结构化编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27674 2026-05-01 cs.CL cs.AI cs.CR cs.IR 81%

One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

一个单一的枢纽文本破坏CLIP:通过枢纽性揭示跨模态编码器的漏洞

Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai

机构 * NTT, Inc.(NTT公司) Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出方法识别枢纽嵌入及其对应文本,揭示跨模态编码器的漏洞,实验显示单一枢纽文本在图像描述评估中表现优异,暴露了编码器的缺陷。

Comments Accepted at ACL2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07474 2026-04-23 cs.CL cs.AI 81%

Cross-Modal Taxonomic Generalization in (Vision-) Language Models

跨模态分类泛化在(视觉-)语言模型中

Tianyang Xu, Marcelo Sandoval-Castaneda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了语言模型在无显性证据情况下通过跨模态泛化恢复超范畴知识的能力,发现语言模型能基于语言线索实现泛化。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV 81%

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16487 2026-04-22 cs.CV cs.AI 81%

Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering

通过局部跨模态对齐与引导实现几何感知的CLIP检索

Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval, Roy Ka-Wei Lee, Meenakshi Khosla, Amir Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks UCSD(加州大学圣塔莫尼卡分校) Harvard University(哈佛大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过局部跨模态对齐与引导改进CLIP检索,通过匈牙利匹配实现邻居级重排序,并利用查询条件局部引导提升属性绑定和组合检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 81%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17217 2026-04-21 cs.CV cs.AI 81%

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

视觉-语言模型中的跨模态注意力分析与优化:对视觉可靠性的研究

Lijie Zhou

机构 * School of Computer Science(计算机科学学院) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型中跨模态依赖性问题,通过对抗性评估框架发现优化模型能显著降低跨模态依赖,提升视觉特征关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16311 2026-04-21 cs.CL cs.AI cs.SI 81%

Multimodal Claim Extraction for Fact-Checking

多模态声明提取用于事实核查

Joycelyn Teo, Rui Cao, Zhenyun Deng, Zifeng Ding, Michael Sejr Schlichtkrull, Andreas Vlachos

机构 * Defence Science and Technology Agency, Singapore(新加坡国防科学与技术局) University of Cambridge, UK(英国剑桥大学) Queen Mary University of London, UK(英国伦敦大学学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个多模态社交媒体声明提取基准,评估了最先进的多模态大语言模型,在语义对齐、忠实度和去上下文化框架下发现基线模型难以建模修辞意图和上下文线索,引入意图感知框架MICE提升关键意图场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏