arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2602.02175 2026-02-04 cs.CV 83%

CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization

CIEC: 通过隐式和显式线索耦合实现多模态弱监督操作定位

Xinquan Yu, Wei Lu, Xiangyang Luo, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) MoE Key Laboratory of Information Technology(信息技术关键实验室) Key Laboratory of Information Security Technology(信息安全技术重点实验室) Sun Yat-sen University(中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 CIEC通过耦合隐式和显式线索,实现多模态弱监督操作定位,利用粗粒度标注提升图像-文本对的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03007 2026-02-04 cs.CV cs.AI cs.LG 81%

VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering

VOILA:基于信息价值的保真度选择框架用于成本感知的多模态问答

Rahul Atul Bhope, K. R. Jayaram, Vinod Muthusamy, Ritesh Kumar, Vatche Isahagian, Nalini Venkatasubramanian

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 VOILA通过基于信息价值的自适应保真度选择,在多模态问答中实现成本优化与高精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03822 2026-02-04 cs.CL 70%

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考

Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) The University of Western Australia(西澳大学) Stanford University(斯坦福大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。

Comments Accepted at the The Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 67%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL 62%

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21249 2026-02-04 cs.CV cs.AI cs.LG 62%

Decipher-MR: A Vision-Language Foundation Model for 3D MRI Representations

Decipher-MR:一种用于3D MRI表示的视觉-语言基础模型

Zhijian Yang, Noel DSouza, Istvan Megyeri, Xiaojian Xu, Amin Honarmandi Shandiz, Farzin Haddadpour, Krisztian Koos, Laszlo Rusko, Emanuele Valeriano, Bharadwaj Swaninathan, Lei Wu, Parminder Bhatia, Taha Kass-Hout, Erhan Bas

机构 * GE Healthcare(通用电气医疗)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Decipher-MR是一种专门针对3D MRI的视觉-语言基础模型,通过自监督学习和报告引导的文本监督,实现对多种医学任务的高效支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02786 2026-02-04 cs.LG 50%

LEMON: Local Explanations via Modality-aware OptimizatioN

LEMON:通过模态感知优化实现局部解释

Yu Qin, Phillip Sloan, Raul Santos-Rodriguez, Majid Mirmehdi, Telmo de Menezes e Silva Filho

机构 * University of Bristol(布里斯托大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 LEMON是一种高效的多模态局部解释框架,通过模态感知优化生成统一解释,减少计算成本并提升解释忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏