arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2601.20618 2026-01-29 cs.CV cs.AI cs.CL 87%

GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection

GDCNet:用于多模态讽刺检测的生成不一致比较网络

Shuguang Zhang, Junhong Lian, Guoxin Yu, Baoxun Xu, Xiang Ao

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所(ICT),中国科学院(CAS)) University of Chinese Academy of Sciences, CAS(中国科学院大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Stock Exchange(深圳证券交易所)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GDCNet通过生成事实性图像描述和文本对比,提升多模态讽刺检测的准确性和鲁棒性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20075 2026-01-29 cs.CV 70%

Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning

稀疏CLIP:在对比学习中协同优化可解释性与性能

Chuan Qin, Constantin Venhoff, Sonia Joseph, Fanyi Xiao, Stefan Scherer

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 稀疏CLIP通过在对比学习中直接整合稀疏性,实现了可解释性与性能的协同优化,保留了多模态能力并提升了下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17461 2026-01-29 cs.CV cs.CL 62%

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。

Comments Accepted to appear in the main conference of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20064 2026-01-29 cs.CV 57%

DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation

DiSa:面向开放词汇语义分割的视觉-语义解耦框架

Zhen Yao, Xin Li, Taotao Jing, Shuai Zhang, Mooi Choo Chuah

机构 * Department of Computer Science and Engineering, Lehigh University(计算机科学与工程系,莱恩大学) Department of Computer Science(计算机科学系) Engineering, Lehigh University(工程系,莱恩大学) Qualcomm AI Research(高通人工智能研究)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 DiSa通过显著性感知解耦框架和分层细化模块,有效解决开放词汇语义分割中前景偏见和空间定位不足的问题,提升分割精度。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20707 2026-01-29 cs.CV 57%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 57%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏