arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-24 至 2025-11-24 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2407.07026 2025-11-24 cs.CV cs.CL cs.MM cs.SI 85%

Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition

通过语义补全与分解解决多模态情感检测中的情感差异

Daiqing Wu, Dongbao Yang, Huawen Shen, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CoDe网络,通过语义补全与分解解决多模态情感检测中的情感差异问题,提升分类性能。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 84%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV 79%

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11313 2025-11-24 cs.CV 79%

DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding

DocSLM:一种用于长多模态文档理解的小型视觉-语言模型

Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta

机构 * Microsoft(微软公司) LMU Munich(慕尼黑大学) MCML FAIR Meta(Meta FAIR) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 DocSLM通过高效的小型视觉-语言模型,在受限内存下实现长多模态文档理解,使用更少的资源达到与先进方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17103 2025-11-24 cs.CV 74%

Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs

弥合视觉情感差距:通过学习噪声图像-文本对借用文本知识

Daiqing Wu, Dongbao Yang, Yu Zhou, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) TMCC, College of Computer Science, Nankai University(TMCC,南开大学计算机学院)

专题命中 图文多模态 :image-text(title);分类 cs.CV

AI总结 本文提出通过学习噪声图像-文本对中的文本知识,弥合视觉情感识别中的情感差距,提升预训练视觉模型的情感感知能力。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 62%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV 57%

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15278 2025-11-24 cs.CV 57%

MindShot: A Few-Shot Brain Decoding Framework via Transferring Cross-Subject Prior and Distilling Frequency Domain Knowledge

MindShot: 一种通过跨受试者先验知识转移和频域知识蒸馏的少样本脑解码框架

Shuai Jiang, Zhu Meng, Haiwen Li, Delong Liu, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Network System(北京网络系统与网络文化重点实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MindShot通过跨受试者先验知识转移和频域知识蒸馏,实现少样本脑解码,提升解码适应性和效率。

Comments Accepted by KBS

详情

展开后加载摘要…

URL PDF HTML 收藏