arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2311.15759 2025-12-30 cs.CL cs.AI cs.CV 85%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI 81%

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23573 2025-12-30 cs.CV 79%

ProGuard: Towards Proactive Multimodal Safeguard

ProGuard:迈向主动多模态安全防护

Shaohan Yu, Lijun Li, Chenyang Si, Lu Sheng, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) PRLab Nanjing University(南京大学PRLab) Beihang University(北航)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ProGuard通过强化学习和同义词库奖励机制,实现主动多模态安全防护,显著提升分布外风险检测与描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23557 2025-12-30 cs.CR cs.AI 79%

Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks

迈向可信的代理AI:一种多模态框架用于防止提示注入攻击

Toqeer Ali Syed, Mishal Ateeq Almutairi, Mahmoud Abdel Moaty

机构 * Faculty of Computer and Information System(计算机与信息系统系) Islamic University of Madinah(麦地那伊斯兰大学) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过溯源感知机制防止代理AI中的提示注入攻击,提升系统安全性和稳定性。

Comments It is accepted in a conference paper, ICCA 2025 in Bahrain on 21 to 23 December

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 62%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23244 2025-12-30 cs.CV cs.AI 62%

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23028 2025-12-30 cs.CV cs.AI cs.SE 62%

An Architecture-Led Hybrid Report on Body Language Detection Project

以架构为导向的混合报告:身体语言检测项目

Thomson Tong, Diba Darooneh

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22238 2025-12-30 cs.LG cs.AI cs.CV 62%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06474 2025-12-30 cs.CV cs.AI cs.LG 62%

Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding

通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性

Yixiong Fang, Ziran Yang, Zhaorun Chen, Zhuokai Zhao, Jiawei Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23109 2025-12-30 cs.LG cs.AI stat.ML 57%

How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure

需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16531 2025-12-30 cs.AI 57%

Scaling Laws for Energy Efficiency of Local LLMs

本地大语言模型和视觉-语言模型的扩展定律

Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, Román Orús

机构 * Multiverse Computing Donostia International Physics Center Ikerbasque Foundation for Science Multiverse Computing, Centre for Social Innovation

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2506.05191 2025-12-30 cs.CV 85%

MokA: Multimodal Low-Rank Adaptation for MLLMs

MokA:多模态低秩适应用于大规模语言模型

Yake Wei, Yu Miao, Dongzhan Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 MokA通过多模态低秩适应提升大规模语言模型的多模态微调效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13673 2025-12-30 cs.MM cs.CV cs.IR cs.LG eess.AS 82%

Recent Advances and Challenges in Deep Audio-Visual Correlation Learning

深度音频视觉相关性学习的最新进展与挑战

Luís Vilaça, Yi Yu, Paula Viana

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文综述了深度音频-视觉相关性学习的最新进展,分析了现有模型、优化方法及未来研究方向。

Comments 8 pages, 1 figure

Journal ref ACM Computing Surveys, 57(12), 1-46, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02005 2025-12-30 cs.CV 70%

Learning Visual Affordance from Audio

从音频学习视觉可及性

Lidong Lu, Guo Chen, Zhu Wei, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 AVAGFormer通过融合音频和视觉信号,实现了从音频学习视觉可及性的任务,提升了交互区域的识别性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22491 2025-12-30 cs.CL cs.AI 62%

ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation

曼juTTS: 通过流匹配和分层文本表示实现高质量曼ju语音合成

Suhua Wang, Zifan Wang, Xiaoxin Sun, D. J. Wang, Zhanbo Liu, Xin Li

机构 * Department of Computer Science, Changchun Humanities and Sciences College(计算机科学系,长春人文科学学院) School of Information Science and Technology, Northeast Normal University(信息科学与技术学院,东北师范大学) College of Optical Science and Engineering, Zhejiang University(光学科学与工程学院,浙江大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 ManchuTTS通过流匹配和分层文本表示,解决曼ju语音合成中的黏着性和数据稀缺问题,实现高质量语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2512.23291 2025-12-30 cs.CV 83%

Multi-Track Multimodal Learning on iMiGUE: Micro-Gesture and Emotion Recognition

多轨多模态学习于iMiGUE:微手势与情绪识别

Arman Martirosyan, Shahane Tigranyan, Maria Razzhivina, Artak Aslanyan, Nazgul Salikhova, Ilya Makarov, Andrey Savchenko, Aram Avetisyan

机构 * Russian - Armenian University(俄罗斯-亚美尼亚大学) Sber AI Lab(Sber AI实验室) HSE University(俄罗斯高等经济大学) Innopolis University(Innopolis大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院可信人工智能研究中心)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出多模态框架,利用视频和骨骼姿态数据实现微手势识别和基于行为的情绪预测,通过交叉模态融合模块提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22741 2025-12-30 cs.CL 83%

Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

基于解释和时序对齐的文本引导稀疏专家混合模型用于多模态情感分析

Dongning Rao, Yunbiao Zeng, Zhihua Jiang, Jujian Lv

专题命中 视频多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出基于解释和时序对齐的文本引导稀疏专家混合模型,用于提升多模态情感分析的性能。

Comments 9 pages, 9 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG 67%

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10516 2025-12-30 cs.CV cs.AI 62%

CogStream: Context-guided Streaming Video Question Answering

CogStream: 基于上下文的流视频问答

Zicheng Zhao, Kangyu Wang, Shijie Li, Rui Qian, Weiyao Lin, Huabin Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CogStream任务,通过视觉流压缩和历史对话检索,解决流视频中关键信息识别与问答问题。

Comments Project page: https://github.com/LiamZhao326/CogStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 62%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13415 2025-12-30 cs.CV 57%

USTM: Unified Spatial and Temporal Modeling for Continuous Sign Language Recognition

USTM:统一的空间和时间建模用于连续手语识别

Ahmed Abul Hasanaath, Hamzah Luqman

机构 * College of Information and Computer Science(信息与计算机科学学院) King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 USTM通过结合Swin Transformer与轻量级时间适配器,实现高效的空间-时间建模,提升连续手语识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23093 2025-12-30 cs.HC 50%

Cogniscope: Modeling Social Media Interactions as Digital Biomarkers for Early Detection of Cognitive Decline

Cogniscope: 将社交媒体互动建模为数字生物标记物以早期检测认知衰退

Ananya Drishti, Mahfuza Farooque

专题命中 视频多模态 :multimodal(abstract)

AI总结 Cogniscope通过模拟社交媒体互动数据,研究认知健康的数字生物标记物,提供可控测试平台以评估早期认知衰退检测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2509.13754 2025-12-30 cs.CV 79%

Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval

跨模态全模式细粒度对齐用于文本到图像人物检索

Hao Yin, Xin Man, Feiyu Chen, Jie Shao, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究所,电子科学与技术大学) University of Electronic Science and Technology of China(电子科学与技术大学) Sichuan Artificial Intelligence Research Institute(四川人工智能研究院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出FMFA框架,通过显式细粒度对齐和隐式关系推理实现文本到图像人物检索的高精度匹配。

Comments accepted by ACM Transactions on Multimedia Computing Communications and Applications in December 2025

Journal ref ACM Transactions on Multimedia Computing Communications and Applications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22780 2025-12-30 cs.CV eess.IV 57%

Plug In, Grade Right: Psychology-Inspired AGIQA

插入选项,正确评分:心理学启发的AGIQA

Zhicheng Liao, Baoliang Chen, Hanwei Zhu, Lingyu Zhu, Shiqi Wang, Weisi Lin

机构 * School of Computer Science, South China Normal University(南方科技大学计算机科学学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Computer Science, City University of Hong Kong(香港城市大学计算机科学学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 基于心理学的AGIQA模型通过改进的分级响应模型提升图像质量评分的准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 11 篇

2512.11239 2025-12-30 cs.CV 88%

Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition

跨模态提示用于平衡不完整多模态情绪识别

Wen-Jue He, Xiaofeng Zhu, Zheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态提示方法,通过增强模态特定特征和动态加权提升多模态情绪识别的准确性和鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 79%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 70%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23185 2025-12-30 eess.IV cs.AI cs.CV 62%

EIR: Enhanced Image Representations for Medical Report Generation

EIR: 增强的医学报告生成图像表示

Qiang Sun, Zongcheng Ji, Yinlong Xiao, Peng Chang, Jun Yu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EIR通过跨模态Transformer融合元数据与图像表示,结合医学领域预训练模型,有效解决信息不对称和领域差距问题,提升胸部X光报告生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22288 2025-12-30 cs.LG cs.AI cs.CV 62%

Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

Co-GRPO:针对掩码扩散模型的协同优化组相对策略优化

Renping Zhou, Zanlin Ni, Tianyi Chen, Zeyu Liu, Yang Yue, Yulin Wang, Yuxuan Wang, Jingshu Liu, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 leap 实验室) Anyverse Dynamics

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Co-GRPO通过协同优化模型和调度参数提升掩码扩散模型的生成质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22237 2025-12-30 cs.CV cs.AI 62%

Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction

元信息引导的跨领域协同扩散模型用于低剂量PET重建

Mengxiao Geng, Ran Hong, Xiaoling Xu, Bingxuan Li, Qiegen Liu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出元信息引导的跨领域协同扩散模型,通过整合跨模态先验知识提升低剂量PET重建质量与生理细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏