arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-05 至 2025-08-05 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2507.16596 2025-08-05 cs.CV 83%

A Multimodal Deviation Perceiving Framework for Weakly-Supervised Temporal Forgery Localization

Wenbo Xu, Junyan Wu, Wei Lu, Xiangyang Luo, Qian Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) School of Cyber Science and Engineering, Wuhan University(网络科学与工程学院,武汉大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 9 pages, 3 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05185 2025-08-05 q-fin.CP cs.AI cs.MM 81%

Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance

Fengbin Zhu, Junfeng Li, Liangming Pan, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Estates Pte Ltd(6Estates私人有限公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

Comments Accepted by MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19378 2025-08-05 cs.CV cs.AI cs.CL cs.LG 80%

Libra: Leveraging Temporal Images for Biomedical Radiology Analysis

Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * Information Retrieval Group(信息检索组) AI4BioMed Lab(AI4BioMed实验室) School of Computing Science(计算科学学院) University of Glasgow(格拉斯哥大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 30 pages, 5 figures, Adding Appendix

Journal ref Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02179 2025-08-05 cs.CV 79%

Weakly Supervised Multimodal Temporal Forgery Localization via Multitask Learning

Wenbo Xu, Wei Lu, Xiangyang Luo

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University(计算机科学与工程学院、信息科技教育部重点实验室、广东省信息安全技术重点实验室、中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 13 pages,4 figures. arXiv admin note: text overlap with arXiv:2507.16596

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01701 2025-08-05 cs.LG cs.AI 79%

MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model

Asmit Bandyopadhyay, Rohit Basu, Tanmay Sen, Swagatam Das

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01168 2025-08-05 cs.MM 79%

Graph-based Interaction Augmentation Network for Robust Multimodal Sentiment Analysis

Hu Zhangfeng, Shi mengxin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01781 2025-08-05 cs.CL cs.AI 62%

A comprehensive taxonomy of hallucinations in Large Language Models

Manuel Cossio

机构 * Universitat de Barcelona(巴塞罗那大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 55 pages, 16 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01546 2025-08-05 cs.CV 57%

E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation

Zeyu Xu, Junkang Zhang, Qiang Wang, Yi Liu

机构 * Zeyu Xu(作者) Junkang Zhang(作者) Qiang Wang(作者) Yi Liu(作者)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏