arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-22 至 2025-12-22 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2510.16442 2025-12-22 cs.CV cs.AI 84%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17574 2025-12-22 cs.DC cs.LG 82%

Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing

通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理

Lingxiao Zhao, Haoran Zhou, Yuezhi Che, Dazhao Cheng

机构 * Wuhan University(武汉大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract)

AI总结 通过GPU内部调度和资源共享实现解耦的多阶段MLLM推理,提升吞吐量和延迟性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17154 2025-12-22 cs.SD 50%

InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing

InstructDubber:基于指令的零样本电影配音对齐

Zhedong Zhang, Liang Li, Gaoxiang Cong, Chunshan Liu, Yuhan Gao, Xiaowan Wang, Tao Gu, Yuankai Qi

机构 * VIPL group, ICT, CAS(中国科学院信息科技研究所VIPL小组)

专题命中 视频多模态 :multimodal(abstract)

AI总结 InstructDubber通过指令生成和持续时间蒸馏模块,实现鲁棒的领域内和零样本电影配音对齐。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08107 2025-12-22 cs.CR cs.HC 50%

Detecting Ambiguity Aversion in Cyberattack Behavior to Inform Cognitive Defense Strategies

检测网络攻击行为中的模糊厌恶以指导认知防御策略

Stephan Carney, Soham Hans, Sofia Hirschmann, Stacey Marsella, Yvonne Fonken, Peggy Wu, Nikolos Gurney

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究通过分析网络攻击行为中的模糊厌恶,提出了一种基于多模态数据和大语言模型的框架,用于实时推断攻击者倾向,以指导认知防御策略的开发。

详情

展开后加载摘要…

URL PDF HTML 收藏