arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-04 至 2025-12-04 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.13747 2025-12-04 cs.CV 90%

InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue

InteractiveOmni: 一种用于音频-视觉多轮对话的统一多模态模型

Wenwen Tong, Hewei Guo, Dongchuan Ran, Jiangnan Chen, Jiefan Lu, Kaibin Wang, Keqiang Li, Xiaoxu Zhu, Jiakui Li, Kehan Li, Xueheng Li, Lumin Li, Chenxu Guo, Jiasheng Zhou, Jiandong Chen, Xianye Wu, Jiahao Wang, Silei Wu, Lei Chen, Hanming Deng, Yuxuan Song, Dinghao Zhou, Guiping Zhong, Ken Zheng, Shiyin Kang, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 InteractiveOmni是一种统一的多模态模型,通过多阶段训练策略提升多轮对话能力,提供高效的音频-视觉交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17282 2025-12-04 cs.AI cs.SD 88%

ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection

ERF-BA-TFD+: 一种用于音频视觉深度伪造检测的多模态模型

Xin Zhang, Jiaming Chu, Jian Zhao, Yuchu Jiang, Xu Yang, Lei Jin, Chi Zhang, Xuelong Li

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.AI

AI总结 ERF-BA-TFD+通过结合增强接收场和音频视觉融合,提出了一种多模态深度伪造检测模型,在DDL-AV数据集上实现了最先进的检测性能。

Comments The paper is withdrawn after discovering a flaw in the theoretical derivation presented in Section Method. The incorrect step leads to conclusions that are not supported by the corrected derivation. We plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 87%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.17139 2025-12-04 cs.LO cs.DM math.LO 50%

Nested Sequents for Intuitionistic Grammar Logics via Structural Refinement

通过结构细化方法为直觉语法学逻辑构建嵌套序列为

Tim S. Lyon

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文通过结构细化方法,为直觉语法学逻辑构建了无割嵌套序列表演系统,并证明了其保守性、不可判定性和可判定子类。

Comments This paper is currently under review. arXiv admin note: text overlap with arXiv:2107.01998

详情

展开后加载摘要…

URL PDF HTML 收藏