arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2510.10509 2026-02-18 cs.SD cs.AI 74%

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

MARS-Sep: 多模态对齐强化声音分离

Zihan Zhang, Xize Cheng, Zhennan Jiang, Dongjie Fu, Jingyuan Chen, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 67%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12174 2026-02-18 cs.LG cs.AI cs.CL cs.CV 67%

Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes

Just KIDDIN: 基于知识注入与蒸馏的有害表情包检测

Rahul Garg, Trilok Padhi, Hemang Jain, Ugur Kursuncu, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad Georgia State University(佐治亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种结合知识蒸馏与注入的框架,用于提升有害表情包检测的性能,通过整合大规模知识图谱和视觉语言模型,实现更准确的毒性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15381 2026-02-18 cs.IR cs.CV 57%

Automatic Funny Scene Extraction from Long-form Cinematic Videos

从长篇电影视频中自动提取搞笑场景

Sibendu Paul, Haotian Jiang, Caren Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端系统,用于从长篇电影视频中自动识别和排名幽默场景,通过多模态方法提升场景定位和幽默检测精度。

Journal ref Association for the Advancement of Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏