arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2601.16547 2026-01-26 cs.SD cs.AI eess.AS 81%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、eess.AS

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 80%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 70%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16225 2026-01-26 eess.AS cs.AI cs.SD 62%

ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation

基于前置情感建模的语音编码用于共情响应生成

Zhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 ES4R通过前置情感建模和双层注意力机制,提升语音对话中的共情响应生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14357 2026-01-26 astro-ph.IM 50%

One Attempt at Building an Inclusive & Accessible Hybrid Astronomy Conference: FRB 2025

一次构建包容与可及性混合天文学会议的尝试:FRB 2025

Alice P. Curtin, Reshma Anna-Thomas, Amanda M. Cook, Carolina Cruz-Vinaccia, Jason Hessels, Robert Main, Inés Pastor Marazuela, Lauren Rhodes, Vishwangi Shah

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 FRB 2025会议通过混合模式、低费用和教育活动,为早期研究人员和欠资地区提供可及性,展示了低成本高包容性的会议可能性。

Comments 10 pages, 4 figures; Conference Reflection

详情

展开后加载摘要…

URL PDF HTML 收藏