arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-03 至 2025-12-03 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 87%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02759 2025-12-03 eess.AS cs.SD eess.IV 86%

Towards Language-Independent Face-Voice Association with Multimodal Foundation Models

面向语言无关的面容-语音关联的多模态基础模型

Aref Farhadipour, Teodora Vukovic, Volker Dellwo

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系)

专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);cross-modal(abstract);分类 eess.AS

AI总结 本文提出了一种基于多模态基础模型的跨语言面容-语音关联方法,通过ImageBind与LoRA结合,实现了在未见过语言上的有效验证。

Comments This paper presents the system description of the UZH-CL team for the FAME2026 Challenge at ICASSP 2026. Our model achieved second place in the final ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02973 2025-12-03 cs.CV cs.CL cs.CR 81%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02523 2025-12-03 cs.SD cs.LG 71%

Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation

生成式多模态反馈用于歌唱语音合成评估

Xueyan Li, Yuxin Wang, Mengjie Jiang, Qingzi Zhu, Jiang Zhang, Zoey Kim, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :multi-modal(title)

AI总结 本文提出生成式多模态反馈框架,通过音频-语言模型生成多维语言和音频反馈,提升歌唱语音合成评估的准确性和可解释性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21025 2025-12-03 cs.SD cs.AI cs.LG eess.AS 62%

Text-Queried Audio Source Separation via Hierarchical Modeling

通过分层建模实现文本查询的音频源分离

Xinlei Yin, Xiulian Peng, Xue Jiang, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) School of Information and Communication Engineering, Communication University of China(中国通信大学信息与通信工程学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出HSM-TSS框架,通过分层建模实现文本查询的音频源分离,结合双阶段语义分离与结构保持重建,提升复杂场景下的分离性能与语义一致性。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01234 2025-12-03 cs.HC cs.AI 57%

Proactive Agentic Whiteboards: Enhancing Diagrammatic Learning

主动代理白板:增强图示学习

Suveen Ellawela, Sashenka Gamage, Dinithi Dissanayake

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 DrawDash通过实时语音驱动的视觉辅助,主动完成和优化教育图表,以减少教师认知负担并提升图示教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02515 2025-12-03 cs.SD 50%

VibOmni: Towards Scalable Bone-conduction Speech Enhancement on Earables

VibOmni: 向耳戴设备的可扩展骨传导语音增强迈进

Lixing He, Yunqi Guo, Haozheng Hou, Zhenyu Yan

机构 * department of information engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 VibOmni通过骨传导振动与音频融合,提升耳戴设备在嘈杂环境中的语音质量与噪声抑制能力。

Comments Submitted to TMC

详情

展开后加载摘要…

URL PDF HTML 收藏