arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-11 至 2025-12-11 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2506.11436 2025-12-11 cs.CV 87%

TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models

TAViS: 基于文本的音频视觉分割与基础模型

Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

AI总结 TAViS通过文本桥接机制结合多模态基础模型与分割模型,实现高效的音频视觉分割与跨模态对齐。

Comments ICCV2025,code:https://github.com/Sssssuperior/TAViS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02149 2025-12-11 cs.CV 79%

AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation

AURORA:通过结构化推理和强化学习增强参考音频视频分割

Ziyang Luo, Nian Liu, Fahad Shahbaz Khan, Junwei Han

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 AURORA通过结构化推理和强化学习提升参考音频视频分割的准确性和鲁棒性

Comments AAAI2026,code:https://github.com/Sssssuperior/AURORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08953 2025-12-11 cs.HC cs.AI 79%

SimClinician: A Multimodal Simulation Testbed for Reliable Psychologist AI Collaboration in Mental Health Diagnosis

SimClinician: 一种多模态模拟测试平台,用于心理健康诊断中可靠的心理学家AI协作

Filippo Cenacchi, Longbing Cao, Deborah Richards

机构 * Macquarie University(麦考瑞大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SimClinician是一种多模态模拟平台,通过整合音频、文本和目光-表情模式,帮助心理学家在心理健康诊断中与AI协作,提升诊断的准确性和交互的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09504 2025-12-11 cs.SD 78%

DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance

DMP-TTS: 解耦多模态提示的可控文本到语音系统 with 链式引导

Kang Yin, Chunyu Qiang, Sirui Zhao, Xiaopeng Wang, Yuzhe Liang, Pengfei Cai, Tong Xu, Chen Zhang, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 DMP-TTS通过解耦多模态提示和链式引导技术,实现了更强的文本到语音风格可控性,同时保持良好的可懂度和自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏