arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-29 至 2025-09-29 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 13 篇

2509.21377 2025-09-29 cs.CV cs.AI 86%

Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation

Yinfeng Yu, Hailong Zhang, Meiling Zhu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) No. 59 Middle School of Urumqi(乌鲁木齐市第五十九中学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Main paper (8 pages). Accepted for publication by ECAI( European Conference on Artificial Intelligence) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10859 2025-09-29 cs.MM cs.CL cs.HC 81%

MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions

Ramaneswaran Selvakumar, Ashish Seth, Nishit Anand, Utkarsh Tyagi, Sonal Kumar, Sreyan Ghosh, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15220 2025-09-29 cs.CV cs.CL cs.SD 81%

video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21749 2025-09-29 cs.CL cs.SD 79%

Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models

Zhen Xiong, Yujun Cai, Zhecheng Li, Junsong Yuan, Yiwei Wang

机构 * University of Southern California(南加州大学) University of Queensland(昆士兰大学) University of California, San Diego(加州大学圣地亚哥分校) University of Buffalo(布法罗大学) University of California, Merced(加州大学默塞德分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16378 2025-09-29 cs.CY cs.CL 79%

Longitudinal and Multimodal Recording System to Capture Real-World Patient-Clinician Conversations for AI and Encounter Research: Protocol

Misk Al Zahidy, Kerly Guevara Maldonado, Luis Vilatuna Andrango, Ana Cristina Proano, Ana Gabriela Claros, Maria Lizarazo Jimenez, David Toro-Tobon, Victor M. Montori, Oscar J. Ponce-Ponte, Juan P. Brito

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments 23 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22651 2025-09-29 cs.CL cs.AI cs.CV cs.HC cs.SD 67%

VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing

Ke Wang, Houxing Ren, Zimu Lu, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22063 2025-09-29 cs.CV cs.SD 57%

High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling

Chao Huang, Susan Liang, Yapeng Tian, Anurag Kumar, Chenliang Xu

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22062 2025-09-29 cs.SD eess.AS 57%

Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling

Junjie Cao, Yichen Han, Ruonan Zhang, Xiaoyang Hao, Hongxiang Li, Shuaijiang Zhao, Yue Liu, Xiao-Ping Zhng

机构 * Tsinghua University(清华大学) Peking University(北京大学) AMAP Speech(AMAP语音)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

Comments conference paper about TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21574 2025-09-29 cs.CV 57%

X-Streamer: Unified Human World Modeling with Audiovisual Interaction

You Xie, Tianpei Gu, Zenan Li, Chenxu Zhang, Guoxian Song, Xiaochen Zhao, Chao Liang, Jianwen Jiang, Hongyi Xu, Linjie Luo

机构 * ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page at https://byteaigc.github.io/X-Streamer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16031 2025-09-29 cs.CV 57%

GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition

Tianyue Wang, Shuang Yang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04059 2025-09-29 cs.CL 57%

Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning

Zhilin Wang, Zhe Yang, Yun Luo, Yafu Li, Xiaoye Qu, Ziqian Qiao, Haoran Zhang, Runzhe Zhan, Derek F. Wong, Jizhe Zhou, Yu Cheng

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19463 2025-09-29 cs.HC cs.AI 57%

"She was useful, but a bit too optimistic": Augmenting Design with Interactive Virtual Personas

Paluck Deep, Monica Bharadhidasan, A. Baki Kocaballi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments The version accepted for publication at International Journal of Human-Computer Studies

Journal ref International Journal of Human-Computer Studies (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13068 2025-09-29 cs.SD cs.LG eess.AS 57%

On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning

Tiago Tavares, Fabio Ayres, Zhepei Wang, Paris Smaragdis

机构 * INSPER Institute of Teaching and Research(INSPER教学与研究机构) Research University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校研究大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏