arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-04 至 2025-09-04 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2509.03212 2025-09-04 cs.CV 70%

AIVA: An AI-based Virtual Companion for Emotion-aware Interaction

Chenxi Li

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21619 2025-09-04 cs.CL cs.AI cs.SD eess.AS 67%

IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech

Siyi Zhou, Yiquan Zhou, Yi He, Xun Zhou, Jinchao Wang, Wei Deng, Jingchen Shu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02969 2025-09-04 cs.CV cs.MM cs.SI 62%

VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results

Dasong Li, Sizhuo Ma, Hang Hua, Wenjie Li, Jian Wang, Chris Wei Zhou, Fengbin Guan, Xin Li, Zihao Yu, Yiting Lu, Ru-Ling Liao, Yan Ye, Zhibo Chen, Wei Sun, Linhan Cao, Yuqin Cao, Weixia Zhang, Wen Wen, Kaiwei Zhang, Zijian Chen, Fangfang Lu, Xiongkuo Min, Guangtao Zhai, Erjia Xiao, Lingfeng Zhang, Zhenjie Su, Hao Cheng, Yu Liu, Renjing Xu, Long Chen, Xiaoshuai Hao, Zhenpeng Zeng, Jianqin Wu, Xuxu Wang, Qian Yu, Bo Hu, Weiwei Wang, Pinxin Liu, Yunlong Tang, Luchuan Song, Jinxi He, Jiaru Wu, Hanjia Lyu

机构 * Sizhuo Ma(* 作者单位) Hang Hua(* 作者单位) Wenjie Li(* 作者单位) Jian Wang(* 作者单位) Chris Wei Zhou(* 作者单位) Fengbin Guan(* 作者单位) Xin Li(* 作者单位) Zihao Yu(* 作者单位) Yiting Lu(* 作者单位) Ru-Ling Liao(* 作者单位) Yan Ye(* 作者单位) Zhibo Chen(* 作者单位) Wei Sun(* 作者单位) Linhan Cao(* 作者单位) Yuqin Cao(* 作者单位) Weixia Zhang(* 作者单位) Wen Wen(* 作者单位) Kaiwei Zhang(* 作者单位) Zijian Chen(* 作者单位) Fangfang Lu(* 作者单位) Xiongkuo Min(* 作者单位) Guangtao Zhai(* 作者单位) Erjia Xiao(* 作者单位) Lingfeng Zhang(* 作者单位) Zhenjie Su(* 作者单位) Hao Cheng(* 作者单位) Yu Liu(* 作者单位) Renjing Xu(* 作者单位) Long Chen(* 作者单位) Xiaoshuai Hao(* 作者单位) Zhenpeng Zeng(* 作者单位) Jianqin Wu(* 作者单位) Xuxu Wang(* 作者单位) Qian Yu(* 作者单位) Bo Hu(* 作者单位) Weiwei Wang(* 作者单位) Pinxin Liu(* 作者单位) Yunlong Tang(* 作者单位) Luchuan Song(* 作者单位) Jinxi He(* 作者单位) Jiaru Wu(* 作者单位) Hanjia Lyu(* 作者单位)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ICCV 2025 VQualA workshop EVQA track

Journal ref ICCV 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21376 2025-09-04 cs.AI cs.CL 62%

AHELM: A Holistic Evaluation of Audio-Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Zijun Wang, Siwei Yang, Yifan Mai, Yuyin Zhou, Cihang Xie, Percy Liang

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克ruz分校) Hitachi America, Ltd.(日立美国有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13314 2025-09-04 cs.SD eess.AS 57%

I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception

Jiawei Zhang, Tian-Hao Zhang, Jun Wang, Jiaran Gao, Xinyuan Qian, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Tencent AI Lab(腾讯AI实验室) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Accepted by APSIPA ASC2025

详情

展开后加载摘要…

URL PDF HTML 收藏