arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 88%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、cs.AI、cs.MM

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06689 2025-12-09 cs.CV eess.AS 81%

Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation

轻量级瓦瑟斯坦音频视觉模型用于统一的语音增强与分离

Jisoo Park, Seonghak Lee, Guisik Kim, Taewoo Kim, Junseok Kwon

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 UniVoiceLite通过轻量级无监督音频-视觉框架,统一语音增强与分离,利用嘴唇运动和面部身份线索,并采用瓦瑟斯坦距离正则化提升鲁棒性。

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06485 2025-12-09 cs.CV 79%

Sanvaad: A Multimodal Accessibility Framework for ISL Recognition and Voice-Based Interaction

Sanvaad: 一种多模态可访问性框架,用于手语识别和基于语音的交互

Kush Revankar, Shreyas Deshpande, Araham Sayeed, Ansh Tandale, Sarika Bobde

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Sanvaad是一种多模态可访问性框架,通过结合轻量级计算机视觉和语音处理工具,为聋人和视障用户提供实时双向沟通解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 79%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06106 2025-12-09 cs.HC cs.AI 74%

Future You: Designing and Evaluating Multimodal AI-generated Digital Twins for Strengthening Future Self-Continuity

未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性

Constanze Albrecht, Chayapatr Archiwaranguprok, Rachel Poonsiriwong, Awu Chen, Peggy Yin, Monchai Lertsutthiwong, Kavin Winson, Hal Hershfield, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Harvard University(哈佛大学) Stanford University(斯坦福大学) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI 57%

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏