arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-08 至 2025-10-08 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2510.06060 2025-10-08 cs.MM cs.AI cs.CV 82%

Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information

Christian Marinoni, Riccardo Fosco Gramaccioni, Eleonora Grassucci, Danilo Comminiello

机构 * Sapienza University of Rome, Italy(罗马大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05417 2025-10-08 cs.HC cs.AI 79%

Exploring Student Choice and the Use of Multimodal Generative AI in Programming Learning

Xinying Hou, Ruiwei Xiao, Runlong Ye, Michael Liut, John Stamper

机构 * University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Toronto Mississauga(多伦多大学滑铁卢分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments 7 pages, accepted to SIGCSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05249 2025-10-08 cs.HC 50%

CLAd-VR: Cognitive Load-based Adaptive Training for Machining Tasks in Virtual Reality

Bhavya Matam, Adamay Mann, Kachina Studer, Christian Gabbianelli, Sonia Castelo, John Liu, Claudio Silva, Dishita Turakhia

专题命中 音频语音多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏