arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-12 至 2025-12-12 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 85%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10778 2025-12-12 cs.SD cs.MM eess.AS 81%

Building Audio-Visual Digital Twins with Smartphones

利用智能手机构建音频-视觉数字孪生

Zitong Lan, Yiwei Tang, Yuhan Wang, Haowen Lai, Yiduo Hao, Mingmin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 AV-Twin通过智能手机实现可编辑的音频-视觉数字孪生,结合移动RIR捕获和视觉辅助声场模型,实现房间声学的高效重建与材料属性的动态更新。

Comments Under Mobisys 2026 review, single blind

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21429 2025-12-12 cs.LG 78%

Deception Detection in Dyadic Exchanges Using Multimodal Machine Learning: A Study on a Swedish Cohort

利用多模态机器学习检测双人交流中的欺骗:一项针对瑞典群体的研究

Thomas Jack Samuels, Franco Rugolon, Stephan Hau, Lennart Högman

机构 * Department of Psychology(心理学系) Department of Computer and Systems Sciences(计算机与系统科学系) Stockholm University(斯德哥尔摩大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本研究利用多模态机器学习分析双人互动中的欺骗检测,发现结合语音和面部信息及双方数据可提高检测准确率至71%。

Comments 40 pages, 2 figures, 2 tables. To be submitted in Behavior Research Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18708 2025-12-12 cs.CL 57%

The Spatial Semantics of Iconic Gesture

图标手势的空间语义

Andy Lücking, Alexander Henlein, Alexander Mehler

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种空间手势语义学,通过区分图标性三个层面,探讨手势与言语意义的结合方式。

Comments 52 pages, 38 figures, in review

详情

展开后加载摘要…

URL PDF HTML 收藏