arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-22 至 2026-01-22 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2601.14259 2026-01-22 cs.CV cs.AI cs.HC cs.LG cs.SD eess.AS 85%

A Cloud-Based Cross-Modal Transformer for Emotion Recognition and Adaptive Human-Computer Interaction

基于云的跨模态Transformer用于情绪识别和自适应人机交互

Ziwen Zhong, Zhitao Shu, Yue Zhao

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 本文提出基于云的跨模态Transformer框架,通过整合多模态信号提升情绪识别的鲁棒性和泛化能力,实现高效、实时的自适应人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15278 2026-01-22 cs.MM 83%

Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok

在短视频中大规模解读多模态交流:TikTok上的视觉、音频和文本心理健康 discourse

Mingyue Zha, Ho-Chun Herbert Chang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本研究提出了一种结合自动多模态特征提取与Shapley值的框架,分析TikTok上关于社交焦虑障碍的视频中视觉、音频和文本如何共同影响观众参与度,揭示了跨模态协同效应的阈值依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14651 2026-01-22 cs.CV cs.MM cs.SD 81%

READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection

READ-Net:通过自适应特征重校准澄清情绪歧义以实现音频-视觉抑郁症检测

Chenglizhao Chen, Boze Li, Mengke Song, Dehao Feng, Xinyu Liu, Shanchen Pang, Jufeng Yang, Hui Yu

机构 * College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) College of Computer Science, Nankai University(南开大学计算机科学学院) School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 READ-Net通过自适应特征重校准解决音频-视觉抑郁症检测中的情绪歧义问题,提升检测准确率与F1分数。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14620 2026-01-22 eess.AS cs.AI cs.LG cs.SD 62%

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

缩放歧义:通过音频-语言模型增强语音情感识别中的人工标注

Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang

机构 * University of Melbourne(墨尔本大学) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文通过音频-语言模型生成合成标注,提升语音情感识别中模糊情感的真实分布可靠性,实验表明合成标注在低歧义区域效果显著,但高歧义情况需进一步优化。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12534 2026-01-22 cs.CV cs.AI 62%

Encoding Emotion Through Self-Supervised Eye Movement Reconstruction

通过自监督眼动重建编码情感

Marcus Ma, Jordan Prescott, Emily Zhou, Tiantian Feng, Kleanthis Avramidis, Gabor Mihaly Toth, Shrikanth Narayanan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种自监督眼动重建模型,用于从自然主义低分辨率视频中预测情绪表达的多模态标记,通过微调两个下游任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08422 2026-01-22 cs.RO 50%

Teaching Robots Like Dogs: Learning Agile Navigation from Luring, Gesture, and Speech

教机器人像教狗一样:从诱饵、手势和言语中学习敏捷导航

Taerim Yoon, Dongho Kang, Jin Cheng, Fatemeh Zargarbashi, Yijiang Huang, Minsung Ahn, Stelian Coros, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出了一种人机协同框架,通过手势、言语和诱饵等多模态输入,使机器人高效学习敏捷导航,实验显示在少于1小时的数据下任务成功率高达97.15%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏