arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-14 至 2025-11-14 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2511.10059 2025-11-14 cs.CV 85%

When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?

Qilang Ye, Wei Zeng, Meng Liu, Jie Zhang, Yupeng Hu, Zitong Yu, Yu Zhou

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10325 2025-11-14 cs.MM 79%

TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities

Yan Zhuang, Minhao Liu, Yanru Zhang, Jiawen Deng, Fuji Ren

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05735 2025-11-14 cs.AI 79%

A Comprehensive Survey on Multi-modal Conversational Emotion Recognition with Deep Learning

Yuntao Shou, Tao Meng, Wei Ai, Fangze Fu, Nan Yin, Keqin Li

机构 * Central South University of Forestry and Technology(中部林业科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State University of New York(纽约州立大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

Comments 36 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09989 2025-11-14 cs.LG 78%

Towards Robust Multimodal Learning in the Open World

Fushuo Huo

机构 * Department of Computing(计算系)

专题命中 音频语音多模态 :multimodal(title,abstract)

Comments Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09958 2025-11-14 cs.RO cs.SD 67%

Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation

Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) School of Software Engineering, East China Normal University(东华师范大学软件工程学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08132 2025-11-14 cs.AI 57%

National Institute on Aging PREPARE Challenge: Early Detection of Cognitive Impairment Using Speech -- The SpeechCARE Solution

Maryam Zolnoori, Hossein Azadmaleki, Yasaman Haghbin, Ali Zolnour, Mohammad Javad Momeni Nezhad, Sina Rashidi, Mehdi Naserian, Elyas Esmaeili, Sepehr Karimi Arpanahi

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08670 2025-11-14 cs.HC cs.AI 57%

Once Upon an AI: Six Scaffolds for Child-AI Interaction Design, Inspired by Disney

Nomisha Kurian

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏