arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

1603.08321 2016-03-29 cs.CV cs.CL cs.LG 62%

Audio Visual Emotion Recognition with Temporal Alignment and Perception Attention

Linlin Chao, Jianhua Tao, Minghao Yang, Ya Li, Zhengqi Wen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.01209 2015-07-07 cs.CV cs.MM 62%

TV News Commercials Detection using Success based Locally Weighted Kernel Combination

Raghvendra Kannao, Prithwijit Guha

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1407.1165 2014-07-07 cs.CV cs.CL 62%

Recognition of Isolated Words using Zernike and MFCC features for Audio Visual Speech Recognition

Prashant Bordea, Amarsinh Varpeb, Ramesh Manzac, Pravin Yannawara

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19527 2026-08-21 cs.HC cs.CL cs.SD 新提交 61%

Does Listening Matter? Backchanneling and Nodding in AI Clone

倾听重要吗?AI克隆中的反馈式回应与点头动作

Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara

机构 * Kyoto University(京都大学) Sony Computer Science Laboratories(索尼计算机科学实验室)

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL

AI总结 本研究将口头反馈式回应与头部点头整合到配备语音克隆及LLM响应的AI克隆中,经35人被试内研究证实,添加互动倾听行为可提升AI克隆的感知专注度、真实感与共同在场感,其保真度需涵盖倾听行为。

Comments This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18080 2026-08-20 cs.AI 新提交 61%

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述

Yisong Chen, Yifan Gao, Sijing Yu, Chuqing Zhao, Yang Lu

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI

AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。

Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations

Journal ref Journal of Industrial Integration and Management (JIIM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11837 2025-10-15 cs.CR cs.AI 61%

Countermind: A Multi-Layered Security Architecture for Large Language Models

Dominik Schwarz

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI

Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04736 2025-09-08 cs.CV 61%

WatchHAR: Real-time On-device Human Activity Recognition System for Smartwatches

Taeyoung Yeon, Vasco Xu, Henry Hoffmann, Karan Ahuja

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学)

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV

Comments 8 pages, 4 figures, ICMI '25 (27th International Conference on Multimodal Interaction), October 13-17, 2025, Canberra, ACT, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10642 2025-04-16 cs.CV 61%

SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging

Tan-Hanh Pham, Chris Ngo, Trong-Duong Bui, Minh Luu Quang, Tan-Huong Pham, Truong-Son Hy

机构 * Florida Institute of Technology(佛罗里达理工学院) Knovel Engineering Lab(诺维尔工程实验室) Vietnam Military Medical University(越南军事医科大学) Military Central Hospital(108陆军中央医院) Can Tho University of Medicine and Pharmacy(芹苴医药大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV

Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13912 2020-12-29 cs.CV 61%

Exploring Emotion Features and Fusion Strategies for Audio-Video Emotion Recognition

Hengshun Zhou, Debin Meng, Yuanyuan Zhang, Xiaojiang Peng, Jun Du, Kai Wang, Yu Qiao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV;multimodal(comments)

Comments Accepted by ACM ICMI'19 (2019 International Conference on Multimodal Interaction)

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.01076 2016-07-06 cs.HC cs.CV 61%

Aggressive actions and anger detection from multiple modalities using Kinect

Amol Patwardhan, Gerald Knapp

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CV

Comments 11 pages, 2 figures, 5 tables, in peer review with ACM TIST, Key words: Aggression, multimodal anger recognition, Kinect

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0211005 2009-11-30 cs.CV cs.HC 61%

Prosody Based Co-analysis for Continuous Recognition of Coverbal Gestures

Sanshzar Kettebekov, Mohammed Yeasin, Rajeev Sharma

专题命中 音频语音多模态 :multimodal(abstract,journal_ref);分类 cs.CV

Comments Alternative see: http://vision.cse.psu.edu/kettebek/academ/publications.htm

Journal ref S. Kettebekov, M. Yeasin, and R. Sharma, "Prosody Based Co-analysis for Continuous Recognition of Coverbal Gestures," presented at International Conference on Multimodal Interfaces (ICMI'02), Pittsburgh, USA, 2002

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 57%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :omni-modal(abstract);分类 eess.AS

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26153 2026-08-28 cs.AI 新提交 57%

EEG-to-Report: An Annotation and Feature-Text Framework for Training Language Models on Clinical EEG

EEG-to-Report:用于在临床脑电图上训练语言模型的标注与特征-文本框架

Xuan-The Tran, Le Trung Kien Nguyen

机构 * Vietnam Maritime University(越南海事大学) HAISmartlink Lab(HAISmartlink实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对临床EEG报告依赖人工、现有工具无法满足AI训练需求的问题,提出EEG-to-Report框架,整合多格式EEG处理与标注,生成对齐特征-文本对,还含自动报告模块,为自动化EEG报告系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24909 2026-08-27 cs.HC cs.CV cs.SD 新提交 57%

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

超级明星:面向数字人的流式实时交互智能体

Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) LIGHTSPEED(腾讯光速工作室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。

Comments Accepted by ACM Multimedia 2026. Project Page: \url{https://super-star-2026.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24579 2026-08-26 eess.AS 新提交 57%

Visually-Guided Spatial Audio Generation for $360^\circ$ In-the-Wild Speech Scenes

面向野外360°语音场景的视觉引导空间音频生成

Qingyu Luo, Peng Zhang, Wenwu Wang, Philip J. B. Jackson

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24707 2026-08-26 cs.CL 新提交 57%

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

迷失在语音中:跨音频与文本的三语语音幻觉检测

Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun, Dongwon Lee

机构 * Satbayev University(萨塔巴耶夫大学) University of Colorado Boulder(科罗拉多大学博尔德分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22907 2026-08-25 eess.AS 新提交 57%

Unsupervised Speech Recognition at the Syllable Level

音节级别的无监督语音识别

Liming Wang, Kai-Wei Chang, Kunio Kashino, David Harwath, Mark Hasegawa-Johnson, James R. Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 该研究针对现有无监督语音识别方法依赖G2P且训练不稳定的问题,提出基于掩码语言建模的音节级UASR框架,在LibriSpeech上使CER相对降低40%,并有效推广到低资源语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22796 2026-08-25 eess.AS cs.SD 新提交 57%

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型

Bingshen Mu, Xian Shi, Xiong Wang, Zhifang Guo, Ting He, Xize Cheng, Yu Xi, Jin Xu, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交 57%

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20433 2026-08-24 cs.RO cs.HC cs.MM cs.SD 新提交 57%

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

类人音乐机器人作为音乐诱发情绪研究的实验接口

Vincent K. M. Cheung, Jia-Yeu Lin

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Waseda University(早稻田大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。

Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交 57%

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17812 2026-08-19 cs.MM 新提交 57%

On computational approaches to Pop music culture

流行音乐文化的计算研究方法

Arthur Flexer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

AI总结 该文提出流行音乐文化的计算研究需采用多模态方法,综述相关量化研究并指出其存在的多模态方法匮乏等问题,勾勒出绘制歌词主题图谱等三个未来研究方向。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06505 2026-08-19 cs.CL 版本更新 57%

Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning

在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐

Yuchen Zhang, Haralambos Mouratidis, Ravi Shekhar

机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-18 cs.LG cs.AI cs.ET 版本更新 57%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-08-18 cs.CL 版本更新 57%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 57%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00982 2026-08-17 eess.AS 57%

VisG AV-HuBERT: Viseme-Guided AV-HuBERT

VisG AV-HuBERT:基于视觉发音的AV-HuBERT

Aristeidis Papadopoulos, Rishabh Jain, Naomi Harte

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出VisG AV-HuBERT,通过引入辅助的发音分类任务,强化模型对视觉发音特征的依赖,提升在噪声环境下的语音识别性能。

Comments Includes Supplementary Material. Accepted for Publication at International Conference on Pattern Recognition 2026 - ICPR 2026. Code is available at https://github.com/aristosp/visg_avhubert

Journal ref A. Papadopoulos, R. Jain, N. Harte, VisG AV-HuBERT: Viseme-Guided AV-HuBERT, in Pattern Recognition. ICPR 2026, Lecture Notes in Computer Science, vol. 16812, pp. 667-682, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏