arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 22 篇

2608.30726 2026-09-01 cs.AI 新提交 87%

Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis

面向情感分析的、结合文本路由与序数原型优化的多模态自适应专家选择方法

Xiaode Chen, Jiakang Yu, Hongtao Deng, Huina Qu, Xun Zhu, Yinxia Lou

机构 * Jianghan University(江汉大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析的静态计算图与忽略情感序数层级的问题,提出MAESTRO框架,通过文本引导的MoE机制与O-PCL实现动态多模态表征,在CMU-MOSI等基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-09-01 cs.CL cs.LG 版本更新 85%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07593 2026-09-01 cs.CV 版本更新 83%

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29239 2026-09-01 cs.CL cs.SD eess.AS 新提交 81%

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

用语义锚定语音:一种针对低资源语言自动语音识别的多模态适配器机制

Kuan-Tang Huang, Cheng-Yeh Yang, Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen

机构 * National Taiwan Normal University(台湾师范大学) EZAI Academia Sinica(中央研究院)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源语言ASR的监督证据不足问题,提出轻量级多模态适配器机制SAMA-ASR,结合语义与声学锚,在台湾闽南语和客家话数据集上优于多种基线,且紧凑ST模型可生成有效语义锚。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交 80%

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30270 2026-09-01 cs.CL 新提交 79%

Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

读懂房间,读懂图像:理解多模态视觉语境中的间接言语行为

Jaehee Kim, Ji Hoon Chung, Seoyoon Park, Unsol Kim, Kyungwon Park, Ji Hak Kim, Yi-Jun Chen, Hansaem Kim

机构 * Yonsei University(延世大学) LG AI Research(LG人工智能研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究推出多模态基准READI,以视觉语用问答任务评估间接言语行为理解,发现先进多模态模型在视觉接地间接言语行为上表现差,性能随间接性提升而下降,凸显相关基准的必要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交 79%

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29121 2026-09-01 cs.CV 新提交 79%

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

基于声学接地代价学习的开放词汇视听语义分割

Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Cardiff University(卡迪夫大学) University of Macau(澳门大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 针对开放词汇视听语义分割的现有方法缺陷,提出AGCL框架及AMCG、AGTA、SDM模块,在AVSBench-OV数据集上显著优于现有SOTA方法,尤其在未见类别上表现突出。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交 78%

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30013 2026-09-01 cs.HC 新提交 71%

Multimodal Takeover Requests for Drivers with Hearing Loss: Implications for AI-Enabled Communication in Automated Vehicles

针对听力障碍驾驶员的多模态接管请求:自动驾驶汽车中AI驱动通信的启示

Aries Chu, Wei-Hsiang Lo, Gaojian Huang

专题命中 音频语音多模态 :multimodal(title)

AI总结 该研究针对听力障碍驾驶员,通过驾驶模拟器实验发现视觉-触觉接管显示可缩短反应与接管时间,AI驱动汽车可据此调整接管消息内容以适配不同需求。

Comments 10 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交 70%

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交 70%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交 67%

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30260 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

Using Prosody to Predict Syntactic Structure

用韵律预测句法结构

Junghyun Min, Alex Warstadt, Tamar I. Regev, Tiago Pimentel, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究从信息论视角提出通用框架,利用多模态语言模型量化韵律与句法的互信息,发现韵律可降低自然对话中10.2%的句法不确定性,为相关理论提供实证支持。

Comments 15 pages, 4 figures. EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28875 2026-09-01 cs.CL cs.AI cs.SD 新提交 62%

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

提示词层面上下文未检测到侧边级词错误率(WER)变化:对生产级口述历史语料库的预注册消融实验

Theodore O. Cochran, Stephanie Dodson, Keith Nore

机构 * AI for Altruism(利他智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该预注册实验在生产级口述历史转录工具上发现,提示词层面上下文未改变侧边级WER,仅短语有小幅改善,需结合序列对齐指标评估上下文机制。

Comments 31 pages, 1 figure. Preregistered on OSF (https://osf.io/ns49b, DOI 10.17605/OSF.IO/NS49B); release materials and dated provider-documentation snapshots in the study component (https://osf.io/9nsvr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-09-01 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Accepted to Findings of EMNLP 2026, page 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28966 2026-09-01 eess.AS 新提交 57%

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

当语调与字面意义不一致时:面向大型音频语言模型的声学-语义不一致研究

Yu-Wen Chen, William Ho, Maxim Topaz, Zoran Kostic, Julia Hirschberg

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究针对LALMs在语调与字面意义不一致场景下的表现问题,构建CREMA-ASIS数据集,经实验发现其受语义主导且难识别不一致,监督式微调可显著提升其性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30622 2026-09-01 cs.SD eess.AS 新提交 57%

Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

面向通用型大语言模型的深度伪造语音检测的文本声学接地

Yassine El Kheir, Xin Wang, Wanqing Ge, Tim Polzehl, Sebastian Moeller, Junichi Yamagishi

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) National Institute of Informatics(情报信息学研究所) Technical University of Berlin(柏林工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 该研究针对深度伪造语音检测的域泛化问题,提出跨模态提示策略,将openSMILE提取的声学特征作为文本标记注入冻结Qwen LLM,在ITW、MLAAD基准上获16.2%宏观F1绝对提升,性能最优。

Comments 6pages + 1ref, SLT Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30068 2026-09-01 cs.CV 新提交 57%

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

TAKE 85:基于85小时电影时长的电影创作者意图测试基准

Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant, Xi Wang, Dimitris Samaras, Vicky Kalogeiton

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) New York University(纽约大学) Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) Stony Brook University(石溪大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-09-01 eess.AS 版本更新 57%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments INTERSPEECH 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00571 2026-09-01 cs.SD eess.AS 版本更新 57%

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview

从音频深度伪造检测到AI生成音乐检测——路径与综述

Yupei Li, Manuel Milling, Lucia Specia, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文系统综述AI生成音乐(AIGM)检测方法,建立四级分类体系,结合音频深度伪造检测开展分层可迁移性分析,从多维度分类代表性方法并提出未来研究方向。

Comments Accepted at Computational Intelligence Magazine (CIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2026-09-01 cs.MM 版本更新 57%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

基于身份驱动的参考辅助多媒体伪造检测

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 针对现有媒体伪造数据集的局限,提出含54位名人视频的IDForge数据集,设计参考辅助多模态伪造检测网络R-MFDN,实验验证其在多媒体伪造检测任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏