arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 14 篇

2608.15522 2026-08-18 cs.CV 新提交 88%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16285 2026-08-18 cs.CV cs.AI 新提交 88%

Audio-Visual Segmentation via Depth-Guided Collaborative Modeling

基于深度引导协同建模的视听分割

Zhaojin Fu, Yuyang Hong, Qi Yang, Zili Wang, Kun Ding, Shiming Xiang, Bin Fan

机构 * School of Intelligent Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有视听分割方法未建模几何线索的问题,提出三模态框架DGCM-AVS,通过深度感知动态调制器与深度引导渐进融合模块优化,在AVSS数据集上实现M_J、M_F指标的显著提升。

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14812 2026-08-18 eess.AS 新提交 83%

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

先分离,再关联:面向真实场景的视听语音增强的两阶段方法

Tongtao Ling, Zhong-Qiu Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 eess.AS

AI总结 针对真实场景视听语音增强性能下降问题,提出“分离-然后关联”两阶段方法,经挑战赛数据集验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15066 2026-08-18 eess.SP cs.MM eess.IV 新提交 79%

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

ParaJSCC:一种用于可复用多模态联合信源信道编码的参数化框架

Kemi Chen, Mingkai Chen, Youjia Chen, Qian Liu, Wei Gao, Tiesong Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态内容重复访问的效率问题,提出ParaJSCC参数化框架,通过离线生成参数包按需传输,降低延迟与传输速率并保持重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 79%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 79%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 70%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 eess.AS

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 62%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26329 2026-08-18 eess.AS cs.CL cs.LG cs.SD 62%

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

Yi-Cheng Lin, Yu-Hua Chen, Jia-Kai Dong, Yueh-Hsuan Huang, Szu-Chi Chen, Yu-Chen Chen, Chih-Yao Chen, Yu-Jung Lin, Yu-Ling Chen, Zih-Yu Chen, I-Ning Tsai, Hsiu-Hsuan Wang, Ho-Lam Chung, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) University of Toronto(多伦多大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments 5 pages; submitted to ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 15542-15546

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07665 2026-08-18 cs.CL eess.AS 62%

Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models

Yi-Cheng Lin, Wei-Chih Chen, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Journal ref 2024 IEEE Spoken Language Technology Workshop (SLT), Macao, 2024, pp. 871-878

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-18 cs.LG cs.AI cs.ET 版本更新 57%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-08-18 cs.CL 版本更新 57%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15048 2026-08-18 cs.HC 新提交 50%

Beyond Overt Reactions: Analyzing Subtle User Emotional Response to Unexpected In-Vehicle System Behavior

超越显性反应:分析用户对车载系统意外行为的细微情绪响应

Huy Quyen Ngo, Suresh Kumaar Jayaraman, Brian Mok, Ken Friedl, Oliver Krause, Aaron Steinfeld, Nikolas Martelaro

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本研究通过驾驶模拟器收集用户与全自主车辆交互时的多模态数据,分析用户对车载系统意外行为的细微情绪响应,为设计适配乘员行为的车辆提供依据。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15037 2026-08-18 cs.SD cs.LG 新提交 50%

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

严重声学偏移下的原型修正迭代自监督流形去噪

Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Vellore Institute of Technology(韦洛尔理工大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对严重声学噪声下音频-文本基础模型的失效问题,提出无训练无数据源的TTA框架PRISM,在UrbanSound8K数据集上取得显著性能提升,还解决了复音陷阱问题。

Comments Accepted as a full paper at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏