arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2601.08133 2026-03-03 cs.CV cs.AI 84%

How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?

光学流和文本提示如何协作以辅助音频视觉语义分割?

Yujian Lee, Peng Gao, Yongqi Xu, Wentao Fan

机构 * Hong Kong Baptist University(香港 Baptist 大学) Guangdong Provincial/Zhuhai Key Laboratory IRADS(广东省级/珠海关键实验室 IRADS) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist 大学,珠海,中国) Peking University, Shenzhen Graduate School, Shenzhen, China(北京大学,深圳研究生院,深圳,中国)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SSP通过整合光学流和文本提示,提升音频视觉语义分割的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04326 2026-03-03 cs.CV cs.AI 84%

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

WorldSense: 评估多模态大语言模型的现实世界多模态理解

Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22961 2026-03-03 eess.AS 83%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 eess.AS

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02072 2026-03-03 cs.HC cs.AI 79%

Cognitive Prosthetic: An AI-Enabled Multimodal System for Episodic Recall in Knowledge Work

认知假体:一种基于AI的多模态系统,用于知识工作中的事件回忆

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

机构 * Old Dominion University(老奥 Dominion 大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多模态系统CPMS,通过结构化事件捕获和自然语言检索,支持知识工作中的事件回忆,同时保障隐私安全。

Comments CHI EA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01431 2026-03-03 cs.CV 79%

SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation

SeaVIS: 声音增强的在线音频视觉实例分割

Yingjian Zhu, Ying Wang, Yuyang Hong, Ruohao Guo, Kun Ding, Xin Gu, Bin Fan, Shiming Xiang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 SeaVIS通过引入因果交叉注意力融合模块和音频引导对比学习策略,实现了高效的在线音频视觉实例分割,提升了声音跟随能力并保持了实时处理性能。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07367 2026-03-03 cs.SD 79%

FOCAL: A Novel Benchmarking Technique for Multi-modal Agents

FOCAL:多模态代理的新型基准测试技术

Anupam Purwar, Aditya Choudhary

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。

Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22286 2026-03-03 cs.LG cs.IT math.IT 78%

OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

OmniZip: 一种用于多模态数据的统一且轻量级无损压缩器

Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Dajiang Zhou, Qunshan Gu, Qi Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 OmniZip是一种用于多模态数据的统一且轻量级无损压缩器,通过三种关键组件实现高效压缩,并在多个数据集上实现了更高的压缩效率。

Comments 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01415 2026-03-03 eess.AS 70%

The USTC-NERCSLIP Systems for the CHiME-9 MCoRec Challenge

USTC-NERCSLIP系统参加CHiME-9 MCoRec挑战

Ya Jiang, Ruoyu Wang, Jingxuan Zhang, Jun Du, Yi Han, Zihao Quan, Hang Chen, Yeran Yang, Kongzhi Zheng, Zhuo Chen, Yanhui Tu, Shutong Niu, Changfeng Xi, Mengzhi Wang, Zhongbin Wu, Jieru Chen, Henghui Zhi, Weiyi Shi, Shuhang Wu, Genshun Wan, Jia Pan, Jianqing Gao

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 USTC-NERCSLIP系统通过多模态级联方法和LLM技术,在CHiME-9 MCoRec挑战中实现15.70%的联合ASR-聚类错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04134 2026-03-03 cs.CV cs.SD eess.AS 62%

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架

Jinting Wang, Shan Yang, Chenxing Li, Dong Yu, Li Liu

机构 * HKUST-GZ(香港科技大学-珠海校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。

Comments 13 pages, 12 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 62%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏