arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46237 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4578 篇

2604.10632 2026-04-14 cs.SD cs.LG cs.MM eess.AS 81%

Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences

多模态数据集规范化与感知验证:音乐-味觉对应关系

Matteo Spanio, Valentina Frezzato, Antonio Rodà

机构 * University of Padova(帕多瓦大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文通过两项实验验证了合成FMA标注中存在听觉调味效果,展示了跨模态结构在不同监督下的保持以及计算目标与人类感知的显著一致性。

Comments Submitted to SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 81%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05007 2026-04-08 cs.SD cs.AI eess.AS 81%

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

通过双耳差异注意力和动作转移预测实现可泛化的音频视觉导航

Jia Li, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出BDATP框架,通过双耳差异注意力增强空间定位并减少对语义类别的依赖,同时引入动作转移预测任务作为正则化项,提升模型在未见环境中的泛化能力,实验表明在Replica和Matterport3D数据集上取得显著性能提升。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02390 2026-04-06 cs.SD cs.AI eess.AS 81%

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

空间感知条件融合用于音视频导航

Shaohang Wu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出空间感知条件融合(SACF),通过离散化目标相对方向和距离,生成紧凑描述符以指导策略和状态建模,利用音频嵌入和空间描述符生成通道级缩放和偏置,调节视觉特征以生成目标导向的融合表示,提升导航效率和泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28757 2026-03-31 cs.CV cs.MM cs.SD 81%

SonoWorld: From One Image to a 3D Audio-Visual Scene

SonoWorld:从一张图像到一个三维音频视觉场景

Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。

Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26840 2026-03-31 eess.AS cs.AI 81%

Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition

双分支图域适应用于跨场景多模态情感识别

Yuntao Shou, Jun Zhou, Tao Meng, Wei Ai, Keqin Li

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出双分支图域适应框架DGDA,解决跨场景多模态情感识别中的域移位和标签噪声问题,通过情感交互图和双分支编码器提升模型泛化能力,实验验证其优于现有方法。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 81%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02768 2026-03-20 eess.AS cs.CL cs.SD 81%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10043 2026-03-12 cs.MM cs.AI cs.SD 81%

AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition

AMB-DSGDN: 适应性模态平衡动态语义图差分网络用于多模态情感识别

Yunsheng Wang, Yuntao Shou, Yilong Tan, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南林业科技大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 AMB-DSGDN通过适应性模态平衡和动态语义图差分机制,提升多模态情感识别的准确性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08034 2026-03-10 cs.CV cs.AI 81%

Solution to the 10th ABAW Expression Recognition Challenge: A Robust Multimodal Framework with Safe Cross-Attention and Modality Dropout

解决第10届ABAW表情识别挑战的方案:一种具有安全交叉注意力和模态dropout的鲁棒多模态框架

Jun Yu, Naixiang Zheng, Guoyuan Wang, Yunxiang Zhang, Lingsi Zhu, Jiaen Liang, Wei Huang, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种鲁棒多模态框架,通过安全交叉注意力和模态dropout处理现实环境中的遮挡和缺失模态问题,提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV 81%

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 81%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08580 2026-03-05 cs.SD cs.AI eess.AS 81%

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

LadderSym: 一种用于音乐练习错误检测的多模态交错Transformer

Benjamin Shiue-Hal Chou, Purvish Jajal, Nick John Eliopoulos, James C. Davis, George K. Thiruvathukal, Kristen Yeon-Ji Yun, Yung-Hsiang Lu

机构 * Purdue University(普渡大学) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 LadderSym通过双流编码器和多模态策略提升音乐练习错误检测的F1分数,显著提高遗漏和额外音符的识别准确率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 81%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05847 2026-02-17 cs.AI cs.CV 81%

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: 通过查询意图和模态注意力强化音频视觉推理

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

机构 * tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 OmniVideo-R1通过查询意图和模态注意力机制,提升多模态推理能力,在多个基准上超越现有基线模型。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13263 2026-02-17 cs.CL cs.SD eess.AS 81%

Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation

多模态一致性引导的参考自由数据选择用于ASR口音适应

Ligong Lei, Wenwen Lu, Xudong Pang, Zaokere Kadeer, Aishan Wumaier

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出一种多模态一致性引导的参考自由数据选择方法,用于提升ASR在口音适应中的性能,通过减少噪声伪标签和优化查询相关性,实现更高效的口音适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09637 2026-02-11 cs.CV cs.MM 81%

Towards Training-free Multimodal Hate Localisation with Large Language Models

无需训练的多模态仇恨定位与大型语言模型

Yueming Sun, Long Yang, Jianbo Jiao, Zeyu Fu

机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) The MIx Group University of Birmingham(伯明翰大学MIx集团)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01284 2026-02-03 cs.MM cs.CV cs.HC 81%

Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection

看见、听见与认知:深度伪造视频检测中的多模态策略

Chen Chen, Dion Hoe-Lian Goh

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 研究探讨了多模态策略在深度伪造视频检测中的应用,通过分析人类识别过程中的线索组合,提出了提升媒体素养的指导方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13576 2026-01-30 eess.AS cs.AI cs.SD eess.IV 81%

End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments

端到端音频视觉学习用于在噪声环境中的人工耳蜗声音编码模拟

Meng-Ping Lin, Enoch Hsin-Ho Huang, Shao-Yi Chien, Yu Tsao

机构 * Graduate Institute of Electronics Engineering(电子工程研究所) the Department of Electrical Engineering, National Taiwan University, Taipei 106319, Taiwan(国立台湾大学电子工程系) Research Center for Information Technology Innovation Technology, Academia Sinica, Taipei 115201, Taiwan(中科院资讯科技创新研究中心) Department of Electrical Engineering, Chung Yuan Christian University, Taoyuan 320314, Taiwan(Chung Yuan Christian University 电子工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出了一种端到端的人工耳蜗声音编码系统,通过整合音频视觉信息提升噪声环境中的语音可懂度和信噪比。

Comments 7 pages, 2 figures

Journal ref JASA Express Lett. 6 (2026) 015202

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 81%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS 81%

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 81%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、eess.AS

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14651 2026-01-22 cs.CV cs.MM cs.SD 81%

READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection

READ-Net:通过自适应特征重校准澄清情绪歧义以实现音频-视觉抑郁症检测

Chenglizhao Chen, Boze Li, Mengke Song, Dehao Feng, Xinyu Liu, Shanchen Pang, Jufeng Yang, Hui Yu

机构 * College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) College of Computer Science, Nankai University(南开大学计算机科学学院) School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 READ-Net通过自适应特征重校准解决音频-视觉抑郁症检测中的情绪歧义问题,提升检测准确率与F1分数。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 81%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05436 2026-01-06 cs.SD cs.MM eess.AS 81%

pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing

pyAMPACT:一种用于表演数据估计和多模态处理的评分-音频对齐工具包

Johanna Devaney, Daniel McKemie, Alex Morgan

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 pyAMPACT是一种用于表演数据估计和多模态处理的工具,通过符号与音频的对齐实现性能数据的估计及多模态分析

Comments Proceedings of the 2025 International Computer Music Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26569 2025-12-18 cs.CV cs.IR cs.MM 81%

AdSum: Two-stream Audio-visual Summarization for Automated Video Advertisement Clipping

AdSum:用于自动化视频广告剪辑的双流音频视觉摘要

Wen Xie, Yanjun Zhu, Gijs Overgoor, Yakov Bart, Agata Lapedriza Garcia, Sarah Ostadabbas

机构 * Northeastern University(东北大学) Southern Methodist University(南方 Methodist 大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 AdSum提出了一种双流音频视觉融合模型,用于自动化视频广告剪辑,通过重要性预测提升广告剪辑效率。

Comments Accepted at 32nd International Conference on MultiMedia Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12875 2025-12-16 cs.CV cs.MM cs.SD 81%

Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal

Schrodinger Audio-Visual Editor: 对象级音频视觉去除

Weihan Xu, Kan Jen Cheng, Koichi Saito, Muhammad Jehanzeb Mirza, Tingle Li, Yisi Liu, Alexander H. Liu, Liming Wang, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, Gopala Anumanchipalli, Paul Pu Liang

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Schrodinger Audio-Visual Editor,通过联合编辑音频和视频实现对象级去除,提升时间同步性和语义对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10778 2025-12-12 cs.SD cs.MM eess.AS 81%

Building Audio-Visual Digital Twins with Smartphones

利用智能手机构建音频-视觉数字孪生

Zitong Lan, Yiwei Tang, Yuhan Wang, Haowen Lai, Yiduo Hao, Mingmin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 AV-Twin通过智能手机实现可编辑的音频-视觉数字孪生,结合移动RIR捕获和视觉辅助声场模型,实现房间声学的高效重建与材料属性的动态更新。

Comments Under Mobisys 2026 review, single blind

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06689 2025-12-09 cs.CV eess.AS 81%

Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation

轻量级瓦瑟斯坦音频视觉模型用于统一的语音增强与分离

Jisoo Park, Seonghak Lee, Guisik Kim, Taewoo Kim, Junseok Kwon

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 UniVoiceLite通过轻量级无监督音频-视觉框架,统一语音增强与分离,利用嘴唇运动和面部身份线索,并采用瓦瑟斯坦距离正则化提升鲁棒性。

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02973 2025-12-03 cs.CV cs.CL cs.CR 81%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏