arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2606.16351 2026-06-16 cs.CL 新提交 57%

TMASC: Transmasculine Attitude and Speech Corpus

TMASC:跨男性态度与语音语料库

Sidney Wong

机构 * Centre for Sustainability Research, University of Otago(奥塔哥大学可持续发展研究中心) Te Pūnaha Matatini Centre of Research Excellence for Complex Systems(Te Pūnaha Matatini复杂系统卓越研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 介绍一个包含196名跨男性个体的多模态语料库,包括问卷和66份录音,用于支持跨男性个体研究。

Comments Accepted to Interspeech 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 57%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07015 2026-06-16 cs.SD cs.AI 新提交 57%

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

面向统一歌曲生成与带伴奏共生成的歌声转换

Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang, Yuxin Guo, Kang Yin, Wenjie Tian, Jingbin Hu, Tianlun Zuo, Zhao Guo, Teng Ma, Yuzhe Liang, Chen Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14321 2026-06-15 cs.SD cs.MM 新提交 57%

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

MaskedFOP:缺失视觉模态下的多语言说话人识别通过级联图标签传播

Ayoub Elkhouzari, Youssef Iraqi, Loubna Mekouar

机构 * College of Computing, University Mohammed VI Polytechnic(穆罕默德六世理工大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出MaskedFOP系统,在测试时人脸完全缺失且语音为未见语言(乌尔都语)的挑战下,通过模态丢弃双头网络、互补嵌入平均和两级级联推理实现闭集多语言说话人识别,在POLY-SIM 2026挑战赛中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11875 2026-06-11 cs.CL cs.SD 新提交 57%

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

我理解你的感受:通过对话系统中的多语言情感验证增强深层情感支持

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 提出情感验证在对话系统中的应用,构建多语言语料库M-EDESConv和测试集M-TESC,设计多语言情感感知门控单元MEGUMI进行时机检测,并评估当前LLM在情感验证响应生成中的表现。

Comments This paper has been accepted for presentation at SIGdial Meeting on Discourse and Dialogue 2026 (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新 57%

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08748 2026-06-09 cs.CL 新提交 57%

HydraQE: OSU's Submission for the IWSLT 2026 Speech Translation Metrics Shared Task

HydraQE: OSU 在 IWSLT 2026 语音翻译指标共享任务中的提交

Kevin Krahn, Eric Fosler-Lussier

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 提出 HydraQE,一个基于 Qwen3-ASR 的端到端无参考语音翻译质量估计系统,通过可学习的稀疏标量混合和轻量双向 Transformer 实现跨模态交互,并在人类标注、MetricX-24 和 xCOMET 伪标签上训练三个预测头,优于级联文本基线。

Comments Accepted to IWSLT 2026; 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08486 2026-06-09 cs.CL 新提交 57%

TRADE: Transducer-Augmented Decoder for Speech LLM

TRADE: 换能器增强的语音大语言模型解码器

Yun Tang, Shanil Puri, Shinji Watanabe, Subhabrata Mukherjee

机构 * Hippocratic AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-06-08 eess.AS 新提交 57%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06047 2026-06-05 cs.CL 57%

Automatic Labelling of Speech Translation Errors

语音翻译错误的自动标注

Dominik Macháček, Maike Züfle, Ondrej Klejch

机构 * Charles University(查尔斯大学) University of Edinburgh(爱丁堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对语音翻译缺乏置信度评估方法的问题,提出STEL标注协议,通过文本和多模态系统分析,发现直接语音处理对任务必要且与文本系统互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04106 2026-06-04 cs.LG cs.AI 57%

Building The Ph(ysical)AI Layer Of Machine Intelligence

构建机器智能的物理AI层

Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。

Comments 102 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03874 2026-06-03 cs.CV cs.RO 57%

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction

DyaPlex: 用于二元交互的全双工语音-运动模型

Koki Nagano, Hongyu Liu, Seonwook Park, Tianye Li, Amrita Mazumdar, Christian Jacobsen, Shengze Wang, Michael Stengel, Rajarshi Roy, Ka Chun Cheung, Simon See, Shalini De Mello

机构 * NVIDIA HKUST(香港科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出DyaPlex,一种流式全双工语音-运动模型,通过双塔Transformer架构和统一二元令牌交织机制,实现同步多模态交互,在单体和二元交互基准上达到最优性能。

Comments Project page: https://research.nvidia.com/labs/amri/projects/DyaPlex

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03614 2026-06-03 cs.MM 57%

OmniHalluc-L: Counterfactual Benchmarking and Modality-Perturbation Reliability Calibration for Long-Form Omni Hallucination

OmniHalluc-L:长形式全模态幻觉的反事实基准测试与模态扰动可靠性校准

Zixuan Dong, Jiafu Tang, Zhide Lei, Zhe Cao, Zijie Zhang, Yanghai Wang, Shihao Li, Xiaodong Wang, Baoyun Peng, Jiaheng Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 针对长视频全模态助手将真实证据错误绑定到错误说话者、时刻或模态的“几乎正确”错误,提出反事实事件绑定协议构建配对支持/反事实声明,并基于此构建基准OmniHalluc-L,同时提出模态扰动可靠性校准方法(Modality-Perturbation Reliability Calibration)在不更新主干网络的情况下提升模型性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16808 2026-06-03 cs.CV 57%

BioLip: Language-Generalizable Lip-Sync Deepfake Detection via Biomechanical Constraint Violation Modeling

BioLip: 通过生物力学约束违反建模实现语言泛化的唇同步深度伪造检测

Hao Chen, Junnan Xu

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 针对现有检测方法在生成器或语言迁移下失效的问题,提出基于唇部运动生物力学约束的轻量级三分支网络,仅利用地标坐标检测唇同步伪造,在零样本设置下对未见生成器和多种语言表现鲁棒。

Comments 13 pages, 5 figures. Keywords: Deepfake detection, lip-sync forgery, biomechanical constraints, landmark kinematics, cross-lingual generalization, video forensics, privacy-preserving inference, compression robustness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01704 2026-06-02 eess.AS 57%

Kinship Verification Using Voice

使用语音进行亲属关系验证

Jagabandhu Mishra, Tomi H. Kinnunen

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究通过提出新的评估协议和多种神经网络说话人嵌入提取器,建立了语音亲属关系验证的基础,并揭示了说话人验证与亲属关系验证之间的密切联系。

Comments Submited to IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01264 2026-06-02 q-bio.NC cs.HC cs.SD eess.AS eess.SP 57%

A 1000-hour EEG-EMG-audio dataset of Japanese speech production

1000小时日语语音产生的EEG-EMG-音频数据集

Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama, Yuya Kita, Atsushi Yamamoto, Ippei Fujisawa, Shuntaro Sasai

机构 * National Institute of Information and Communications Technology, Japan(日本信息与通信技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究构建了一个包含1020小时同步头皮脑电图、面部肌电图和语音音频的多模态数据集,来自三名健康日语母语者在开放词汇有声语音过程中的记录,旨在支持语音解码、多模态信号处理及脑电图表示学习等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00712 2026-06-02 cs.CV 57%

CASTLE2026 Team WDL Technical Report

CASTLE2026 团队 WDL 技术报告

Zhengyang Li, Zhenglin Du, Yi Wen, Fang Liu, Shuo Li, Xu Liu

机构 * Key Laboratory of Intelligent Perception and Image Understanding(智能感知与图像理解重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于 Qwen 的证据感知多模态推理流程,通过提示路由和置信度加权投票解决长视频问答,在 CASTLE 挑战赛中排名第一。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00670 2026-06-02 cs.SD cs.AI 57%

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

超越口部:声学不确定性下视听句子识别中的上半脸情感线索

Zhou Yang, Yueyi Yang

机构 * Faculty of Education and Psychology, University of Oulu, Finland(奥卢大学教育与心理学学院,芬兰) Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用CREMA-D语料库,通过特征分类器探究在声学退化条件下,上半脸情感信息是否有助于视听句子识别,发现上半脸情感线索能提升模型校准和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00324 2026-06-02 cs.IR cs.AI 57%

LLMs Need Encoders for Semantic IDs Too

LLM 也需要语义 ID 的编码器

Xiangyi Chen, Zelun Wang, Xinyi Li, Yi-Ping Hsu, Jaewon Yang, Jiajing Xu

机构 * Pinterest United States(Pinterest美国公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出 PrefixMem,一种基于前缀 n-gram 记忆表的轻量级语义 ID 编码器,为 LLM 提供结构化、前缀条件的表示,显著提升生成推荐中的语义 ID 准确率和检索召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31294 2026-06-01 cs.CV 57%

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

TokTalk: 基于音频-大语言模型令牌的富有表现力的实时面部动画

Qingcheng Zhao, Yifang Pan, Karan Singh

机构 * University of Toronto(多伦多大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 提出TokTalk系统,利用音频-大语言模型产生的音频令牌直接实时生成富有表现力的3D面部动画,通过分块条件流匹配模型和轻量级适配策略实现低延迟和高品质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08979 2026-05-29 cs.SD cs.CL 57%

Beyond Transcripts: A Renewed Perspective on Audio Chaptering

超越文本:音频章节划分的新视角

Fabian Retkowski, Maike Züfle, Thai Binh Nguyen, Jan Niehues, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过提出音频专用架构AudioSeg、分析影响性能的因素以及形式化评估协议,系统研究了音频章节划分任务,发现AudioSeg显著优于基于文本的方法,停顿是最有效的声学特征,而多模态大模型在短音频上表现有潜力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26176 2026-05-27 cs.SD cs.AI 57%

PitchBench: Measuring Pitch Hearing in Audio-Language Models

PitchBench: 测量音频-语言模型中的音高听觉能力

Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith, David M. Chan, Karina Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校) Thoughtful Lab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出PitchBench评估套件,通过28个实验系统测量音频-语言模型在绝对和相对音高感知上的表现,发现当前模型在不同声源、音长和格式下音高感知不可靠。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 57%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23463 2026-05-25 eess.AS 57%

StepAudio 2.5 Technical Report

StepAudio 2.5 技术报告

Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15151 2026-05-22 cs.SD cs.AI 57%

Exploring How Audio Effects Alter Emotion with Foundation Models

探索音频效果如何通过基础模型改变情感

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究音频效果如何通过基础模型影响情感,探讨了基础模型在分析音频效果与情绪关系中的作用,揭示了声音设计技术对感知影响的模式。

Comments https://github.com/stelioskt/audioFX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 57%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18749 2026-05-19 cs.SD cs.CV 57%

WavFlow: Audio Generation in Waveform Space

WavFlow:在波形空间中进行音频生成

Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出WavFlow框架,直接在原始波形空间生成高保真的音频,无需中间表示,通过波形分块和振幅提升实现稳定优化,通过自动化数据管道生成高质量视频-文本-音频三元组,实验结果显示在视频到音频和文本到音频基准测试中表现优异,证明了无需中间压缩即可实现高质量合成。

Comments Code: https://github.com/facebookresearch/WavFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 57%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16403 2026-05-19 cs.CV cs.SD 57%

When Vision Speaks for Sound

当视觉为声音说话

Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu, Rui Cai, Tinghui Zhu, Wendi Li, Yanan Xie, Muhao Chen, Peng Qi

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文发现视频中MLLMs的音频理解依赖视觉线索而非实际音频流,提出Thud框架通过三种音频编辑干预研究此问题,并提出两阶段对齐方法提升模型性能。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏