arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2608.12034 2026-08-13 eess.AS cs.SD 新提交 57%

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试

Dehui Gao, Zhixian Zhao, Zhennan Lin, Yujie Liao, Yuhang Dai, Yike Zhu, Longshuai Xiao, Hui Bu, Xin Xu, Xie Chen, Shuai Wang, Liumeng Xue, Zhonghua Fu, Jun Du, Eng-Siong Chng, Jun Zhou, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Huawei(华为) AIShell Inc(AIShell公司) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Rokid

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 57%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

机构 * MiLM Plus Xiaomi Inc.(小米公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01982 2026-08-12 cs.HC cs.AI 版本更新 57%

Music Interpretation and Emotion Perception: A Computational and Neurophysiological Investigation

音乐诠释与情感感知:计算与神经生理学调查

Vassilis Lyberatos, Spyridon Kantarelis, Ioanna Zioga, Christina Anagnostopoulou, Giorgos Stamou, Anastasia Georgaki

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典) Department of Music Studies, National and Kapodistrian University of Athens(音乐研究系,国家与卡波迪斯特里亚大学雅典)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用计算和神经生理学方法,探究不同演奏情境(如曲目、调式练习曲和即兴演奏)及表现力水平对表演者情感传达和听众反应的影响,发现表现力和即兴演奏具有独特声学特征并引发更强情感反应,且即兴演奏带来更大的神经生理放松。

Comments Accepted at SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08990 2026-08-11 cs.HC cs.MM 新提交 57%

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

AI引导式学习:基于深度学习音视频处理技术的知识与技能获取支持方法研究

Kazuki Kawamura

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本研究提出含三个系统的AI引导式学习框架,通过深度学习音视频处理技术,解决学习中长内容耗时、技能模仿反馈不足的问题,相关系统在播放效率、视频时长缩减、发音提升上均有良好效果。

Comments 118 pages, 26 figures, 4 tables. Doctoral dissertation, Doctor of Interdisciplinary Informatics, The University of Tokyo; degree awarded September 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22790 2026-08-11 cs.SD cs.AI 版本更新 57%

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

机构 * University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 57%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 57%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 57%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31589 2026-08-10 cs.CV 版本更新 57%

Recognizing Co-Speech Gestures in-the-Wild

识别野外伴随语音的手势

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06612 2026-08-07 cs.CV 版本更新 57%

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

从音频到视频的桥梁:音素-视素对齐让任意人脸可说多种语言

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出MuEx框架,通过PG-MoE架构和PV-Align机制,结合含12种语言的MTFD数据集,实现多语言语音驱动说话人脸合成,在MTFD全语言表现优异且可零样本泛化到未见语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03742 2026-08-05 cs.SD cs.AI 新提交 57%

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

基于AI的音效生成:跨输入模态生成模型的叙事性综述

Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本章综述了跨文本、视觉等输入模态的AI音效生成模型,考察30篇文献,指出模型性能提升的同时存在时间同步局限等挑战,推动音效生成向自适应系统发展。

Comments 29 pages, 5 figures, to appear in G. A. Tsihrintzis, M. Virvou, N. Bourbakis, and L. C. Jain (Eds.), Advances in Global Applied Artificial Intelligence: Springer, Learning and Analytics in Intelligent Systems Book Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15755 2026-08-03 cs.SD cs.AI 版本更新 57%

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27436 2026-07-31 eess.AS 新提交 57%

WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction

WeSep:面向目标说话人提取的模块化与线索可组合框架

Ke Zhang, Xiaoyang Yu, Haoyu Li, Shuai Wang, Shuhan Zhang, Haizhou Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 WeSep是将目标说话人提取重新表述为异质线索条件学习问题的统一框架,通过模块化设计提升灵活性,多模态实验验证其稳定性,工具包将公开。

Comments 6 pages, accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26567 2026-07-30 cs.RO cs.CV 新提交 57%

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07044 2026-07-30 cs.DB cs.AI cs.CR 版本更新 57%

Balancing Privacy and Efficiency: Music Information Retrieval via Additive Homomorphic Encryption

平衡隐私与效率:基于加法同态加密的音乐信息检索

William Zerong Wang, Dongfang Zhao

机构 * University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出基于加法同态加密的音乐检索方法,实现音乐专用推理攻击量化、结构感知加法原语优化,在四组音频数据集上验证其兼具隐私性与高效扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 57%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18946 2026-07-29 cs.CL 版本更新 57%

Constrained CTC Decoding for Efficient Diacritic Restoration

用于高效变音符恢复的约束 CTC 解码

Rufael Marew, Amr Keleg, Hanan Aldarmaki

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 研究阿拉伯语音转录本变音符恢复问题,提出基于 CTC 的高效非自回归方法,通过构建标注格并纳入硬约束进行解码,在相关测试集上评估,相比基线降低了变音符错误率,实现性能和效率提升。

Comments Accepted at Interspeech 2026. Includes an additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24359 2026-07-28 cs.CV 新提交 57%

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交 57%

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20541 2026-07-28 cs.CL cs.CY 版本更新 57%

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

SAFE-MEME:用于表情包中鲁棒性仇恨言论检测的结构化推理框架

Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究表情包中仇恨言论检测难题,提出SAFE-MEME框架及其两个变体,通过构建新型数据集进行基准测试,实验表明SAFE-MEME-QA和SAFE-MEME-H能有效检测仇恨言论,且不同方法在常规和混淆场景各有优势,还分析了错误案例。

Comments 44 pages, 27 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19352 2026-07-23 cs.HC cs.CY cs.MM cs.SD 新提交 57%

Validating the Single Item Kawaii Measure

验证单项卡哇伊度量

Katie Seaborn, Yijia Wang

机构 * University of Cambridge(剑桥大学) Institute of Science(科学研究院) Tokyo Institute of Technology(东京技术大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。

Comments Accepted at CUI '26 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 57%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 57%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16496 2026-07-16 eess.SY cs.AI cs.LG cs.SY 57%

Synergies between Federated Foundation Models and Smart Power Grids

联邦基础模型与智能电力电网的协同作用

Seyyedali Hosseinalipour, Shimiao Li, Adedoyin Inaolaji, Filippo Malandra, Luis Herrera, Nicholas Mastronarde

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。

Journal ref IEEE Electrification Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11792 2026-07-14 cs.RO eess.AS 新提交 57%

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

将所有内容都转换为在线 API 服务?关于在机器人系统中集成本地化语音识别模型的综述

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

机构 * Institute of Science Tokyo(东京科学研究所) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 综述自动语音识别技术在机器人系统中的集成,涵盖其从传统到深度学习模型的演变、相关数据集与工具包,介绍基于 ASR 模型家族等的部署策略及实际平台,指出挑战与未来方向,助力社交机器人研究人员探索人机交互领域。

Comments accepted in 18th International Conference on Social Robotics (ICSR + ART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28022 2026-07-14 cs.CV 版本更新 57%

Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge

深度伪造是否足够逼真?探索语义不匹配作为新的挑战

Sharayu Nilesh Deshmukh, Kailash A. Hambarde, Joana C. Costa, Hugo Proença, Tiago Roxo

机构 * Instituto de Telecomunicações, Universidade da Beira Interior(电信研究所,贝拉内里大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出新的评估框架,通过引入语义不匹配类别,评估现有模型在面对语义不一致的深度伪造数据时的鲁棒性,并提出语义强化策略提升检测性能。

Comments Added missing FGI results in semantic reinforcement eval (Table 9), showing an architecture-dependent effect. Abstract, contributions, and conclusion revised accordingly. Clarified RARV-SMM/semantic mismatch definition. Corrected SOTA comparison claim (Sec. 4.7). Added code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09095 2026-07-13 cs.SD cs.MM 新提交 57%

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

用于音频条件音乐游戏关卡建模的基于事件的令牌序列

Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究音乐游戏关卡程序生成问题,受基于事件的符号音乐建模启发,提出令牌级序列公式,构建Transformer模型,在事件级评估中优于基线,能系统分析音频对节奏对齐事件预测的支持。

Comments Camera-ready version, published at ICMR 2026

Journal ref Proceedings of the International Conference on Multimedia Retrieval (ICMR '26), June 16-19, 2026, Amsterdam, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏