arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2603.15995 2026-04-30 eess.AS 57%

AILive Mixer: A Deep Learning based Zero Latency Automatic Music Mixer for Live Music Performances

AILive Mixer: 基于深度学习的零延迟自动音乐混音系统用于现场音乐表演

Devansh Zurale, Iris Lorente, Michael Lester, Alex Mitchell

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出一种基于深度学习的自动多轨音乐混音系统,用于现场表演,解决现场表演中通道受相邻乐器声 bleed 影响及音频-视频同步问题,实现零延迟混音。

Comments 5 pages, 4 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26252 2026-04-30 cs.CV 57%

OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction

OmniTrend: 内容-上下文建模用于可扩展的社会流行度预测

Liliang Ye, Guiyi Zeng, Yunyao Zhang, Yi-Ping Phoebe Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出OmniTrend框架,通过分离内容吸引力与上下文曝光,提升跨平台流行度预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 57%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13421 2026-04-30 cs.SD eess.AS 57%

Explainable Detection of Machine Generated Music and Early Systematic Evaluation

可解释性地检测机器生成音乐及早期系统性评估

Yupei Li, Qiyang Sun, Hanqian Li, Lucia Specia, Björn W. Schuller

机构 * Imperial College London, Computing(帝国理工学院伦敦分校,计算机系) Shandong University(山东大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过多种模型评估机器生成音乐检测,揭示ResNet18在领域内和领域外测试中的最佳性能,提出未来研究方向以提升检测方法的鲁棒性和有效性。

Comments Accepted at Scientific report

Journal ref Sci Rep 16, 13757 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL 57%

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 57%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20847 2026-04-24 cs.IR cs.AI 57%

Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models

重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征

Yizhi Zhou, Jia-Qi Yang, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18423 2026-04-21 cs.CL 57%

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

BhashaSutra:印度NLP数据集、语料库和资源的任务导向统一调查

Raghvendra Kumar, Devankar Raj, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳加邦计算机科学与工程系) Indian Institute of Technology Patna, India(印度理工学院帕纳加邦)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文首次系统梳理印度NLP资源,涵盖200+数据集、50+基准测试和100+模型工具,分析注释、评估及模型设计趋势,识别数据稀疏、语言覆盖不均等挑战,为公平、文化导向的NLP研究提供基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18159 2026-04-21 cs.CL 57%

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

FreezeEmpath: 基于冻结大语言模型的高效共情语音聊天机器人训练

Yun Hong, Yan Zhou, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出 FreezeEmpath,通过冻结大语言模型参数,利用现有语音指令和情感识别数据高效训练共情语音聊天机器人,实现情感表达和对话性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17023 2026-04-21 cs.HC cs.AI cs.CY 57%

The Instrumental Dissolution of Typing: Why AI Challenges the Keyboard Era in Knowledge Work

打字的消解:为何AI挑战键盘时代的知识工作

Wei Roy Hua

机构 * T5 Innovations(8T5创新)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AI使键盘在知识工作中不再必要,通过迁移功能至AI系统结束键盘时代,核心贡献是识别验证瓶颈,重新定义专业能力与劳动认可。

Comments 146 pages, 9 sections. Also available at https://zenodo.org/records/19605842

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15322 2026-04-20 cs.HC cs.CL cs.LG 57%

Acoustic and Facial Markers of Perceived Conversational Success in Spontaneous Speech

语音与面部特征在自发言语中感知对话成功的标志

Thanushi Withanage, Elizabeth Redcay, Carol Espy-Wilson

机构 * Department of Electrical and Computer Engineering, University of Maryland College Park, MD, USA(电气与计算机工程系,马里兰大学学院市分校) Department of Psychology, University of Maryland College Park, MD, USA(心理学系,马里兰大学学院市分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析自发Zoom对话,探讨对话动态与感知互动质量的关系,发现同步现象能可靠检测并预测更高的对话成功感知。

Comments Accepted for presentation at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15301 2026-04-20 cs.CV 57%

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

在潜在思想中思考:一种无手势词的签语翻译新范式

Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于推理的签语翻译框架,通过潜在思想序列作为中间层提升翻译的连贯性和准确性,并构建了一个新的大规模无手势词数据集。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14619 2026-04-17 cs.SD cs.LG eess.AS q-fin.CP q-fin.ST 57%

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

声音伪装现象:重新评估语音特征用于金融风险预测

Dhruvin Dungrani, Disha Dungrani

机构 * Department of Information Systems(信息系统系)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了在真实会议环境中,高训练度演讲者使用语音特征(音高、抖动和犹豫)进行金融风险预测的局限性,发现融合声音特征会降低性能,提出声音伪装现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07222 2026-04-17 cs.LG cs.CL 57%

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12221 2026-04-14 cs.CV 57%

A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition

一种两阶段双模态模型用于面部情绪表达识别

Jiajun Sun, Zhe Gao

机构 * Shanghai Normal University(上海师范大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出一种两阶段双模态模型,通过预训练DINOv2编码器提取鲁棒视觉特征,并结合Wav2Vec 2.0音频特征进行融合,提升面部情绪识别性能。

Comments Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 57%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01512 2026-04-14 cs.CL 57%

MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages

MCAT: 通过MLLMs扩展多对多语音到文本翻译至70种语言

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin, YaoWei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology, Harbin(哈尔滨工业大学(哈尔滨)) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MCAT框架通过课程学习和数据平衡策略扩展MLLMs支持70种语言并实现互译,同时优化语音适配模块将语音序列长度缩减至30个token,提升翻译效率。

Comments Accepted in IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14493 2026-04-14 cs.CL cs.CR 57%

LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops

LingoLoop攻击:通过语言上下文和状态陷阱使大语言模型陷入无限循环

Jiyuan Fu, Kaixun Jiang, Lingyi Hong, Jinglun Li, Haijing Guo, Dingkang Yang, Zhaoyu Chen, Wenqiang Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Jiiov Technology(极奥科技)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LingoLoop攻击,通过调整词性标注和隐藏状态限制,使多模态大语言模型生成冗长重复内容,导致资源耗尽和服务降级。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/fuhaha824/LingoLoop-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10542 2026-04-14 cs.SD cs.AI 57%

VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench:跨四个音频类别的V2A和VT2A生成基准测试

Qian Zhang, Yuqin Cao, Yixuan Gao, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VidAudio-Bench,通过四个音频类别评估V2A和VT2A生成,包含1634个视频文本对和11种先进模型,引入13种参考自由指标,揭示当前模型在语音和歌唱生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09881 2026-04-14 eess.AS cs.HC 57%

Toward using Speech to Sense Student Emotion in Remote Learning Environments

迈向利用语音感知远程学习环境中学生情绪的研究

Sargam Vyas, Bogdan Vlasenko, André Mayoraz, Egon Werlen, Per Bergamin, Mathew Magimai. -Doss

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过构建基于语音的自我控制任务数据集,研究语音在远程学习中感知学生情绪的可行性,探讨语音在情感维度上的变化及自动预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00793 2026-04-14 cs.HC cs.CL cs.ET cs.IR 57%

SpeechLess: Micro-utterance with Personalized Spatial Memory-aware Assistant in Everyday Augmented Reality

SpeechLess:日常增强现实中的个性化空间记忆-aware助理的微 utterance

Yoonsang Kim, Devshree Jadeja, Divyansh Pradhan, Yalong Yang, Arie Kaufman

机构 * Stony Brook University(石溪大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 SpeechLess通过个性化空间记忆实现语音意图粒度控制,减少公共场合说话的不适,提升日常信息获取效率。

Comments 11 pages, 9 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09282 2026-04-14 cs.SD cs.CL 57%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07895 2026-04-10 cs.AI 57%

DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues

DialBGM:从日常多轮对话中推荐背景音乐的基准测试

Joonhyeok Shin, Jaehoon Kang, Yujun Lee, Hannah Lee, Yejin Lee, Yoonji Park, Kyuhong Shim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DialBGM基准测试,通过1200个日常对话数据,评估模型在无音乐描述的多轮对话中推荐非侵入性背景音乐的能力,发现现有模型在Hit@1指标上远低于人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07467 2026-04-10 cs.CL cs.LG 57%

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

词调难以量化:探究 Mandarin 和 Yorùbá 中的离散语音单元

Opeyemi Osakuade, Simon King

机构 * The Centre for Speech Technology Research, University of Edinburgh, UK(英国爱丁堡大学语音技术研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究发现离散语音单元在编码超段落信息时可靠性较低,尤其在词调方面,提出通过两次聚类方法改进词调编码。

Comments Accepted at Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV 57%

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM 57%

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20072 2026-03-26 cs.CL 57%

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

从文本到谈话:音频-语言模型需要非自回归联合训练

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) TAL Education Group(TAL教育集团) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Text-to-Talk模型,通过整合自回归文本生成与非自回归音频扩散,统一训练目标,提升多模态语音交互系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏