SynthGuard: An Open Platform for Detecting AI-Generated Multimedia with Multimodal LLMs
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
机构 * LY Corporation(LY公司) ; Keio University(庆应大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments under review
机构 * Department of Psychology, Music and Audio Research Laboratory(心理学系、音乐与音频研究实验室) ; Department of Electronic Engineering and Computer Science(电子工程与计算机科学系)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
Comments Accepted to the NeurIPS 2025 Workshop on AI for Music (AI4Music), 16 pages, 1 figure, 3 tables
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI
机构 * Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院) ; School of Electrical Engineering, KAIST(电气工程学院,韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS
Comments Preprint work
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Peking University(北京大学) ; University of Edinburgh(爱丁堡大学)
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI
机构 * Beijing Fosafer Information Technology Co., Ltd.(北京福萨弗信息科技有限公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
Comments 6 pages,2 figures,accepted by ACM Multimedia Asia 2025
机构 * Imperial College London(伦敦帝国学院) ; Meta AI ; NatWest AI Research(NatWest人工智能研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments NeurIPS 2025
机构 * Computer Aided Medical Procedures, Technical University of Munich(慕尼黑技术大学计算机辅助医学程序)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Submitted to ICASSP 2026; under review
机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) ; The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学) ; Microsoft, China(微软公司) ; South China University of Technology, China(华南理工大学) ; Northwestern Polytechnical University, China(西北工业大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
机构 * Xiamen University(厦门大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
机构 * University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学) ; ByteDance(字节跳动)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL
机构 * Trans-disciplinary Bachelor Degree Program National Taiwan University(台湾国立大学跨学科学士学位计划)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) ; Tencent Ethereal Audio Lab, Tencent Corporation, Shenzhen, China(腾讯虚实音频实验室,腾讯公司,深圳,中国)
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI
机构 * Artificial Intelligence Graduate School(人工智能研究生院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments Published in Interspeech 2025
机构 * Singapore Institute of Technology(新加坡理工学院) ; Duke Kunshan University(杜克-昆山大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments This paper has been accepted by APCIPA ASC 2025
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS
Comments 9 pages, 6 figures
机构 * KLASS Engineering and Solutions Singapore(KLASS工程与解决方案新加坡)
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV、eess.AS
Comments 7 pages, accepted to the 33rd ACM International Conference on Multimedia (MM'25)
机构 * AImotion Bavaria Technische Hochschule Ingolstadt(巴伐利亚AImotion技术大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM
Comments 5 pages and 4 figures
机构 * DISI, University of Bologna(DISI,博洛尼亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments 12th Workshop on Argument Mining (ArgMining 2025) @ ACL 2025
Journal ref In Proceedings of the 12th Argument mining Workshop (ArgMining 2025), pages 388-397, Vienna, Austria
机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) ; Sony Group Corporation(索尼集团) ; Sony AI, Sony Group Corporation(索尼人工智能,索尼集团)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
机构 * University of Utah(犹他大学)
专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted to ICCV 2025. Project Page: https://mahnoor-fatima-saad.github.io/m-capa.html
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Work in progress
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments Submitted to ACM Computing Surveys
机构 * Medical AI Research Center (MedARC)(医学人工智能研究中心(MedARC)) ; Psychological and Brain Sciences, Dartmouth College(心理学与脑科学系,达特茅斯学院) ; Core for Advanced Magnetic Resonance Imaging (CAMRI), Baylor College of Medicine(先进磁共振成像核心(CAMRI),贝勒医学院) ; Sophont ; Princeton Neuroscience Institute(普林斯顿神经科学研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Code available at https://github.com/MedARC-AI/algonauts2025
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) ; National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) ; University at Buffalo(布法罗大学)
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACM MM2025
机构 * The Edward S. Rogers Sr. Department of Electrical and Computer Engineering, University of Toronto, Toronto, Canada(电气与计算机工程系,多伦多大学) ; Division of Engineering Science, University of Toronto, Toronto, Canada(工程科学系,多伦多大学) ; Cundill Centre for Child and Youth Depression, Centre for Addiction and Mental Health, Toronto, Canada(儿童与青少年抑郁研究中心,成瘾与心理健康中心) ; Department of Psychology, York University, Toronto, Canada(心理学系,约克大学) ; The Hospital for Sick Children, Toronto, ON, Canada(多伦多儿童医院) ; Department of Psychiatry, University of Toronto, Toronto, Canada(精神病学系,多伦多大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
Comments 6 pages, 1 figure, 3 tables. The corresponding author is Mai Ali (maia dot ali at mail dot utoronto dot ca). Christopher Lucasius and Tanmay P. Patel contributed equally