A Multi-modal Deep Neural Network approach to Bird-song identification
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
Comments LifeCLEF 2017 working notes, Dublin, Ireland
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
Comments LifeCLEF 2017 working notes, Dublin, Ireland
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments 14 pages, 6 figures, 5 tables
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(6), 1086 - 1099, 2018
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted to IEEE SLT 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments Accepted at Journal of Computer Methods in Biomechanics and Biomedical Engineering
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments Accepted to EMNLP 2018
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
Comments Conference paper at ACM Multimedia 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments reformatted; ICPRAI 2018 conference proceedings, pp. 151-157, CENPARMI, Concordia University, Montreal
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments To appear in Interspeech 2018. We provide supplementary material with interactive demonstrations on http://www.robots.ox.ac.uk/~vgg/demo/theconversation
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
Comments To appear in: IEEE Computer Vision and Pattern Recognition (CVPR), 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments ICASSP 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments AKBC 2017 Workshop Paper
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments Robo-NLP workshop at ACL 2017. 9 pages, 5 figures, 6 tables
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments 14 pages, 4 figures, 4 tables
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, volume 38, number 12, 2402 - 2415, 2016
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments NIPS Workshop on Future of Interactive Learning Machines, 2016
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Appears in Proceedings of the Eighth Conference on Uncertainty in Artificial Intelligence (UAI1992)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Journal ref IJCSI International Journal of Computer Science Issues, Vol. 8, Issue 6, No 2, 2011, 122-127
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 27, pages 55-83, 2006
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
Comments http://www.journalofcomputing.org
Journal ref Journal of Computing, Volume 2, Issue 5, May 2010
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 8 pages, Postscript file, UNIX compressed, uuencoded
超越表格数据的TabPFN:多模态嵌入的校准与准确性
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。
Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings
FOCAL:多模态代理的新型基准测试技术
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。
Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)
Wan-Streamer v0.1: 端到端实时交互基础模型
机构 * Alibaba Group(阿里巴巴集团)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 提出Wan-Streamer,一种原生流式、端到端的交互基础模型,通过单一Transformer联合建模语言、音频和视频,实现低延迟全双工音视频交互,无需外部模块。
Comments Website: https://wan-streamer.com
JAM-Flow:联合音频-运动合成与流匹配
机构 * Yonsei University(延世大学) ; CineLingo ; Seoul National University(首尔国立大学)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
AI总结 本文提出JAM-Flow框架,通过流匹配和多模态扩散变压器架构,实现面部运动与语音的联合合成与条件生成,支持文本到说话人生成、音频驱动动画等多种任务。
Comments project page: https://joonghyuk.com/jamflow-web Under review. Preprint published on arXiv
保留音频无法表达的内容:面向多模态大语言模型的上下文保留令牌修剪
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ContextGuard框架,通过保留音频-视觉上下文并去除跨模态冗余,实现多模态大语言模型的高效令牌修剪,实验表明其在多个基准测试中表现优异,能有效减少输入令牌数量。