DeepStroke: An Efficient Stroke Screening Framework for Emergency Rooms with Multimodal Adversarial Deep Learning
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI
Comments 6 pages
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2022. 16 pages
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
Comments 8 pages, 3 figures, Pattern Recognition Letters
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.AI、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments Preprint submitted to the Information Fusion journal in August 2020
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、eess.AS
Comments 7 pages, 6 figures
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Under submission as a conference paper
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS
Comments Submitted to ICASSP 2021
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
Comments Submitting to ICASSP 2021
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
Comments Accepted to ECCV 2020 (Spotlight). Project page: http://vision.cs.utexas.edu/projects/audio_visual_navigation/
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS
Comments 5 pages, 1 figure, accepted at INTERSPEECH 2020. Corrected the reference [20]
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments ICASSP 2020. The first three authors contributed equally to this work
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS
Comments Accepted by ICRA 2020. Project page: http://avn.csail.mit.edu
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
Comments Accepted at WACV 2020; supplementary material at page 11; code available at https://github.com/afperezm/acoustic-images-distillation
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted in IEEE ASRU 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
Comments 16 pages, 7 figures. arXiv admin note: substantial text overlap with arXiv:1808.00046
Journal ref Information Fusion, 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments 5 pages, 1 figure, subject to the 2018 IJCNN challenge on One-Minute Gradual-Emotion Recognition
视觉特征能否改善他人发起的修复检测?一种二元多模态方法
机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分院) ; ISIR, Sorbonne University Paris(巴黎索邦大学信息学、系统与机器人研究所) ; Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS Paris(巴黎电信学院、巴黎高等理工学院SES系、巴黎综合理工学院I3 - 法国国家科学研究中心) ; CNRS(法国国家科学研究中心) ; LTCI, Institut Polytechnique de Paris(巴黎综合理工学院LTCI实验室)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究他人发起的修复检测问题,提出结合视觉特征的二元多模态模型,通过在两个语料库上评估,证明视觉信息能提升检测性能,提供跨模态特征贡献见解。
Comments Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments Our code is available at https://github.com/AndyFrancesco29/Audio-Visual-Figure-Skating
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);multimodal foundation model(abstract)
Comments Project page: https://avlmaps.github.io/
通过自动生成的音频视觉伪假来泛化视频深度伪造检测
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM
AI总结 本文提出AVPF方法,通过自动生成多样化的音频视觉伪假样本提升模型泛化能力,实验显示在多个标准数据集上平均性能提升达7.4%。