Positive Sample Propagation along the Audio-Visual Event Line
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to CVPR 2021. Code is available at https://github.com/jasongief/PSP_CVPR_2021
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to CVPR 2021. Code is available at https://github.com/jasongief/PSP_CVPR_2021
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Presented at NeurIPS (2020)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)
Comments 17th IEEE International Conference on Mobile Ad-Hoc and Sensor Systems (MASS) - 2020
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments To appear in the first EMNLP Workshop on NLP Beyond Text, 2020. Aman Khullar and Udit Arora have equal contribution
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted at Interspeech 2020
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
Comments NAACL 2019 oral presentation
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS
Comments To appear in Proc. IEEE ASRU Workshop 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS
Comments Will be presented in 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2019)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
Comments ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS
Comments Published in INTERSPEECH 2016
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted by CVPR2019
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS
Comments A prototype system for the Audio Visual Scene-aware Dialog (AVSD) at DSTC7
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at the 19th International Conference on Computational Linguistics and Intelligent Text Processing (CICLing), 2018
机构 * Indian Institute of Technology Indore(印度理工学院印第安纳分校) ; School of Computing, Edinburgh Napier University(爱丁堡纳皮尔大学计算机学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM
Journal ref INTERSPEECH 2025 - 4th COG-MHEAR Workshop on Audio-Visual Speech Enhancement (AVSEC)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI;multimodal(comments)
Comments Companion Publication of the 25th International Conference on Multimodal Interaction (pp. 311-317)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
Comments 5 pages. arXiv admin note: text overlap with arXiv:2102.07054
Journal ref Proceedings of the 2021 International Conference on Multimodal Interaction
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted at ICASSP 2023. This is the longer version of the five-page camera-ready paper. Project page: https://vision.cs.utexas.edu/projects/learning-audio-visual-dereverberation
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments 13 pages, Accepted at Workshop on Performance and Interpretability Evaluations of Multimodal, Multipurpose, Massive-Scale Models, COLING 2022
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments This work aims to do an adversarial sound intervention for robust audio-visual navigation
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted at ASRU 2021. Code available at https://github.com/mmakiuchi/multimodal_emotion_recognition
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted by the 2020 International Conference on Multimodal Interaction (ICMI'20)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Published in the First Workshop on Computational Modeling of Human Multimodal Language - ACL 2018
StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 音频语音多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。
Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code is available at https://github.com/dvlab-research/MGM-Omni
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CMU Machine Learning Department PhD Thesis
专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments WACV 2024
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 11 pages, Accepted by IEEE Transactions on Multimedia