Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
Comments ICCV 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
Comments ICCV 2025
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments Under Review
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所基础模型研究中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accpted by ICCV 2025
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University & ByteDance(智能机器人与先进制造学院,复旦大学 & 字节跳动) ; School of Cyber Science and Engineering, Zhengzhou University(网络科学与工程学院,郑州大学) ; Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学) ; Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司) ; Department of Computer Science, The University of Toronto(计算机科学系,多伦多大学) ; Research Center for Space Computing System, Zhejiang Lab(空间计算系统研究中心,浙江实验室) ; Institute of Information Technology, University of Klagenfurt(信息技术学院,克雷格福特大学) ; School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
机构 * Great Bay University(大亚湾大学) ; Nanyang Technological University(南洋理工大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted by Workshop SVC of ACM MM 2025
机构 * Department of Computer Science, The University of Texas at Dallas(计算机科学系,德克萨斯大学达拉斯分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Seoul National University(首尔国立大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
Comments Published at ICCV 2025. Project page: https://hahyeon610.github.io/Video-centric_Audio_Visual_Localization/
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Wang Liu Bell University of Edinburgh(王刘贝尔爱丁堡大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS
Comments Accepted by Interspeech 2025
机构 * Kyung Hee University(庆熙大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; Sungkyunkwan University(成均馆大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments Accepted at CVPR 2025
Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 8342-8351
机构 * MBZUAI(穆桑大学人工智能研究所) ; University of California Merced(加州大学默塞德分校) ; Google Research(谷歌研究) ; Australian National University(澳大利亚国立大学) ; Linköping University(林肯大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments VideoMathQA Technical Report
机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院智能信息处理重点实验室) ; Key Laboratory of AI Safety, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Code: https://github.com/ictnlp/Stream-Omni , Model: https://huggingface.co/ICTNLP/stream-omni-8b
机构 * Sungkyunkwan University(成均馆大学) ; Purdue University(普渡大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments CVPR 2025. Code is available at https://github.com/AIM-SKKU/QA-TIGER
机构 * Indian Institute of Technology JodhpurIndia(印度理工学院贾姆普尔分校) ; Columbia UniversityUSA(哥伦比亚大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 eess.AS
Comments Accepted in Interpseech 2025
机构 * Nagoya University(名古屋大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
Comments Accepted by INTERSPEECH 2025
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
机构 * King’s College London(伦敦国王学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM
Comments Originally submitted to CVPR 2025 on 2024-11-15 with paper ID 15808
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 52 pages
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 9 pages
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by CVPR2025
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);audio-visual(abstract);分类 cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2024
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by ICLR 2025