PhysPatch: A Physically Realizable and Transferable Adversarial Patch Attack for Multimodal Large Language Models-based Autonomous Driving Systems
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
机构 * LITIV, Polytechnique Montréal(Polytechnique Montréal 的 LITIV) ; Data Science Laboratory, Université du Québec (TELUQ)(Université du Québec (TELUQ) 的 Data Science Laboratory)
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
Comments 10 pages
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Tongji University(同济大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted to TPAMI
机构 * China University of Mining and Technology(中国矿业大学) ; Kuaishou Technology(快手科技)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 12 pages, 2 figures
机构 * CoAI group, DCST, Tsinghua University(清华大学DCST学院) ; Beihang University(北航大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
Comments 10 pages, 3 tables, 2 figures, to appear in the Proceedings of the 33rd ACM International Conference on Multimedia (MM '25)
机构 * Zhejiang University(浙江大学) ; Hangzhou RongNao Technology Co., Ltd(杭州融脑科技有限公司)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI、eess.AS
Comments Accepted by ACM MM 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments 15 pages, 8 figures, Accepted by ACM MM 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments Published in IEEE Journal of Selected Topics in Signal Processing
Journal ref https://ieeexplore.ieee.org/abstract/document/11086511/
机构 * IoT Research Laboratory, Ontario Tech University(Ontario Tech 大学物联网研究实验室) ; Ontario Shores Centre for Mental Health Sciences(Ontario Shores 精神健康科学中心) ; Temerty Faculty of Medicine, University of Toronto(多伦多大学Temerty医学学院) ; Faculty of Science, Ontario Tech University(Ontario Tech 大学科学学院)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Multimodal Intelligence Lab(多模态智能实验室) ; Department of Computer Science(计算机科学系) ; University of Exeter(埃克塞特大学) ; University of Birmingham(伯明翰大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
机构 * Information Sciences Institute(信息科学研究所) ; Institute for Creative Technologies(创意技术研究所) ; Department of Computer Science(计算机科学系) ; University of Southern California(南加州大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Aristotle University of Thessaloniki(希腊雅典纳大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL 2025 Findings
机构 * Department of Computer Science Engineering University of Trento(计算机科学工程系 特伦托大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) ; Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院) ; Computer Science Department of the Technische Universität Darmstadt(达姆施塔特技术大学计算机科学系)
专题命中 视频多模态 :multi-modal(abstract)
Comments Accepted for publication in IEEE T-RO. Project website: https://sites.google.com/view/rfmp 17 pages, 12 figures, 12 tables
机构 * Northeastern University, China(东北大学) ; Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI
机构 * Northeastern University(东北大学)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
Comments The camera-ready version for ACL 2025 in Vienna
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
机构 * Peking University(北京大学) ; Wuhan University(武汉大学) ; Shanghai University of International Business(上海国际商务大学) ; Microsoft(微软公司)
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI
Comments SIGIR 2025
Journal ref SIGIR 2025: Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval Pages 1593 - 1602
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Waseda University(早稻田大学) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI
机构 * ByteDance(字节跳动)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments CVPR 2025; Code and models: https://github.com/ByteVisionLab/TokenFlow
机构 * ByteDance(字节跳动)
专题命中 多模态生成 :omni-modal(abstract);分类 cs.CL、cs.AI
机构 * KAIST(韩国科学技术院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 20 pages
机构 * Dali University(大理大学) ; Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)
专题命中 多模态生成 :cross-modal(abstract)
机构 * Stony Brook University(斯通布罗克大学) ; Amazon(亚马逊)
专题命中 多模态评测 :multimodal(title,abstract);image-text(title,abstract);MLLM(abstract);分类 cs.CV
Comments Published in the First Workshop of Evaluation of Multi-Modal Generation 2025
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Meituan(美团)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM
Comments ICCV 2025
机构 * Zefr Inc(Zefr公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
Comments Accepted to the Computer Vision in Advertising and Marketing (CVAM) workshop at ICCV 2025
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
Comments 18 pages
专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV
Comments Accepted at ACL 2025 in the main track
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 2025
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL