Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments A technical report. Project: https://github.com/xin-ran-w/CapAgent
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Won the 'Best Paper Runner-up Award' at the 2024 IEEE International Automated Vehicle Validation Conference (IAVVC 2024). Also accepted at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics, at the Robotics Science and Systems Conference (RSS SemRob 2024)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 10 figures, publised to AAAI 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICASSP 2025. Camera Ready Version
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM
Comments This paper got accepted by IEEE TMM
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL、cs.MM
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by NIPS2024
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments ICIP 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted in AAAI 2025
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments Accepted for publication, 26th Int. Symp. on Multimedia (IEEE ISM 2024), Tokyo, Japan, Dec. 2024. This is the authors' "accepted version"
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments Project Page: https://catherine-r-he.github.io/SynGround/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI25
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Preprint
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 10 Pages
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments the correct arxiv version
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments 24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments 18 pages
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI