From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2025
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to COLING 2025
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL 2024
专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by IEEE Transactions on Multimedia
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://bzhao.me/MUG/
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 14 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2401.15568, arXiv:2402.08473
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://zhourax.github.io/VEGA/
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2024. Code & Dataset: https://github.com/baaivision/CapsFusion
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM
Comments ICLR 2024
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Under Review
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI、cs.MM
Comments AAAI 2024, https://github.com/zjukg/Structure-CLIP
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments CVPR 2023 Main Track Long Paper
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments SIGIR 2023, 10 pages
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to ACL 2022
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
通过利用一对一关系进行多模态对抗防御以提升视觉语言模型
机构 * The University of Tokyo(东京大学) ; CyberAgent ; National Institute of Informatics(信息处理研究所)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。
Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training
专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Comments Project page: https://github.com/donghao51/Awesome-Multimodal-Adaptation
机构 * BIGAI ; BUAA(北京航空航天大学) ; THU(清华大学) ; BIT(北京理工大学) ; RUC(中国人民大学)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.CL
Comments EMNLP 2025 Findings, Project Page: https://huggingface.co/AdaptLLM/Adapt-MLLM-to-Domains
DGSeg:用于推理分割的语义-空间引导预测的动态门控
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)
专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。
Comments Accepted to ECCV2026
专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);分类 cs.AI
面向长文档的查询驱动多模态信息抽取
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.AI、cs.MM
AI总结 针对现有多模态长文档信息抽取范式的不足,本文提出查询驱动的图像-文本联合抽取任务,构建基准ITJoint并设计多智能体框架Q2IT,实验显示Q2IT性能显著优于独立VLMs但仍有提升空间。
自然语言理解在基于多模态视频的登革热诊断中的作用
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。