Towards Medical Artificial General Intelligence via Knowledge-Enhanced Multimodal Pretraining
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Project page: https://github.com/chenzcv7/MOTOR
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Project page: https://github.com/chenzcv7/MOTOR
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 5 pages, 2 figures
专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments International Conference on Learning Representations (ICLR) 2023
专题命中 多模态训练与对齐 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 8 figure, CVPR 2023 accepted
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments EACL 2023
专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL
专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Need to update the results
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI
专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 30 pages, 6 figures, 3 tables
专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 8 pages, IJCAI 2021
专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments To be published at ICDAR 2021
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 6 figures
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments Published in ALVR 2020, a workshop in ACL 2020
Journal ref Proceedings of the First Workshop on Advances in Language and Vision Research 2020 (26-31)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted by CVPR 2020. Code is available at https://github.com/spyflying/CMPC-Refseg
专题命中 多模态训练与对齐 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments ECCV 2020
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 6 figures
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 10 pages, 4 figures
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2018
专题命中 多模态训练与对齐 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
多模态大语言模型高效性中的标记压缩综述
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xiamen University(厦门大学) ; National University of Singapore(新加坡国立大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of Central Florida(佛罗里达大学) ; Salesforce AI Research(Salesforce AI研究) ; Rice University(德克萨斯大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。
Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression
专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments This is the preprint version of the paper to appear in BMVC 2024. Please cite the final published version. Code is available at https://github.com/Mr-Monday/Multi-modal-Crowd-Counting-via-Modal-Emulation
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
Comments Multimodal Large Language Models Defense, 25 Pages
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments [TL;DR] we design and release the SNARE, the first large-scale multimodal alignment probing benchmark for current vision-language pretrained models
VGR:视觉基础推理
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; ByteDance Inc.(字节跳动公司)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。
Comments 9 pages, 4 figures
基于迭代代理修正的鲁棒性不完整多模态情感分析
机构 * Renmin University of China(中国人民大学) ; Anhui Polytechnic University(安徽工程大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 针对不完整多模态情感分析中一次性代理初始化粗糙的问题,提出迭代代理修正框架,在MOSI等数据集上实现了优于基线的鲁棒情感预测。
Comments Accepted to SEKE 2026. 6 pages, 4 figures