VL-NMS: Breaking Proposal Bottlenecks in Two-Stage Visual-Language Matching
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2009.01449
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2009.01449
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments AAAI 2023
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments To appear in AAAI 2023
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments ECCV 2022
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS2022
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2022
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CBMI 2022
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments 12 pages, 7 figures
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022; updated visualizations; fixed hyper-parameters in Appendix C.1
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2022; Code is publicly available at: https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/cosnet
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2021
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is a longer version of "Deep Context-Encoding Network for Retinal Image Captioning" which is accepted by IEEE International Conference on Image Processing (ICIP), 2021
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by CVPR2021 oral
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CL
Comments 10 pages, 4 figures
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL
Comments Accepted to workshop "The How2 Challenge: New Tasks for Vision & Language" of International Conference on Machine Learning 2019
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments COLING 2018
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.CL、cs.AI
Comments To be presented as a poster at the Workshop on Safe and Trustworthy Multimodal AI Systems (SafeMM-AI), 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI;multi-modal(comments)
Comments Accepted at The First Workshop of Evaluation of Multi-Modal Generation (EvalMG) in 31st International Conference on Computational Linguistics (COLING), 2025. 8 pages + references + 6 pages of Appendix
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI;multi-modal(comments)
Comments Accepted at "Multi-Modal Deep Learning: Challenges and Applications" (MMDLCA), International Conference on Pattern Recognition (ICPR)-2020, Milano, Italia
Journal ref Springer LNCS, volume 12666, 2021
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI;multimodal(comments);multimodal foundation model(comments)
Comments Accepted to CVPRW 2024 on 'What is Next in Multimodal Foundation Models?'. Code: https://github.com/ytaek-oh/vl_compo
基于视觉语言模型的无线边缘网络中隐私保护语义通信
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 该研究针对无线边缘网络语义通信的隐私泄露问题,提出基于VLM的隐私保护语义通信框架,通过私有区域移除、加密收发器和语义信息瓶颈实现隐私保护,同时保证重构质量并抑制跨设备冗余。
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。
Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE