ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization
机构 * University of Science, VNU-HCM(越南胡志明市科学大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments ACM Multimedia 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Science, VNU-HCM(越南胡志明市科学大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments ACM Multimedia 2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
Comments Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking
机构 * Tianjin University(天津大学) ; Zhejiang University(浙江大学) ; Zhejiang University of Technology(浙江工业大学) ; Hainan University(海南大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
Comments Project Page: https://personavlog-paper.github.io/
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG
机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG
Comments Accepted at EMNLP 2025, Findings
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Electronic Science and Technology Institute(北京电子科技研究所) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; Northeastern University(东北大学) ; BraneMatrix AI ; Nanyang Technological University(南洋理工大学)
专题命中 其他VLM :vision language model(abstract);分类 cs.AI
Comments Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization