Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式
Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han
机构
*
Fudan University(复旦大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
;
Tencent Jarvis Lab(腾讯贾维斯实验室)
;
Southern University of Science and Technology(南方科技大学)
专题命中
VLM训练与架构
:vision-language model(title);multimodal large language model(abstract);分类 cs.CV
DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval
DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索
Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik
机构
*
Sejong University(世宗大学)
;
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
Ulsan National Institute of Science and Technology(乌山国立科学研究院)
Attention Alignment Between Humans and Vision-Language Models
人类与视觉语言模型之间的注意力对齐
Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano
机构
*
Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所)
;
Department of Psychology, Princeton University(普林斯顿大学心理学系)
;
Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
;
Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心)
;
Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah
机构
*
Khalifa University(卡利法大学)
;
University of Western Australia(西澳大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Melbourne(墨尔本大学)
;
University of Central Florida(佛罗里达中央大学)
专题命中
VLM训练与架构
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
跨模态掩码组合概念建模以增强视觉-语言组合性
Wei Li, Zhen Huang, Xinmei Tian
机构
*
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室)
;
Independent Researcher(独立研究员)
专题命中
VLM训练与架构
:vision-language model(abstract);VLM(abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts
CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现
Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong
机构
*
State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)
;
National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)