SHED: Style-Homogenized Embedding Alignment for Domain Generalization
SHED: 风格均质化嵌入对齐用于领域泛化
Kai Gan, Tong Wei
机构
*
School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(1 东南大学计算机科学与工程学院,南京 210096,中国)
;
Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(2 教育部计算机网络与信息集成重点实验室(东南大学),中国)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展
YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu
机构
*
School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding
为什么我们看那里:一种最大化场景理解的视网膜视觉语言模型表现出的人类样注视模式
Shravan Murlidaran, Ziqi Wen, Sana Shehabi, Miguel P. Eckstein
机构
*
Psychological & Brain Sciences, University of California, Santa Barbara(加州大学圣芭芭拉分校心理学与脑科学系)
;
Electrical and Computer Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校电气与计算机工程系)
;
Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中
其他VLM
:visual language model(title);分类 cs.CV、cs.AI
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Southern University of Science and Technology(南方科技大学)
;
University of Warwick(沃里克大学)