Vision-Language Models vs Human: Perceptual Image Quality Assessment
视觉-语言模型与人类:感知图像质量评估
Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan
机构
*
School of Engineering, University of Galway(Galway大学工程学院)
;
State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)
专题命中
VLM训练与架构
:vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images
一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型
Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles
机构
*
Biological and Agricultural Engineering(生物与农业工程系)
;
Department of Plant Sciences(植物科学系)
;
Viticulture and Enology(葡萄栽培与酿酒系)
;
Wageningen University & Research(瓦赫宁根大学与研究学院)
专题命中
VLM训练与架构
:vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
Bodhi VLM: Privacy-Alignment Modeling for Hierarchical Visual Representations in Vision Backbones and VLM Encoders via Bottom-Up and Top-Down Feature Search
机构
*
Auckland University of Technology(奥克兰技术大学)
;
Resideo Technologies, Inc.(Resideo技术公司)
;
Guilin University of Electronic Technology(桂林电子科技大学)
;
Universidad de Chile(智利大学)
DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer
DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏
Zhengxu He, Jun Li, Zhijian Wu
机构
*
School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院)
;
Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)
CommentsPenguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准
Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi
机构
*
Tsinghua University(清华大学)
;
University College London(伦敦大学学院)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Peking University(北京大学)
;
Southwest Jiaotong University(西南交通大学)
;
Zhejiang University(浙江大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Renmin University of China(中国人民大学)
;
Southeast University(东南大学)
MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Experts for Humanoid Loco-Manipulation
MetaWorld-X: 通过VLM协调的专家实现人形机器人的分层世界建模
Yutong Shen, Hangxu Liu, Penghui Liu, Jiashuo Luo, Yongkang Zhang, Rex Morvley, Chen Jiang, Jianwei Zhang, Lei Zhang
机构
*
University of Hamburg(汉堡大学)
;
School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学)
;
School of Information Science and Engineering, Fudan University(信息科学与工程学院,复旦大学)
;
University of Alberta(阿尔伯塔大学)
DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles
DeAR: 通过分解注意力头角色实现细粒度VLM适应
Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng
机构
*
Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究所)
;
Ocean University of China(中国海洋大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
MLLM-4D: 向基于视觉的空间-时间智能迈进
Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun
机构
*
University of Macau(澳门大学)
;
Xi'an Jiaotong University(西安交通大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中
VLM训练与架构
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV