DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准
Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li
机构
*
Hinton STAI Institute(Hinton STAI研究所)
;
Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部))
;
School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Information Engineering University(信息工程大学)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
Yanyuan Chen, Dexuan Xu, Yu Huang, Songkun Zhan, Hanpin Wang, Dongxue Chen, Xueping Wang, Meikang Qiu, Hang Li
机构
*
School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学)
;
School of Computer Science, Peking University(计算机学院,北京大学)
;
National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学)
;
Peking University Sixth Hospital(北京大学第六医院)
;
Augusta University(奥古斯塔大学)
;
Peking University First Hospital(北京大学第一医院)
专题命中
视觉定位与Grounding
:vision language model(title,abstract);grounding(title,abstract);分类 cs.CV
A Survey on Video Temporal Grounding with Multimodal Large Language Model
Jianlong Wu, Wei Liu, Ye Liu, Meng Liu, Liqiang Nie, Zhouchen Lin, Chang Wen Chen
机构
*
School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
;
School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)
;
School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
;
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵
Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu
机构
*
Georgetown University(乔治城大学)
;
University of Southern California(南加州大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
Arizona State University(亚利桑那州立大学)
机构
*
School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)
;
National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University, China(南京大学新型软件技术国家实验室,人工智能学院)
;
School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)
;
MACS Lab, University of Washington(华盛顿大学MACS实验室)