机构
*
The University of Hong Kong(香港大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
MedGround: 通过验证的 grounding 数据弥合医学视觉-语言模型中的证据差距
Mengmeng Zhang, Xiaoping Wu, Hao Luo, Fan Wang, Yisheng Lv
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)
;
Hupan Lab, Zhejiang Province(浙江省 Hupan 实验室)
机构
*
School of Informatics, Xiamen University(厦门大学信息学院)
;
School of Computer Science, Nanjing University(南京大学计算机科学学院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings
基于概念的噪声负样本抑制用于零样本分类和胸片发现的 grounding
Chenyu Lian, Hong-Yu Zhou, Chun-Ka Wong, Jing Qin
机构
*
The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能健康中心,护理学院,中国香港)
;
Research Institute for Smart Ageing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能老龄化研究 institute,中国香港)
;
School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China(清华大学生物医学工程学院,清华大学,北京,中国)
;
Queen Mary Hospital, LKS Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉诚医学院Queen Mary医院,中国香港)
Language-Conditioned Visual Grounding with CLIP Multilingual
基于CLIP多语言的语言条件视觉 grounding
J. de Curtò, Mauro Liz, I. de Zarzà
机构
*
1 Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, Barcelona, Spain
;
3 Department of Electrical
;
Computer Engineering, Boston University, Boston, MA 02215, USA
;
4 Human centered AI, Data \& Software, LUXEMBOURG Institute of Science
IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models
IoUPD:用于多模态大语言模型视觉定位的IoU感知特权蒸馏
Xiuyuan Zhu, Ke Lu, Hao Wu, Siwen Jiao, Zijin Du, Dongming Zhang, Jian Xue
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
State Key Laboratory of Communication Content Cognition(通信内容认知技术国家重点实验室)
;
Peng Cheng Laboratory(鹏城实验室)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV
Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
机构
*
The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
;
Eisai Inc.(卫材株式会社)
;
IISc, Bangalore(印度科学研究所班加罗尔分校)
;
Cohere Labs Community(Cohere实验室社区)
专题命中
视觉定位与Grounding
:vision language model(title,abstract);grounding(title,abstract);分类 cs.CV
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
GraphThinker: 通过事件图思维强化时间感知的视频推理
Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li
机构
*
Queen Mary University of London(伦敦玛丽女王大学)
;
Samsung AI Centre Cambridge(剑桥三星人工智能中心)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉定位与Grounding
:grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
University of Amsterdam(阿姆斯特丹大学)
;
University of Bristol(布里斯托大学)
;
Amazon AGI(亚马逊人工智慧)
;
College of Business and Economics(商学院和经济学学院)
;
University of Johannesburg(约翰内斯堡大学)
专题命中
视觉定位与Grounding
:grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI