机构
*
Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序)
;
TU Munich, Germany(慕尼黑工业大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院)
机构
*
Laboratory of IEMN, Univ. Polytechnique Hauts-de-France(IEMN实验室,法国高等技术法国大学)
;
KU 6G Research Center, Khalifa University(KU 6G研究中心,哈利法大学)
;
Sorbonne Center for Artificial Intelligence, Sorbonne University(人工智能研究中心,索邦大学)
AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
Aruna Gauba, Irene Pi, Yunze Man, Ziqi Pang, Vikram S. Adve, Yu-Xiong Wang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Rice University(Rice大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
AIFARMS
;
Center for Digital Agriculture at UIUC(伊利诺伊大学厄巴纳-香槟分校数字农业中心)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Sensetime
专题命中
视觉定位与Grounding
:LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection
Yehao Lu, Minghe Weng, Zekang Xiao, Rui Jiang, Wei Su, Guangcong Zheng, Ping Lu, Xi Li
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院)
;
ZTE(ZTE 公司)
RetinaLogos: Fine-Grained Synthesis of High-Resolution Retinal Images Through Captions
Junzhi Ning, Cheng Tang, Kaijing Zhou, Diping Song, Lihao Liu, Ming Hu, Wei Li, Huihui Xu, Yanzhou Su, Tianbin Li, Jiyao Liu, Jin Ye, Sheng Zhang, Yuanfeng Ji, Junjun He
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
Yi Wang, Xinhao Li, Ziang Yan, Yinan He, Jiashuo Yu, Xiangyu Zeng, Chenting Wang, Changlian Ma, Haian Huang, Jianfei Gao, Min Dou, Kai Chen, Wenhai Wang, Yu Qiao, Yali Wang, Limin Wang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
Yiming Huang, Long Bai, Beilei Cui, Kun Yuan, Guankun Wang, Mobarak I. Hoque, Nicolas Padoy, Nassir Navab, Hongliang Ren
机构
*
The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)
;
Shenzhen Research Institute, CUHK, Shenzhen, China(深圳研究学院)
;
Technical University of Munich, Munich, Germany(慕尼黑技术大学)
;
University of Strasbourg & IHU Strasbourg, Strasbourg, France(斯特拉斯堡大学及斯特拉斯堡IHU)
;
University College London, London, United Kingdom(伦敦大学学院)