VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
VKnowU:评估多模态语言模型中的视觉知识理解
Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
City University of Hong Kong(香港城市大学)
RoMa v2: Harder Better Faster Denser Feature Matching
RoMa v2:更优更快更密集的特征匹配
Johan Edstedt, David Nordström, Yushan Zhang, Georg Bökman, Jonathan Astermark, Viktor Larsson, Anders Heyden, Fredrik Kahl, Mårten Wadenbäck, Michael Felsberg
机构
*
Linköping University(_linköping大学)
;
Chalmers University of Technology(_chalmers技术大学)
;
University of Amsterdam(_阿姆斯特丹大学)
;
Centre for Mathematical Sciences, Lund University(_数学科学中心,吕勒奥大学)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学)
;
University of Science and Technology Beijing(北京科技大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation
区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成
Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim
机构
*
Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系)
;
University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院)
;
Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室)
;
Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)
;
Tencent Youtu Lab(腾讯优图实验室)
;
School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院)
;
Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院)
;
The Chinese University of Hong Kong(香港中文大学)
GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness
GenHOI:具有遮挡意识的通用手-物体姿态估计
Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee
机构
*
Hunan University(湖南大学)
;
Lancaster University(兰卡斯特大学)
;
University of Western Australia(西澳大学)
;
University of Trento(特伦托大学)
;
National University of Singapore(新加坡国立大学)
机构
*
Nanjing University of Posts and Telecommunications(南京邮电大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室)
;
East China Normal University(华东师范大学)
机构
*
Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部)
;
Otto-von-Guericke-University(奥托·冯·格里克大学)
;
Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所)
;
Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系)
;
University of Southampton(南安普顿大学)