机构
*
Sun Yat-sen University(中山大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
大规模多模态数据集与基准用于人类活动场景理解和推理
Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing
机构
*
The Chinese University of Hong Kong, Hong Kong(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Columbia University(哥伦比亚大学)
;
University of Pittsburgh(匹兹堡大学)
FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting
FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测
Nan Zhou, Huandong Wang, Jiahao Li, Han Li, Yali Song, Qiuhua Wang, Yong Li, Xinlei Chen
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院)
;
College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)
Rainbow Noise: Stress-Testing Multimodal Harmful-Meme Detectors on LGBTQ Content
彩虹噪声:对多模态有害迷因检测器进行压力测试以应对LGBTQ内容
Ran Tong, Songtao Wei, Jiaqi Liu, Lanruo Wang
机构
*
Mathematics and Statistics Department University of Texas at Dallas(德克萨斯大学达拉斯分校数学与统计学系)
;
Computer Science Department University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系)
;
Naveen Jindal School of Management University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达尔管理学院)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集
Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park
机构
*
Samsung Research(三星研究所)
;
Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院)
;
Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学)
;
Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?
Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du
机构
*
School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)
Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs
Advait Gosai, Arun Kavishwar, Stephanie L. McNamara, Soujanya Samineni, Renato Umeton, Alexander Chowdhury, William Lotter
机构
*
University of California(加州大学)
;
Dana-Farber Cancer Institute(达纳-法伯癌症研究所)
;
Massachusetts General Hospital(麻省总医院)
;
St. Jude Children’s Research Hospital(圣犹大儿童研究医院)
;
Brigham and Women’s Hospital & Harvard Medical School(布里法伦医院及哈佛医学院)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin
机构
*
Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系)
;
Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系)
;
Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部)
;
Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部)
;
Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部)
;
Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系)
;
Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)
机构
*
College of Computer, National University of Defense Technology(国防科技大学计算机学院)
;
School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)
;
CCNU(中国地质大学)
EcomMMMU: Strategic Utilization of Visuals for Robust Multimodal E-commerce Models
Xinyi Ling, Hanwen Du, Zhihui Zhu, Xia Ning
机构
*
Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)
;
Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所)
;
Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系)