Simulating Clinical AI Assistance using Multimodal LLMs: A Case Study in Diabetic Retinopathy
Nadim Barakat, William Lotter
机构
*
Dana-Farber Cancer Institute & Tufts University School of Medicine(达纳-法伯癌症研究所及塔夫茨大学医学院)
;
Dana-Farber Cancer Institute Brigham and Women’s Hospital & Harvard Medical School(达纳-法伯癌症研究所布里特妇女医院及哈佛医学院)
Target-oriented Multimodal Sentiment Classification with Counterfactual-enhanced Debiasing
Zhiyue Liu, Fanrong Ma, Xin Ling
机构
*
School of Computer, Electronics and Information(计算机、电子与信息学院)
;
Guangxi University(广西大学)
;
Guangxi Key Laboratory of Multimedia Communications(广西多媒体通信与网络技术重点实验室)
;
School of Sociology and Anthropology(社会学与人类学学院)
;
Sun Yat-sen University(中山大学)
机构
*
National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(多媒体软件国家工程研究中心,计算机科学学院,武汉大学)
;
School of Computing, National University of Singapore(计算学院,新加坡国立大学)
;
School of Computer Science, Peking University(计算机科学学院,北京大学)
;
State Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
"Humor, Art, or Misinformation?": A Multimodal Dataset for Intent-Aware Synthetic Image Detection
Anastasios Skoularikis, Stefanos-Iordanis Papadopoulos, Symeon Papadopoulos, Panagiotis C. Petrantonakis
机构
*
Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,阿基米德大学塞萨洛尼基分校)
;
Information Technology Institute, Centre for Research & Technology Hellas(信息科技研究所,希腊研究中心)
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
Erik Daxberger, Nina Wenzel, David Griffiths, Haiming Gang, Justin Lazarow, Gefen Kohavi, Kai Kang, Marcin Eichner, Yinfei Yang, Afshin Dehghan, Peter Grasch
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
机构
*
Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)
;
Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学)
;
Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长)
;
Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)
11Plus-Bench: Demystifying Multimodal LLM Spatial Reasoning with Cognitive-Inspired Analysis
Chengzu Li, Wenshan Wu, Huanyu Zhang, Qingtao Li, Zeyu Gao, Yan Xia, José Hernández-Orallo, Ivan Vulić, Furu Wei
机构
*
Microsoft Research(微软研究院)
;
Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)
;
Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
;
Department of Oncology, University of Cambridge(癌症部门,剑桥大学)
;
Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能中心,剑桥大学)
;
VRAIN, Universitat Politècnica de València(VRAIN,巴塞罗那理工大学)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
Yichi Zhang, Yao Huang, Yifan Wang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu
机构
*
Department of Computer Science and Technology, College of AI, Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(计算机科学与技术系、人工智能学院、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)
;
Institute of Artificial Intelligence, Beihang University(人工智能研究院、北航)
;
RealAI
A Versatile Pathology Co-pilot via Reasoning Enhanced Multimodal Large Language Model
Zhe Xu, Ziyi Liu, Junlin Hou, Jiabo Ma, Cheng Jin, Yihui Wang, Zhixuan Chen, Zhengyu Zhang, Fuxiang Huang, Zhengrui Guo, Fengtao Zhou, Yingxue Xu, Xi Wang, Ronald Cheong Kin Chan, Li Liang, Hao Chen
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Southern Medical University(南方医科大学)
;
Nanfang Hospital and School of Basic Medical Sciences(南方医院和基础医学科学学院)
;
Chinese University of Hong Kong(香港中文大学)
Visual Enumeration Remains Challenging for Multimodal Generative AI
Alberto Testolin, Kuinan Hou, Marco Zorzi
机构
*
Department of General Psychology and Department of Mathematics University of Padova(帕多瓦大学心理学系和数学系)
;
Department of General Psychology University of Padova(帕多瓦大学心理学系)
;
Department of General Psychology and Padova Neuroscience Center University of Padova(帕多瓦大学心理学系和帕多瓦神经科学中心)
;
IRCSS San Camillo Hospital, Venice-Lido(威尼斯利多医院IRCSS桑卡莫医院)
专题命中
多模态评测
:multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Visual Position Prompt for MLLM based Visual Grounding
Wei Tang, Yanpeng Sun, Qinying Gu, Zechao Li
机构
*
School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)