Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem
机构
*
Technical University of Munich (TUM)(慕尼黑技术大学)
;
TUM University Hospital(慕尼黑技术大学医院)
;
German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心)
;
Department of Radiology(放射科)
;
Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所)
;
Uniklinik RWTH Aachen(亚琛工业大学医院)
;
HOPPR IL USA(HOPPR美国)
;
University of Oxford(牛津大学)
;
Imperial College London(伦敦帝国学院)
$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles
Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S
机构
*
Tredence Inc.(特伦德公司)
;
Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校)
;
Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所)
;
Rajiv Gandhi University(拉吉夫·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕勒姆研究实验室)
SingaKids: A Multilingual Multimodal Dialogic Tutor for Language Learning
Zhengyuan Liu, Geyu Lin, Hui Li Tan, Huayun Zhang, Yanfeng Lu, Xiaoxue Gao, Stella Xin Yin, He Sun, Hock Huan Goh, Lung Hsiang Wong, Nancy F. Chen
机构
*
Nanyang Technological University, Singapore(新加坡南洋理工大学)
;
National Institute of Education (NIE), Singapore(新加坡国家教育研究所)
;
Institute for Infocomm Research (I 2 R), A*STAR, Singapore(新加坡资讯与通信研究院(I2R))
A Multimodal Pipeline for Clinical Data Extraction: Applying Vision-Language Models to Scans of Transfusion Reaction Reports
Henning Schäfer, Cynthia S. Schmidt, Johannes Wutzkowsky, Kamil Lorek, Lea Reinartz, Johannes Rückert, Christian Temme, Britta Böckmann, Peter A. Horn, Christoph M. Friedrich
机构
*
Institute for Transfusion Medicine, University Hospital Essen, Hufelandstraße 55, Essen, Germany(1 输血医学研究所,埃森大学医院,Hufelandstraße 55,德国)
;
Department of Computer Science, University of Applied Sciences and Arts Dortmund (FHDO), Emil-Figge Str. 42, Dortmund, Germany(2 计算机科学系,多特蒙德应用科学大学(FHDO),Emil-Figge Str. 42,德国)
;
Institute for Medical Informatics, Biometry and Epidemiology (IMIBE), University Hospital Essen, Hufelandstraße 55, Essen, Germany(3 医学信息学、生物统计学和流行病学研究所(IMIBE),埃森大学医院,Hufelandstraße 55,德国)
;
Institute for AI in Medicine (IKIM), University Hospital Essen, Girardetstraße 2, Essen, Germany(4 医学人工智能研究所(IKIM),埃森大学医院,Girardetstraße 2,德国)
;
Institute of Interventional and Diagnostic Radiology and Neuroradiology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(5 干预性和诊断放射学及神经放射学研究所,埃森大学医院,Hufelandstraße 55,德国)
;
Department of Dermatology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(6 皮肤科系,埃森大学医院,Hufelandstraße 55,德国)
A Multi-Modal Explainability Approach for Human-Aware Robots in Multi-Party Conversation
Iveta Bečková, Štefan Pócoš, Giulia Belgiovine, Marco Matarese, Omar Eldardeer, Alessandra Sciutti, Carlo Mazzola
专题命中
图文多模态
:multi-modal(title);分类 cs.CL、cs.AI
Comments32pp (+6pp sup.mat.) Accepted in Computer Vision and Image Understanding Journal on January 23, 2025. This research received funding Horizon-Europe TERAIS project (G.A. 101079338) and Slovak Research and Development Agency, project no. APVV-21-0105
FairPIVARA: Reducing and Assessing Biases in CLIP-Based Multimodal Models
Diego A. B. Moreira, Alef Iury Ferreira, Jhessica Silva, Gabriel Oliveira dos Santos, Luiz Pereira, João Medrado Gondim, Gustavo Bonil, Helena Maia, Nádia da Silva, Simone Tiemi Hashiguti, Jefersson A. dos Santos, Helio Pedrini, Sandra Avila
专题命中
图文多模态
:multimodal(title);分类 cs.CV、cs.AI
Comments14 pages, 10 figures. Accepted to 35th British Machine Vision Conference (BMVC 2024), Workshop on Privacy, Fairness, Accountability and Transparency in Computer Vision