Disentanglement-Based Equivariant Learning for Compositional VQA
基于解耦的等变学习用于组合式VQA
Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu
机构
*
IEEE Publication Technology Group(IEEE出版技术组)
;
School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)
;
Engineering Research Center of Sustainable Urban Intelligence Transportation, Ministry of Education, China(可持续智慧城市交通工程研究中心,中华人民共和国教育部)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统(MAIS)国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案
Chun-Yi Kuan, Hung-yi Lee
机构
*
Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所)
;
Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)
机构
*
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
;
Tsinghua University(清华大学)
Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA
双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答
Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su
机构
*
School of Microelectronics, Tianjin University(天津大学微电子学院)
;
Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部)
;
Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室)
;
School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis
基于代理的大型语言模型用于无训练神经放射学图像分析
Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken
机构
*
Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国)
;
Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学)
;
Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学)
;
Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑)
;
Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦)
;
Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)
Good Scores, Bad Data: A Metric for Multimodal Coherence
好分数,坏数据:一种多模态一致性度量
Vasundra Srinivasan
机构
*
AI Architect(人工智能架构师)
;
Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly))
;
Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))
A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering
检索增强医疗问答中检索流程设计的系统研究
Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik
机构
*
Department of Mechatronics & Industrial Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机电与工业工程系)
;
Department of Mechanical Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机械工程系)
Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks
在计算机断层扫描中学习鲁棒的视觉特征以实现临床任务的高效迁移学习
Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang
机构
*
Bioengineering Department and Imperial-X, Imperial College London(帝国理工学院生物工程系与Imperial-X)
;
Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)
;
Oncology Data Analytics Program, Catalan Institute of Oncology(加泰罗尼亚肿瘤研究所肿瘤数据分析项目)
;
Colorectal Cancer Group, ONCOBELL Program, Institut d’Investigació Biomèdica de Bellvitge(贝尔维特奇生物医学研究所ONCOBELL项目结直肠癌研究组)
;
Consortium for Biomedical Research in Epidemiology and Public Health(流行病学与公共卫生生物医学研究联盟)
;
Department of Clinical Sciences, Faculty of Medicine and Health Sciences, Universitat de Barcelona(巴塞罗那大学医学与健康科学学院临床科学系)
;
Institute of Complex Systems, University of Barcelona(巴塞罗那大学复杂系统研究所)
;
National Heart and Lung Institute, Imperial College London(帝国理工学院国家心肺研究所)
;
Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心)
;
School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理
Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li
机构
*
National University of Singapore(新加坡国立大学)
;
Nanjing University(南京大学)
;
Tongji University(同济大学)
;
Ruijin Hospital(瑞金医院)
;
Technical University of Munich(慕尼黑工业大学)
;
Zhejiang University(浙江大学)
机构
*
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
;
Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科)
;
Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)
UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark
无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准
Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang
机构
*
Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国)
;
University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国)
;
Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国)
;
Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
FCMBench: 首个大规模金融信用多模态基准用于实际应用
Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen
机构
*
AI Lab, Qifu Technology(奇富科技AI实验室)
;
College of Future Information Technology, Fudan University(复旦大学未来信息学院)
;
School of Future Technology, South China University of Technology(华南理工大学未来技术学院)
;
Pazhou Lab(琶洲实验室)