Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs
注意力谱正则化:无回放的连续多模态大语言模型
Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Sun Yat-sen University(中山大学)
;
Nanyang Technological University(南洋理工大学)
;
Renmin University of China(中国人民大学)
;
Tsinghua University(清华大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
LMU Munich(慕尼黑大学)
;
Harvard University(哈佛大学)
;
University of Cambridge(剑桥大学)
;
Mina AI
;
Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))
Disentanglement-Based Equivariant Learning for Compositional VQA
基于解耦的等变学习用于组合式VQA
Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu
机构
*
IEEE Publication Technology Group(IEEE出版技术组)
;
School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)
;
Engineering Research Center of Sustainable Urban Intelligence Transportation, Ministry of Education, China(可持续智慧城市交通工程研究中心,中华人民共和国教育部)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统(MAIS)国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案
Chun-Yi Kuan, Hung-yi Lee
机构
*
Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所)
;
Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)
机构
*
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
;
Tsinghua University(清华大学)
Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA
双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答
Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su
机构
*
School of Microelectronics, Tianjin University(天津大学微电子学院)
;
Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部)
;
Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室)
;
School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis
基于代理的大型语言模型用于无训练神经放射学图像分析
Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken
机构
*
Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国)
;
Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学)
;
Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学)
;
Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑)
;
Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦)
;
Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)
Good Scores, Bad Data: A Metric for Multimodal Coherence
好分数,坏数据:一种多模态一致性度量
Vasundra Srinivasan
机构
*
AI Architect(人工智能架构师)
;
Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly))
;
Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))