Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings
多站点听诊录音的患者级多模态问答
机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) ; Eindhoven University of Technology(埃因霍温理工大学) ; Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) ; Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) ; Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)
专题命中 多模态评测 :multimodal(title);分类 cs.AI、eess.AS
AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。