AI 中文总结
研究旨在通过人在回路的大语言模型框架检测皮肤免疫相关不良事件,采用检索增强等方法,相比人工审查提高了准确性、一致性并缩短审查时间,还试点了大语言模型在跨器官系统识别免疫毒性及数据提取方面的应用。
AI 中文摘要
本研究评估了一种检索增强、多智能体大语言模型驱动、人在回路的框架,用于从临床记录中检测皮肤免疫相关不良事件(cirAEs)。与无辅助人工审查相比,大语言模型辅助工作流程提高了准确性(F1 = 0.88 对 0.77)、科恩kappa系数衡量的评分者间一致性(kappa = 0.82 对 0.50),并将平均审查时间减少了约一半。该框架试点了大语言模型如何应用于识别跨器官系统的免疫相关毒性,更广泛地说,实现准确、可扩展和透明的不良事件数据提取。
英文摘要
This study evaluated a retrieval-augmented, multi-agent large language model (LLM)-driven, human-in-the-loop framework for detecting cutaneous immune-related adverse events (cirAEs) from clinical notes. Compared with unassisted manual review, the LLM-assisted workflow improved accuracy (F1 = 0.88 vs 0.77), inter-rater agreement measured by Cohen's kappa (kappa = 0.82 vs 0.50), and reduced average review time by approximately half. This framework pilots how LLMs can be applied to identify immune-related toxicities across organ systems and, more broadly, enable accurate, scalable, and transparent adverse event data extraction.