EQPO: Equitable Group Relative Policy Optimization for Clinical Reasoning
EQPO: 面向临床推理的公平群体相对策略优化
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 提出EQPO分层强化学习方法,通过自适应重加权样本促进异质临床人群的均衡学习,在7个诊断基准上降低F1标准差43.9%,缩小预测公平差距27.2%。
Comments Accepted as Oral on NeurIPS 2025 GenAI4Health Workshop