APTER:基于专家准则的自适应后训练
APTER: Adaptive Post-Training with Expert-Grounded Rubrics
- Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)
机构由 AI 辅助整理,请以论文原文为准。
中文总结 AI 辅助
APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。
中文摘要 AI 辅助
随着大语言模型进入专业领域,它们必须满足领域约束、包含关键证据并提供完整推理,而非仅生成流畅的响应。现有后训练方法通常依赖整体偏好或结果级验证,而近期基于准则的方法往往为每个查询独立生成准则。在数学推理和医学问答等专业领域,此类无约束准则可能遗漏关键要求且在样本间存在差异,阻碍对持续能力缺陷的诊断与针对性修复。我们提出APTER(Adaptive Post-Training with Expert-Grounded Rubrics,基于专家准则的自适应后训练),该框架将结构化领域知识整合至细粒度评估、优化与诊断中,用于专业复杂推理。首先,基于专家准则的准则构建始于领域专家构建的专家准则框架,每个准则代表一项稳定的专业能力;对于每个查询,APTER选择相关准则并将其实例化为与源准则关联的查询级准则,将可复用的专家准则转化为无需参考答案即可执行的查询级监督。其次,自适应后训练将准则判定同时用作优化信号与准则级诊断信号:按准则ID聚合低分判定可揭示持续缺陷,并在强化学习期间触发针对性的监督微调更新。在数学推理和医学问答上的实验显示,APTER在两个领域均取得一致提升,在三代模型中,其使数学和医学的平均性能较对应基础模型分别提升高达15.86和8.04个百分点。代码与准则数据集可在该https链接获取。
英文摘要
As large language models enter professional domains, they must satisfy domain constraints, include critical evidence, and provide complete reasoning rather than merely produce fluent responses. Existing post-training methods often rely on holistic preferences or outcome-level verification, while recent rubric-based methods usually generate rubrics independently for each query. In specialized domains, such unconstrained rubrics may omit critical requirements and vary across samples, hindering the diagnosis and targeted repair of persistent capability deficiencies. We propose APTER (Adaptive Post-Training with Expert-Grounded Rubrics), a framework that integrates structured domain knowledge into fine-grained evaluation, optimization, and diagnosis for specialized complex reasoning. First, expert-grounded rubric construction starts from an expert criteria framework built by domain experts, where each criterion represents a stable professional capability. For each query, APTER selects relevant criteria and instantiates them into query-level rubrics linked to their source criteria, turning reusable expert criteria into executable query-level supervision without reference answers. Second, adaptive post-training uses rubric verdicts as both optimization and criterion-level diagnostic signals. Aggregating low-scoring verdicts by criterion ID reveals persistent deficiencies and triggers targeted supervised fine-tuning updates during reinforcement learning. Experiments on mathematical reasoning and medical question answering show consistent gains across both domains. Across three model generations, APTER improves the mathematics and medical averages over the corresponding base models by up to 15.86 and 8.04 points, respectively. Code and rubric datasets are available at https://github.com/AntDT-APTER/APTER.