发表机构
HKUST(GZ); HKUST; Xiaohongshu Inc.; WeChat, Tencent; CUHK; AI Robotics(香港科技大学(广州); 香港科技大学; 小红书公司; 腾讯微信; 香港中文大学; 人工智能机器人)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。
AI 中文摘要
基础模型的后训练通常依赖人类标签、偏好数据、更强的教师模型或可执行验证器。我们研究无监督后训练(UPT):对未标记输入进行带更新的适配,其学习信号源自同谱系的模型产物而非外部权威。我们梳理了80种严格的UPT方法,并按提供更新信号的对象分类:预测统计量、样本关系、自生成目标或内部评估器。除了梳理,我们还表明内部信号和任务结构的选择决定了后训练是提升模型还是递归放大误差。正交的输入可见性×更新持续性视角映射了部署场景,并为UPT的选择与评估定义了统一框架。
英文摘要
Foundation-model post-training usually relies on human labels, preference data, stronger teachers, or executable verifiers. We study Unsupervised Post-Training (UPT): update-bearing adaptation on unlabeled inputs whose learning signal is derived from same-lineage model artifacts rather than an external oracle. We catalog 80 strict UPT methods and organize them by the object that supplies the update signal: a prediction statistic, a sample relation, a self-generated target, or an internal evaluator. Beyond inventory, we show how the choice of internal signal and task structure determines whether post-training improves the model or recursively amplifies error. An orthogonal Input Visibility $\times$ Update Persistence view maps deployment regimes and defines a unified framework for UPT selection and evaluation.
CommentsAccepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables