TTPO: Test-Time Policy Optimization
TTPO:测试时策略优化
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。
Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)