Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies
偏好目标微调:冻结策略的后训练作为潜在控制
机构 * Peking University(北京大学) ; Tencent AI Lab(腾讯AI实验室)
AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。
大厂专区
偏好目标微调:冻结策略的后训练作为潜在控制
机构 * Peking University(北京大学) ; Tencent AI Lab(腾讯AI实验室)
AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。
SiriusHelper:一种基于LLM代理的大数据平台操作助手
机构 * TEG, Tencent Inc.(腾讯科技(TEG)) ; School of Computer Science, Peking University(北京大学计算机学院)
AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。
G-reasoner:用于统一图结构知识推理的基础模型
机构 * Monash University(莫纳什大学) ; Nanjing University of Science and Technology(南京理工大学) ; Griffith University(格里菲斯大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; NVIDIA(英伟达)
AI总结 G-reasoner通过整合图与语言基础模型,实现对多样化图结构知识的高效推理,采用标准化四层抽象QuadGraph统一异构知识源,并通过混合精度训练和分布式消息传递提升效率与泛化能力。
Comments Accepted by ICLR 2026