2607.13399 2026-07-16 cs.CL cs.LG 新提交 Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations 揭开在线策略蒸馏的神秘面纱:作用、问题及调控 Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong 机构 * The Chinese University of Hong Kong(香港中文大学) ; Tencent AI Lab(腾讯人工智能实验室) 纠错 AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.13285 2026-07-16 cs.AI cs.SE 新提交 Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性 Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang 机构 * Tencent(腾讯) ; Indiana University(印第安纳大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Georgia(佐治亚大学) ; National University of Singapore(新加坡国立大学) 纠错 AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。 Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/ 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图