From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体
AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。
Comments Submitted to ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体
AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。
Comments Submitted to ICML 2026
内部耦合:通过蒸馏的规范化流进行流匹配
AI总结 本文提出规范化流匹配(NFM),通过蒸馏预训练的规范化流模型的耦合来训练学生模型,从而在性能和效率上均优于传统方法。
Comments Submitted to ICML 2026