Rethinking the Divergence Regularization in LLM RL
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
大厂专区
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
超越回忆的记忆:用于自进化LLM代理的双过程认知记忆系统
机构 * Tencent(腾讯)
AI总结 提出DCPM系统,基于双过程理论将代理记忆组织为认知能力层次,通过同步日间写入器和异步夜间引擎分别处理信念修正和模式归纳,在隐式跨会话推理任务上提升显著。
打破分词器壁垒:跨模型系列的在线策略蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出跨分词器在线策略蒸馏方法,通过精确的token映射算法使教师模型概率分布信号能跨不同分词器传播,显著提升计算效率。
Rosetta Memory: 跨LLM智能体的自适应记忆
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Weixin, Tencent(腾讯微信) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 提出记忆中心式LLM自适应方法,通过双轮廓条件算子与最小增益采样课程,解决上游记忆激活下游LLM的跨模型适应问题,在多项QA任务中优于基线。
Comments 19 pages, 7 figures
探索用于模型专业化的自主智能体数据工程
机构 * Zhejiang University(浙江大学) ; Platform and Content Group, Tencent(腾讯平台与内容部)
AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。
Comments Work in progress
通过奖励倾斜分布匹配增强少步生成器
机构 * Tencent Hunyuan(腾讯文英) ; Hong Kong University of Science and Technology(香港科技大学) ; Westlake University(西湖大学)
AI总结 提出奖励倾斜分布匹配蒸馏(RTDMD)两阶段框架,结合分布匹配蒸馏与奖励引导强化学习,在仅4步推理下实现文本到图像生成的最新性能。
Comments Code and models are available at https://github.com/Harahan/RTDMD