Rethinking the Divergence Regularization in LLM RL
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
大厂专区
重新思考LLM强化学习中的散度正则化
机构 * Tencent Hunyuan(腾讯混元) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学)
AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。
超越回忆的记忆:用于自进化LLM代理的双过程认知记忆系统
机构 * Tencent(腾讯)
AI总结 提出DCPM系统,基于双过程理论将代理记忆组织为认知能力层次,通过同步日间写入器和异步夜间引擎分别处理信念修正和模式归纳,在隐式跨会话推理任务上提升显著。
打破分词器壁垒:跨模型系列的在线策略蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 提出跨分词器在线策略蒸馏方法,通过精确的token映射算法使教师模型概率分布信号能跨不同分词器传播,显著提升计算效率。
Rosetta Memory: 跨LLM智能体的自适应记忆
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Weixin, Tencent(腾讯微信) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 提出记忆中心式LLM自适应方法,通过双轮廓条件算子与最小增益采样课程,解决上游记忆激活下游LLM的跨模型适应问题,在多项QA任务中优于基线。
Comments 19 pages, 7 figures