Utility-Constrained Policy Optimization
效用约束策略优化
机构 * York University(约克大学) ; Google DeepMind(谷歌DeepMind)
AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。
大厂专区
效用约束策略优化
机构 * York University(约克大学) ; Google DeepMind(谷歌DeepMind)
AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。
当上下文分片到达时的多轮推理:可扩展的分片与记忆增强强化学习
机构 * The University of Melbourne(墨尔本大学) ; Google Research Australia(谷歌澳大利亚研究院)
AI总结 针对多轮对话中信息碎片化导致LLM准确率下降65%的问题,提出通过训练模型维护紧凑滚动记忆而非增长历史来缓解,并引入低成本分片流水线将单轮QA转换为多轮碎片化情节,训练的记忆增强策略显著提升多轮准确率并零样本泛化到更难任务。
后训练的解剖:利用可解释性表征数据并塑造学习信号
机构 * Stanford University(斯坦福大学) ; Google Research(谷歌研究院)
AI总结 提出基于可解释性的数据后训练流程,通过统计假设识别偏好数据中的潜在概念,实现细粒度反馈,减少虚假关联和不良行为。