Relative Value Learning
相对价值学习
AI总结 研究提出相对价值学习框架,通过反对称函数学习价值差异,引入成对贝尔曼算子并推导相关目标及估计器,将其与PPO集成,在Atari基准测试中取得有竞争力性能,证明相对价值估计可替代绝对评论家。
Comments Published as a conference paper at ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
相对价值学习
AI总结 研究提出相对价值学习框架,通过反对称函数学习价值差异,引入成对贝尔曼算子并推导相关目标及估计器,将其与PPO集成,在Atari基准测试中取得有竞争力性能,证明相对价值估计可替代绝对评论家。
Comments Published as a conference paper at ICLR 2026
训练用于自解释忠实性的大语言模型
机构 * Imperial College London(帝国理工学院)
AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。
Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)
Gumbel Distillation用于并行文本生成
机构 * Department of Computer Science(计算机科学系)
AI总结 本文提出Gumbel Distillation技术,通过Gumbel-Max技巧使并行解码器有效学习token序列的联合分布,提升生成质量,在LM1B和OpenWebText数据集上取得显著改进。
Comments ICLR 2026
具有自适应Bregman步长的快速Frank-Wolfe算法用于弱凸函数
AI总结 本文提出了一种适用于弱凸函数的快速Frank-Wolfe算法,通过自适应Bregman步长策略实现更宽松的收敛保证和更快的收敛速度。
Comments ICLR2026 camera-ready version; 38 pages, 10 figures
Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026
SESaMo:用于归一化流的对称强制随机调制
AI总结 研究聚焦深度生成模型中从未归一化类玻尔兹曼分布采样的挑战。核心方法是引入SESaMo,通过随机调制将对称性等归纳偏差纳入归一化流。主要贡献是增强生成模型灵活性,能学习多种对称性,并在多场景下进行了数值实验验证。
Comments 29 pages, 14 figures
Journal ref ICLR 2026