arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-07-24 至 2026-07-24 共收录 2
2607.21120 2026-07-24 cs.LG cs.AI 新提交

Relative Value Learning

相对价值学习

Marc Höftmann, Jan Robine, Stefan Harmeling

AI总结 研究提出相对价值学习框架,通过反对称函数学习价值差异,引入成对贝尔曼算子并推导相关目标及估计器,将其与PPO集成,在Atari基准测试中取得有竞争力性能,证明相对价值估计可替代绝对评论家。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏