arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-02-05 至 2026-02-05 共收录 2
2602.04417 2026-02-05 cs.LG cs.AI

EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习

Lunjun Zhang, Jimmy Ba

机构 * University of Toronto(多伦多大学)

AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00157 2026-02-05 q-bio.QM cs.AI q-bio.BM

ProDCARL: Reinforcement Learning-Aligned Diffusion Models for De Novo Antimicrobial Peptide Design

ProDCARL:用于从头设计抗菌肽的强化学习对齐扩散模型

Fang Sheng, Mohammad Noaeen, Zahra Shakeri

机构 * University of Toronto(多伦多大学)

AI总结 ProDCARL通过强化学习对齐框架,结合扩散模型和序列属性预测器,优化抗菌肽设计,提高预测性能和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏