EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL
EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习
机构 * University of Toronto(多伦多大学)
AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现
高校专区
EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习
机构 * University of Toronto(多伦多大学)
AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现
ProDCARL:用于从头设计抗菌肽的强化学习对齐扩散模型
机构 * University of Toronto(多伦多大学)
AI总结 ProDCARL通过强化学习对齐框架,结合扩散模型和序列属性预测器,优化抗菌肽设计,提高预测性能和多样性。