Efficient Offline Reinforcement Learning: First Imitate, then Improve
高效离线强化学习:先模仿,后改进
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft Research Cambridge(微软研究院剑桥分部)
AI总结 本文提出了一种结合监督学习和离策略强化学习的方法,通过预训练提升离策略算法的效率和稳定性。
高校专区
高效离线强化学习:先模仿,后改进
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft Research Cambridge(微软研究院剑桥分部)
AI总结 本文提出了一种结合监督学习和离策略强化学习的方法,通过预训练提升离策略算法的效率和稳定性。
像大型语言模型一样对齐代理
机构 * School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(爱丁堡大学信息学院) ; Micosoft Research, Cambridge, United Kingdom(微软研究院)
AI总结 本文提出通过像训练大型语言模型一样训练代理,以实现更通用、稳健和对齐的行为,并通过3D视频游戏环境中的概念验证展示方法。
迭代多语言光谱属性擦除
机构 * University of Cambridge(剑桥大学) ; University of Edinburgh(爱丁堡大学) ; NVIDIA Research(NVIDIA研究)
AI总结 IMSAE通过迭代SVD截断在多语言中减轻联合偏见子空间,优于传统单语言和跨语言去偏方法。
Comments Accepted to the main conference of EMNLP 2025