Test-Time Learning with an Evolving Library
测试时学习与进化库
机构 * Microsoft Research(微软研究院)
AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。
大厂专区
测试时学习与进化库
机构 * Microsoft Research(微软研究院)
AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。
基于表示的语言模型探索:从测试时到训练后
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。
Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io
关于连续 K 最大多臂老虎机的次线性遗憾
机构 * Microsoft Research Asia(微软亚洲研究院) ; Institute for Interdisciplinary Information Sciences(交叉信息院) ; Tsinghua University(清华大学)
AI总结 研究连续K最大多臂老虎机问题,该问题在推荐等应用中出现,有离散化误差等困难。引入DCK - UCB算法,证明其实现了\(\widetilde{O}(T^{3/4})\)遗憾界,还针对特定情况提出MLE - Exp算法,为连续组合老虎机提供了算法解决方案。