Learning with Simulators: No Regret in a Computationally Bounded World
与模拟器学习:计算受限世界中的无悔学习
机构 * MIT(麻省理工学院) ; Microsoft Research(微软研究院)
AI总结 提出可模拟过程框架,利用模拟器近似任意复杂依赖的数据分布,恢复VC维误差界,并展示条件采样的统计与计算优势。
Comments To appear at COLT 2026
大厂专区
与模拟器学习:计算受限世界中的无悔学习
机构 * MIT(麻省理工学院) ; Microsoft Research(微软研究院)
AI总结 提出可模拟过程框架,利用模拟器近似任意复杂依赖的数据分布,恢复VC维误差界,并展示条件采样的统计与计算优势。
Comments To appear at COLT 2026
选择与改进:理解推理后训练的机制
机构 * Microsoft Research NYC(微软研究院纽约) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。
LLMs 能更好地捕捉人类判断——使用合适的提示
机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) ; The Ohio State University(俄亥俄州立大学) ; University of Cambridge(剑桥大学) ; University of Chicago(芝加哥大学) ; Microsoft Research(微软研究院)
AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。
GRIP:面向大型多模态模型的反馈引导提示检索
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Bonn(波恩大学) ; Microsoft(微软)
AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。