arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-08-25 至 2026-08-25 共收录 4
2608.19197 2026-08-25 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15454 2026-08-25 cs.AI 版本更新

Dynamic Multi-Byte Prediction With Hierarchical Language Models

基于分层语言模型的动态多字节预测

Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

AI总结 本文针对分层语言模型逐字节生成推理速度慢的问题,提出多字节预测方法,通过可变长度预测窗口与因果注意力掩码实现并行字节预测,在多任务中达成性能与吞吐量的最优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16532 2026-08-25 cs.LG econ.GN 版本更新

Boundedly Rational Meta-Learning in Sequential Consumer Choice

有界理性元学习在序列消费者选择中的应用

Mehrzad Khosravi, Max Kleiman-Weiner, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

AI总结 研究消费者在不确定环境下重复选择时的跨情境知识转移,提出有界理性元动态规划政策BRMDP(D),发现消费者通过粗略的先验不确定性表示实现跨情境学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06926 2026-08-25 stat.ML cs.LG stat.ME 版本更新

Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference

用于长期因果推断的半参数双重强化学习

Lars van der Laan, David Hubbard, Allen Tran, Nathan Kallus, Aurélien Bibaut

机构 * Department of Statistics, University of Washington, USA(华盛顿大学统计系) Netflix Research, USA(Netflix研究) Cornell Tech, Cornell University, USA(康奈尔科技学院、康奈尔大学)

AI总结 该研究针对长期因果推断中双重强化学习的不稳定问题,提出半参数双重强化学习方法,推导相关效率界并构建鲁棒估计量,可提升推断效率。

Comments 84 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏