arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-02-10 至 2026-02-10 共收录 8
2602.08808 2026-02-10 cs.LG

How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs

How2Everything: 从网络挖掘如何操作指南以评估和改进大语言模型

Yapei Chang, Kyle Lo, Mohit Iyyer, Luca Soldaini

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Maryland(马里兰大学) University of Washington(华盛顿大学)

AI总结 How2Everything通过从网络挖掘操作指南,构建评估集并利用强化学习提升模型性能,实现大规模的能力评估与改进闭环。

Comments 53 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08372 2026-02-10 cs.LG math.OC

Dynamic Regret via Discounted-to-Dynamic Reduction with Applications to Curved Losses and Adam Optimizer

通过折扣到动态的还原实现动态后悔,应用于曲面损失和Adam优化器

Yan-Feng Xie, Yu-Jie Zhang, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) School of Artificial Intelligence(人工智能学院) University of Washington(华盛顿大学)

AI总结 本文通过折扣到动态的还原方法,改进了FTRL相关问题的动态后悔界,并应用于曲面损失和Adam优化器,获得了非凸非光滑设置下的最优收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15586 2026-02-10 cs.CL

Bolmo: Byteifying the Next Generation of Language Models

Bolmo:字节化下一代语言模型

Benjamin Minixhofer, Tyler Murray, Tomasz Limisiewicz, Anna Korhonen, Luke Zettlemoyer, Noah A. Smith, Edoardo M. Ponti, Luca Soldaini, Valentin Hofmann

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Edinburgh(爱丁堡大学)

AI总结 Bolmo通过两阶段转换将现有子词模型转换为字节级模型,实现性能和细粒度理解的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07848 2026-02-10 cs.LG

MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation

MARTI-MARS$^2$:通过强化学习实现多智能体自搜索的扩展用于代码生成

Shijie Wang, Pengfei Li, Yikun Fu, Kaifeng Liu, Fangyuan Li, Yang Liu, Xiaowei Sun, Zonglin Li, Siyao Zhao, Jian Zhao, Kai Tian, Dong Li, Junqi Gao, Yutong Zhang, Yiqun Chen, Yuqiang Li, Zoe Li, Weinan Zhang, Peng Ye, Shuyue Hu, Lei Bai, Bowen Zhou, Kaiyan Zhang, Biqing Qi

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation(自动化研究所) Fudan University(复旦大学) High School Affiliated to Fudan University(复旦大学附属高中) Renmin University of China(中国人民大学) University of Washington(华盛顿大学)

AI总结 MARTI-MARS2通过多智能体强化学习实现代码生成的扩展,突破单智能体限制,提升性能和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07845 2026-02-10 cs.RO

Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning

递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展

Yalcin Tur, Jalal Naghiyev, Haoquan Fang, Wei-Chuan Tsai, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * Stanford University(斯坦福大学) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。

Comments 11 Pages, Project page:https://rd-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07061 2026-02-10 stat.ML cs.LG

Local EGOP for Continuous Index Learning

连续索引学习的局部EGOP

Alex Kokot, Anand Hemmady, Vydhourie Thiyageswaran, Marina Meila

机构 * Department of Statistics, University of Washington(华盛顿大学统计学系) Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院)

AI总结 本文提出局部EGOP学习算法,用于连续索引学习,通过适应局部变化子空间提升高维噪声下的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07205 2026-02-10 cs.LG cs.GT stat.ML

Online Learning for Uninformed Markov Games: Empirical Nash-Value Regret and Non-Stationarity Adaptation

在线学习无信息马尔可夫游戏:经验纳什价值遗憾与非平稳适应

Junyan Liu, Haipeng Luo, Zihan Zhang, Lillian J. Ratliff

机构 * University of Washington(华盛顿大学) University of Southern California(南加州大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出了一种参数无关算法,通过经验纳什价值遗憾度量,在对手非平稳性适应下实现O(min{√K + (CK)^{1/3},√LK})的遗憾界。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏