arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-02-02 至 2026-02-02 共收录 3
2601.22311 2026-02-02 cs.AI cs.CL cs.LG

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

为何推理无法规划:从规划角度分析LLM代理在长周期决策中的表现

Zehong Wang, Fang Wu, Hongru Wang, Xiangru Tang, Bolian Li, Zhenfei Yin, Yijun Ma, Yiyang Li, Weixiang Sun, Xiusi Chen, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) Yale University(耶鲁大学)

AI总结 本文从规划角度分析LLM代理在长周期决策中的失败原因,提出FLARE方法通过前瞻和价值传播提升规划能力,使LLaMA-8B在多个基准中超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17965 2026-02-02 math.OC cs.LG stat.ML

Bias-Optimal Bounds for SGD: A Computer-Aided Lyapunov Analysis

SGD的偏差最优界限:一种计算机辅助的李雅普诺夫分析

Daniel Cortild, Lucas Ketels, Juan Peypouquet, Guillaume Garrigos

机构 * University of Oxford(牛津大学) University of Groningen(格罗宁根大学) Université Paris Cité and Sorbonne Université(巴黎大学与索邦大学)

AI总结 本文通过计算机辅助的李雅普诺夫分析,推导出SGD在偏差最优意义上的收敛界限,适用于常数步长范围,包括之前未探索的临界和大步长区域。

Comments 35 pages, 2 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07656 2026-02-02 cs.LG cs.AI

Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding

在专家可观测和专家不可观测混杂下的因果模仿学习

Daqian Shao, Thomas Kleine Buening, Marta Kwiatkowska

机构 * Department of Computer Science, University of Oxford, UK(计算机科学系,牛津大学) ETH Zurich, Switzerland(苏黎世联邦理工学院)

AI总结 本文提出DML-IL算法,通过工具变量回归解决因果模仿学习中的隐藏混杂问题,并在连续状态-动作环境中优于现有基线方法。

Comments Proceedings of the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏