arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

2026-02-02 至 2026-02-02 共收录 4
2601.22966 2026-02-02 cs.CL

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要

Zihan Qiu, Zeyu Huang, Kaiyue Wen, Peng Jin, Bo Zheng, Yuxin Zhou, Haofeng Huang, Zekun Wang, Xiao Li, Huaqing Zhang, Yang Xu, Haoran Lian, Siqi Zhang, Rui Men, Jianwei Zhang, Ivan Titov, Dayiheng Liu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(Qwen团队) University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03757 2026-02-02 cs.LG math.OC

PPO in the Fisher-Rao geometry

在Fisher-Rao几何中使用PPO

Razvan-Andrei Lascu, David Šiška, Łukasz Szpruch

机构 * Center for Advanced Intelligence Project, RIKEN AIP, Japan(日本RIKEN AIP高级智能项目中心) School of Mathematics, University of Edinburgh, UK(爱丁堡大学数学学院) School of Mathematics, University of Edinburgh, UK, The Alan Turing Institute, UK(爱丁堡大学数学学院、英国艾伦·图灵研究所)

AI总结 本文提出Fisher-Rao PPO,通过Fisher-Rao几何改进PPO的理论保证,实现亚线性收敛并增强强化学习的稳定性。

Comments 34 pages; Added section on Natural Policy Gradient. Added numerical experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03534 2026-02-02 cs.CL cs.IT math.IT

Quantifying the perceptual value of lexical and non-lexical channels in speech

量化语音中词义通道和非词义通道的感知价值

Sarenne Wallbridge, Peter Bell, Catherine Lai

机构 * Centre for Speech Technology Research, University of Edinburgh(语音技术研究中心,爱丁堡大学)

AI总结 本文提出了一种通用范式,用于量化语音中非词义信息对对话期望的感知价值,通过准确性和熵减少评估,揭示非词义信息在提升对话预期一致性方面的贡献。

Comments To be published in Interspeech 2023, 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22311 2026-02-02 cs.AI cs.CL cs.LG

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

为何推理无法规划:从规划角度分析LLM代理在长周期决策中的表现

Zehong Wang, Fang Wu, Hongru Wang, Xiangru Tang, Bolian Li, Zhenfei Yin, Yijun Ma, Yiyang Li, Weixiang Sun, Xiusi Chen, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) Yale University(耶鲁大学)

AI总结 本文从规划角度分析LLM代理在长周期决策中的失败原因,提出FLARE方法通过前瞻和价值传播提升规划能力,使LLaMA-8B在多个基准中超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏