Evolutionary Strategies lead to Catastrophic Forgetting in LLMs
进化策略导致大语言模型中的灾难性遗忘
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 进化策略在大语言模型训练中导致灾难性遗忘,尽管性能接近GRPO,但持续学习能力受限。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
进化策略导致大语言模型中的灾难性遗忘
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 进化策略在大语言模型训练中导致灾难性遗忘,尽管性能接近GRPO,但持续学习能力受限。
显式多头注意力机制用于大语言模型中头间的交互
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。
探索与利用:通过截断、熵和虚假奖励重新思考RLVR
机构 * Columbia(哥伦比亚大学) ; CUHK SZ(香港大学) ; DAMO, Alibaba US(阿里云实验室) ; NYU Stern(纽约大学 Stern 学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。
Comments Accepted by ICLR 2026
谱logit雕刻:一种自适应低秩logit变换用于受控文本生成
机构 * Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江学院) ; Hangzhou Dianzi University(杭州电子科技大学) ; People’s Public Security University of China(中国人民公安大学) ; Guangzhou University(广州大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SLS通过自适应低秩logit变换优化文本生成,提升输出分布的尖锐度并保持上下文一致性。
Comments Accepted by IEEE ICASSP 2026
SCSimulator: 一种基于LLM驱动多智能体模拟的供应链伙伴选择探索性可视化分析框架
专题命中 数学推理 :reasoning(abstract);CoT(abstract)
AI总结 SCSimulator通过LLM驱动的多智能体模拟与人机协作,探索供应链伙伴选择的动态博弈,提供透明的决策解释和可交互的分析工具。
Comments ACM IUI 2026
Transformer 中的错误模型
机构 * International Centre for Theoretical Sciences, Tata Institute of Fundamental Research, Bengaluru, India(理论科学国际研究中心,印度塔塔基础研究研究所,班加罗尔) ; Google Deepmind, Bengaluru, India(谷歌DeepMind,班加罗尔)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种Transformer错误模型,通过双参数关系解释任务复杂度与准确性的关系,并展示了如何通过提示减少错误率。
Comments 8+17pages
迈向大规模语言模型后训练的统一视角
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; WeChat AI Code(微信AI代码)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。
SuS:基于策略的惊喜用于内在探索
机构 * Higher School of Economics(俄罗斯高等经济学院) ; AI Talent Hub(人工智能人才中心) ; ITMO University(ITMO大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SuS通过结合策略稳定性与策略惊喜,提升强化学习中探索的准确性和多样性,实现显著性能提升。
Comments 8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus
具有价值意识的数值表示用于Transformer语言模型
机构 * National University of Science and Technology(科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。
通过模块化参数定位实现能力迁移与恢复
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ACT通过激活差异局部化能力相关通道,实现能力迁移与恢复,提升多语言数学和科学推理性能。
分布清晰度:大型语言模型中RL友好性的隐藏驱动因素
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Baidu Inc(百度公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。
注意力是扩散大语言模型中KV缓存的所有需求
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Elastic-Cache方法,通过适应性缓存更新提升扩散LLM的解码效率和生成质量。
Comments Code at: https://github.com/VILA-Lab/Elastic-Cache
haystack中隐藏的针:更小的针对LLM来说更难找到
机构 * Center for Alzheimer’s Disease and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国家卫生研究院) ; DataTecnica LLC(DataTecnica公司) ; Johns Hopkins University(约翰霍普金斯大学) ; Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国家卫生研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了黄金上下文大小对LLM长上下文问答性能的影响,发现较短的黄金上下文会显著降低模型性能,揭示了上下文长度对模型表现的关键作用。
Comments Under Review
Astra:一种用于GPU内核性能优化的多智能体系统
机构 * Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学)
专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Astra是首个基于LLM的多智能体系统,用于优化GPU内核性能,通过协作生成高效内核并实现显著加速。
受最小人类监督引导的自演化大语言模型
机构 * Tencent AI Lab in Seattle(西雅图腾讯AI实验室) ; Washington University in St. Louis(斯托克维尔华盛顿大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 R-Few通过引入轻量级人类监督,实现稳定可控的自演化大语言模型,提升数学推理性能并减少对大量人类数据的依赖。
软适应策略优化
机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * AMD
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Intelligent Machines, HFIPS, Chinese Academy of Sciences(中国科学院智能机械研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Sydney(悉尼大学) ; Anhui Disaster Warning & Agrometeorological Information Center(安徽省灾害预警与农业气象信息中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2025
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Academy of Medical Engineering and Translational Medicine, Tianjin University(医学工程与转化医学学院,天津大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2025 accepted paper
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Birmingham, United Kingdom(英国伯明翰大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Databricks(Databricks公司) ; Google DeepMind(谷歌DeepMind) ; UC Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * School of Computing and Information(计算与信息学院) ; University of Pittsburgh(匹兹堡大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Main 2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments MRL Workshop at EMNLP 2025
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Duke University(杜克大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Raghav Singhal and Kaustubh Ponkshe contributed equally to this work
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint
机构 * FAIR at Meta(Meta 的 FAIR) ; Meta
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint. Under Review