SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
SAGE: 通过塑造锚点引导LLMs的RLVR探索
机构 * KAIST(韩国科学技术院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。
Comments Preprint
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SAGE: 通过塑造锚点引导LLMs的RLVR探索
机构 * KAIST(韩国科学技术院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。
Comments Preprint
LightTransfer: 你的长上下文LLM实际上是一个具有轻松适应能力的混合模型
机构 * Singapore Management University(新加坡国立大学) ; National University of Singapore(新加坡国立大学) ; Sea AI Lab, Singapore(新加坡海智实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LightTransfer方法,通过将LLaMA等模型转换为混合架构,实现更高效的生成,实验表明在长上下文理解任务中,即使有半数层被识别为懒层,也能在性能损失小于1.5%的情况下提升2.17倍的吞吐量,并在数学基准AIME24上达到53.3%的分数。
Comments Accepted by TMLR 2025
D$^2$Evo: 双重难度感知的自进化方法用于数据高效的强化学习
机构 * Zhejiang University(浙江大学) ; AMAP, Alibaba Group(AMAP,阿里巴巴集团)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出D$^2$Evo方法,通过双重难度感知的自进化机制,解决强化学习中有效数据稀缺和动态难度变化的问题,从而在数学推理基准上以少于2K真实数学样本实现优于现有方法的性能。
Comments Accepted by ICML 2026. First two authors contributed equally
对抗蒸馏指纹
机构 * Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) ; University of Maryland, College Park, MD, USA(马里兰大学学院市分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出对抗蒸馏指纹方法,通过代理模型识别并采样最大化指纹检测性的token,提升检测效果同时减少对模型性能的影响。
Comments 28 pages, 13 figures, ICML 2026
通过随机选择的少样本引导提升可验证奖励的强化学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出FEST算法,通过随机选择的少样本引导提升可验证奖励的强化学习,仅需128个演示即可获得优于基线的结果,关键在于监督信号、在线信号和衰减权重。
Comments 25 pages, 11 figures
基于查询的测试时自我训练用于大语言模型
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) ; Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。
Comments 17 pages, 7 figures
GEAR:通过自蒸馏实现的粒度自适应优势重加权用于LLM智能体
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GEAR通过自蒸馏获取token和片段级信号,实现粒度自适应的优势重加权,提升长时间跨度任务中的智能体性能,实验表明在数学推理和工具使用任务中优于传统方法。
基于模板的数据生成训练和评估语言模型
机构 * University of California Los Angeles(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。
Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath
fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习
机构 * OPPO AI Center(OPPO人工智能中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。
双通道模型:并行语言模型之间双向隐藏状态耦合
机构 * AWS Agentic AI(AWS智能AI)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出双通道模型,通过可训练的神经接口在两个预训练语言模型的中间隐藏状态之间建立双向耦合,实现任务驱动与工具执行的协同,提升多任务性能。
Comments 9 pages main text, 5 figures, 24 pages appendix
不对称优势调制校准RLVR中的熵动态
机构 * North Carolina State University(北卡罗来纳州立大学) ; Case Western Reserve University(凯斯西储大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。
高效估计用于任务归因的核替代模型
机构 * Northeastern University(东北大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。
Comments 27 pages. Appeared in ICLR 2026
KL 为 KL:带有控制变量基线的在线蒸馏
机构 * Graduate School of Data Science(数据科学研究生院) ; Seoul National University(首尔国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。
H-Probes:从语言模型的潜在表示中提取层次结构
机构 * Supervised Program for Alignment Research(对齐研究监督计划) ; Yale University(耶鲁大学) ; Harvard University(哈佛大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 H-Probes通过线性探针从语言模型的潜在表示中提取层次结构,揭示模型在语法、概念及推理过程中的深层抽象能力。
Bolzano:大语言模型辅助数学研究的案例研究
机构 * Computer Science Institute, Charles University(查尔斯大学计算机科学研究所) ; Institute of Mathematics, Czech Academy of Sciences(捷克科学院数学研究所) ; Institute of Formal and Applied Linguistics, Charles University(查尔斯大学形式与应用语言学研究所) ; Department of Applied Mathematics, Charles University(查尔斯大学应用数学系)
专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过八个数学和理论计算机科学问题,展示Bolzano系统如何通过多代理交互生成可发表的研究成果,其中五项几乎完全自主完成。
Comments 33 pages, 1 figure. Project page: https://bolzano.app
EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化
机构 * Peking University(北京大学) ; Fudan University(复旦大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。
刻画模型内禀技能
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出模型内禀技能的刻画方法,通过从序列激活中恢复紧凑正交基,实现行为变化轴的自组织,验证了在推理和安全对齐中的有效性,优于人类定义的技能。
Comments We argue that when the goal is to intervene on model behavior, skill characterization should be *model-native*: grounded in the model's own representations rather than imposed through external ontologies
Countdown-Code:研究RLVR中奖励黑客现象涌现与泛化的测试平台
机构 * University of Michigan(密歇根大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Countdown-Code测试环境,通过分离代理奖励与真实奖励,研究LLM在监督微调中无意学习奖励黑客行为及其在强化学习中的泛化问题。
重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; StepFun Inc(StepFun公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。
Comments 16 pages, 4 figures
金字塔MoA:一种用于成本优化的任何时间推断概率框架
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Pyramid MoA框架,通过概率方法优化任何时间推断,实现高效查询路由和计算节省。
Comments 12 pages, 6 figures, 4 tables. v3: corrected router direction, added multi-benchmark context-aware escalation analysis, added Dean & Boddy and Horvitz citations
QED-Nano:用小型模型证明难题定理
机构 * CMU(卡内基梅隆大学) ; Hugging Face ; ETH Zurich(苏黎世联邦理工学院) ; Project Numina
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。
复杂损失函数是否必要用于教LLM进行推理?
机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。
TARo: 令牌级自适应路由用于大语言模型测试时间对齐
机构 * Meta ; University of Pittsburgh(匹兹堡大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。
通过神经细胞自动机训练语言模型
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过神经细胞自动机生成合成非语言数据,提升语言模型的预训练效果和推理能力。
Comments Website: https://hanseungwook.github.io/blog/nca-pre-pre-training/
KV缓存变换编码用于LLM推理中的紧凑存储
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。
Comments Accepted to ICLR 2026
两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。
Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/
SAHOO:递归自我改进中高阶优化目标的安全保障
机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) ; AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) ; Google, USA(谷歌) ; Stanford University(斯坦福大学) ; Northeastern University, Seattle, WA, USA(东北大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。
Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures
迈向自主数学研究
机构 * UC Berkeley(伯克利大学) ; Brown University(布朗大学) ; Yonsei University(延世大学) ; Concordia University(Concordia 大学) ; Korea Institute for Advanced Study(韩国高级研究院) ; UC San Diego(圣地亚哥大学) ; Caltech(加州理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Aletheia是一个能够自主生成、验证和修订数学解决方案的代理,展示了AI在数学研究中的应用,包括生成研究论文和解决开放问题。
Comments 42 pages, updated with summary of FirstProof results. Accompanied blog post https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/
DiaBlo: 对角块足以用于微调
机构 * University at Albany, SUNY(纽约州立大学阿尔巴尼分校) ; IBM T. J. Watson Research Center(IBM 汤普逊·杰·沃森研究中心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DiaBlo是一种仅更新模型权重矩阵对角块的参数高效微调方法,通过消除低秩矩阵乘积需求,实现稳定收敛和高效训练。
Comments Accepted by ICLR 2026
一次训练,全部回答:为一次训练成本进行多项预训练实验
机构 * University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; University of Vienna(维也纳大学) ; Faculty of Computer Science(计算机科学学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。
Comments ICLR 2026