On-Policy Context Distillation for Language Models
在线策略上下文蒸馏用于语言模型
机构 * Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
在线策略上下文蒸馏用于语言模型
机构 * Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。
通过领域感知的层选择理解视觉-语言模型中的剪枝规则
机构 * Microsoft AI(微软人工智能)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。
通过否定来实现AI对齐:为什么否定约束在结构上优于积极偏好
机构 * Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了通过否定约束而非积极偏好进行AI对齐的结构优势,提出基于波普尔的证伪逻辑,指出否定信号方法在避免趋炎附势和提升效果上的有效性。
Comments 9 pages, position paper
问答模型中的上下文长度鲁棒性:一项比较实证研究
机构 * Upper Hand ; Ace Rent a Car
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 研究通过SQuAD和HotpotQA基准评估问答模型在上下文长度变化下的鲁棒性,发现多跳推理任务比单跨度提取任务更易受上下文稀释影响。
Comments Accepted for Oral Presentation at Math AI 2026 conference
HorizonMath:通过自动验证衡量AI向数学发现的进步
机构 * University of Oxford(牛津大学) ; Benchmark ; Harvard University(哈佛大学) ; Princeton University(普林斯顿大学) ; Ellison Institute of Technology(Ellison技术研究所)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。
PMAx:一种用于AI驱动流程挖掘的代理框架
机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) ; RWTH Aachen University(亚琛工业大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 PMAx通过隐私保护的多代理架构,使非技术人员能将业务问题转化为可靠流程洞察,避免LLM的确定性推理和隐私泄露问题。
Comments Submitted to EMMSAD 2026 (tool demonstration track), under review
DOS:基于依赖关系的掩码扩散语言模型采样器
机构 * Department of Data Science and AI(数据科学与人工智能系)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。
Comments 16 pages, 5 figures
当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。
混合还是合并:为大语言模型的多领域强化学习而努力
机构 * Samsung Research(三星研究院) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。
上下文强化学习用于大型语言模型中的工具使用
机构 * National University of Singapore(新加坡国立大学) ; Salesforce AI Research(Salesforce AI研究) ; University of California Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。
适应性协作与人类:多智能体大语言模型的元认知策略优化与持续学习
机构 * University of Southern California(南加州大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 HILA框架通过元认知策略优化与持续学习,实现多智能体与人类的协同协作,提升复杂任务处理能力。
查询级不确定性在大语言模型中
机构 * Imperial College London(伦敦帝国学院) ; Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) ; Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) ; Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。
Comments ICLR 2026
Re4: 具有重写、推理、审查和修订的科学计算代理
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 Re4提出一种基于重写、推理、审查和修订机制的科学计算代理,通过协作框架提升代码生成的可靠性与准确性。
Comments 31 pages, 31 figures, Presented at the ICLR 2026 Workshop on AI and Partial Differential Equations (AI&PDE)
FM代理
机构 * Baidu AI Cloud(百度AI云)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 FM代理是一种利用LLM推理和进化搜索的通用多代理框架,能够自主解决复杂问题并达到先进水平。
FrugalRAG: 在多跳问答中少即是多
机构 * Microsoft Research India(微软印度研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。
行为生成代理在能源运营中的应用
机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) ; Graduate School of Business, Stanford University(斯坦福大学商学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。
ParamMem: 通过参数化反思记忆增强语言代理
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 ParamMem通过参数化记忆模块提升语言代理的反思多样性,实现更高效的推理和跨任务迁移能力。
Comments 20 pages
PARL:基于提示的强化学习智能体
机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。
交错头部注意力
机构 * Meta ; UT Austin(德克萨斯大学) ; UC Berkeley(伯克利大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 交错头部注意力通过构造伪头实现跨头混合,提升多步推理效率,在多项式任务和顺序敏感任务中参数效率提高,实测在RULER和OpenThoughts上取得显著提升。
验证大语言模型生成数学解的管道
机构 * Moscow State University(莫斯科国立大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出了一种验证大语言模型数学解的管道,通过提示生成特定形式的解以提高验证准确性,并提供开源实现。
ATTS: 通过置信预测实现异步测试时间扩展
机构 * The University of Hong Kong(香港大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; University College London(伦敦大学学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 ATTS通过异步测试时间扩展方法,在保持精度的同时实现测试时间扩展的显著加速和吞吐量提升。
Comments Accepted by ICLR 2026
TROLL:通过信任区域改进大型语言模型的强化学习
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 TROLL通过引入基于信任区域的离散可微投影,改进了大型语言模型的强化学习训练,提升了训练速度、稳定性和最终成功率。
Comments Published as a conference paper at ICLR 2026
MathScape:在现实数学情境中评估多模态大语言模型
机构 * Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nankai University(南开大学) ; Beijing Institute of Technology(北京理工大学) ; Baichuan Inc.(百度文心)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。
MentalBlackboard: 通过数学变换评估空间可视化能力
机构 * Arizona State University(亚利桑那州立大学)
专题命中 数学推理 :planning(abstract);分类 cs.LG
AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。
对LLM代理轨迹进行水印标记
机构 * Zhejiang University, China(浙江大学) ; University of Virginia, USA(弗吉尼亚大学) ; Alibaba Qwen, China(阿里巴巴通义实验室) ; University of Alberta, Canada(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。
Comments 20 pages, 9 figures
MerLean:一个用于量子计算自动形式化的代理框架
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Northeastern University(东北大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 MerLean通过自动化形式化框架将量子计算论文中的数学语句转化为Lean代码并回译为可读格式,实现端到端验证,为同行评审和合成数据训练提供实用工具。
通过自然语言反馈提升交互式上下文学习
机构 * Google DeepMind(谷歌DeepMind)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。
LACONIC:面向LLM的长度感知约束强化学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce AI研究院) ; National University of Singapore(新加坡国立大学) ; University of Alberta(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。
R-Diverse: 缓解自博弈LLM训练中的多样性幻觉
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Wuhan AI Research(武汉人工智能研究所) ; National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。
离散共轭匹配
机构 * Massachusetts Institute of Technology(麻省理工学院) ; FAIR at Meta(Meta 的 FAIR)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。
Comments ICLR 2026