Learning to Reason With Relational Abstractions
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2022: Math-AI Workshop
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2021. Code and the MATH dataset is available at https://github.com/hendrycks/math/
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Oxford(牛津大学) ; Princeton University(普林斯顿大学) ; Microsoft AI Frontiers(微软人工智能前沿)
专题命中 数学推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments Preprint, 31 pages, 8 figures, long-horizon reasoning
专题命中 数学推理 :reasoning(abstract,journal_ref);分类 cs.AI、cs.LG
Journal ref J. Automated Reasoning 55(3): 245-256 (2015)
机构 * Arizona State University(亚利桑那州立大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract,comments);分类 cs.CL;planning(comments)
Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs
结构化扰动下语言模型的稳定性与失效行为测量
机构 * NeuroLoft(神经 loft(或:神经实验室))
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出分级多类别失效感知框架,在四类模型上测试七种结构化扰动,发现模型失效层级因类别而异,冲突指令与不可能前提问题是所有模型共有的弱点,此类失效无法被标准准确率检测。
先给出答案,后进行推理:扩散大语言模型中的承诺顺序
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。
LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度
机构 * Peking University(北京大学) ; Meituan(美团)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。
近似投机解码
专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出无需训练的Approximate Speculative Decoding(ASD),通过带预算的最长前缀选择优化投机解码,提升了生成吞吐量与验证器接受率,且无需新草稿模型或微调。
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
SOD:分步式在线蒸馏用于小型语言模型代理
机构 * Zhejiang University(浙江大学) ; Large Language Model Department, Tencent(腾讯大语言模型部门) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。
学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法
机构 * University of Florida(佛罗里达大学) ; UC San Diego(加州大学圣迭戈分校) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; Universität Innsbruck(因斯布鲁克大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。
Comments 14 pages, 2 figures
SAPE:用于大语言模型微调参数效率的三明治适配器
机构 * Qom University of Technology(库姆理工大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。
Comments 16 pages, 4 figures, 10 tables, includes appendix
通过非局部性测量SAE特征的语义抽象性
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。
Comments 18 pages, 9 figures
大型语言模型中数学泛化的融合训练
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。
Comments ACL SRW 2026
失配很重要:超越token一致性的在线蒸馏
机构 * The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。
SR-OPSD:自引用同策略自蒸馏
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Imperial College London(伦敦帝国学院) ; University of Science and Technology of China(中国科学技术大学) ; University College London(伦敦大学学院) ; Nanyang Technological University(南洋理工大学) ; Technical University of Denmark(丹麦技术大学) ; University of Copenhagen(哥本哈根大学) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。
PAST:基于完整学生轨迹的特权适配用于在线策略自蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Sun Yat-sen University(中山大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 PAST将完整学生轨迹作为OPSD教师的额外特权信息,通过前向KL蒸馏等方法优化教师,在三个数学推理基准上使Avg@12宏观平均值较Vanilla OPSD提升5.6个百分点。
代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。
破碎的组合性:变换器在算术中的反直觉学习动态
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) ; Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。
Comments 37 pages, 29 figures
FutureBridge:协作解码中超越局部偏好的令牌选择
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。
IB-RL:用于策略性对话智能体的孤立双边强化学习
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。
IFCLoRA:用于参数高效微调的拓扑感知秩分配
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对LoRA方法中秩分配问题,提出IFCLoRA拓扑感知秩分配方法,利用小校准集和冻结模型构建交互图,结合全局拓扑先验与局部梯度敏感性计算得分来分配秩,在多场景下优于其他方法,还揭示了任务依赖的秩分布特点。
Comments 9 pages, 5 figures
OpenPangu在昇腾NPU上量化的实证研究
机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文在昇腾910B1 NPU上系统评估了OpenPangu 1B和7B模型在多种后训练量化方法下的表现,发现8-bit权重量化无损,4-bit对7B模型可行但对1B模型有显著损害,极低比特量化仍具挑战。
InsightEmb:面向智能体洞察检索的动作-意图嵌入学习
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。
EASy:迈向高效的基于大语言模型的智能体系统
机构 * Monash University(莫纳什大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。
Comments Preprint
用于增强边缘部署小模型的大小模型协作
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。