arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

1809.02031 2018-09-07 cs.AI 74%

Planning with Arithmetic and Geometric Attributes

David Folqué, Sainbayar Sukhbaatar, Arthur Szlam, Joan Bruna

专题命中 数学推理 :planning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-08-25 cs.CL cs.AI 版本更新 73%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16627 2026-08-18 cs.CL cs.AI 新提交 73%

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑工业大学) MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02621 2026-08-12 cs.CL cs.LG 版本更新 73%

Reinforcement Learning-based Semi-supervised Knowledge Distillation with LLM-as-a-Judge

基于强化学习的知识蒸馏与大语言模型作为评判者

Yiyang Shen, Lifu Tu, Weiran Wang

机构 * University of Iowa(爱荷华大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 73%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15178 2026-07-20 cs.CL cs.AI 版本更新 73%

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

T^2MLR:具有时间中层循环的Transformer

Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05184 2026-07-07 cs.AI cs.LG 新提交 73%

Rethinking On-Policy Self-Distillation for Thinking Models

重新思考思维模型的在线策略自蒸馏

Simran Kaur, Narutatsu Ri, Yinghui He, Liam Fowl, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Princeton Language and Intelligence(普林斯顿语言与智能实验室)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 73%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交 73%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26744 2026-06-26 cs.LG cs.CL 新提交 73%

HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction

HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减

Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu

机构 * ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07079 2026-06-16 cs.LG cs.CL 版本更新 73%

Entropy-Aware On-Policy Distillation of Language Models

熵感知的在线策略蒸馏语言模型

Woogyeol Jin, Taywon Min, Yongjin Yang, Dennis Wei, Yi Zhou, Swanand Ravindra Kadhe, Nathalie Baracaldo, Kimin Lee

机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。

Comments 18 pages, 11 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07515 2026-06-12 cs.CL cs.AI cs.HC math.PR 新提交 73%

How reliable are LLMs when it comes to playing dice?

LLM 在掷骰子时有多可靠?

Luca Avena, Gianmarco Bet, Bernardo Busoni

机构 * Università degli Studi di Firenze(佛罗伦萨大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过离散概率问题基准测试,发现 LLM 在标准问题上准确率 0.96,但在反直觉问题上仅 0.59,且存在 token 偏差和误导提示的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10768 2026-06-10 cs.LG cs.CL 新提交 73%

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

N-GRPO:嵌入级邻居混合增强策略优化

Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。

Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09932 2026-06-10 cs.LG cs.AI 新提交 73%

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接

Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26099 2026-06-08 cs.CL cs.AI 版本更新 73%

Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

语言模型需要睡眠吗?用于改进在线推理的离线循环

Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种类似睡眠的巩固机制,通过离线循环将上下文转换为快速权重,以解决Transformer注意力机制随上下文长度扩展性差的问题,并在合成任务和数学推理任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15158 2026-06-04 cs.LG cs.AI 73%

Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data

基于结果的强化学习可证明地引导Transformer进行推理,但仅在合适的数据条件下

Yuval Ran-Milo, Yotam Alexander, Shahar Mendel, Nadav Cohen

机构 * Tel Aviv University(特拉维夫大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析单层Transformer在合成图遍历任务上的策略梯度动力学,证明了基于结果的强化学习能够使Transformer自发学习出结构化的迭代推理算法,并揭示了训练数据中“简单示例”的分布对推理能力涌现的关键作用。

Comments 94 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02859 2026-06-03 cs.CL cs.AI cs.MA 73%

Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions

思维经济:具有经济交互的涌现多智能体智能

Zhenting Qi, Huangyuan Su, Ao Qu, Chenyu Wang, Yu Yao, Han Zheng, Kushal Chattopadhyay, Guowei Xu, Zihan Wang, Weirui Ye, Vijay Janapa Reddi, Ju Li, Paul Pu Liang, Himabindu Lakkaraju, Sham Kakade, Yilun Du

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 受哈耶克经济理论启发,通过拍卖和财富积累的简单经济信号实现去中心化信用分配,使弱智能体群体涌现出多步推理策略,在五个智能体任务中超越强单体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25143 2026-06-02 cs.AI cs.LG 73%

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

超越前沿:用于高效测试时扩展的随机回溯

Dao Tran, Duc Anh Le, Ngoc Luu, Quan Pham, Tung Pham, Hung Bui

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12652 2026-06-02 cs.LG cs.AI 73%

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

基于同伴成功与失败的多轨迹在线策略蒸馏

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Purdue University(普渡大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26606 2026-05-27 cs.LG cs.AI 73%

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

将你的展开用在关键处:基于组强化学习后训练的展开分配

Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

机构 * Cornell University(康奈尔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出 Pilot-Commit 框架,通过预算感知的展开分配策略,优先将计算资源分配给高信息量的提示,从而在组策略优化中减少采样成本并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25198 2026-05-26 cs.LG cs.AI 73%

Hide to Guide: Learning via Semantic Masking

隐藏以引导:通过语义掩码学习

Ruitao Liu, Qinghao Hu, Alex Hu, Yecheng Wu, Shang Yang, Luke J. Huang, Zhuoyang Zhang, Han Cai, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22875 2026-05-25 cs.AI cs.LG 73%

RMA: an Agentic System for Research-Level Mathematical Problems

RMA:一个面向研究级数学问题的智能体系统

Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出Research Math Agents (RMA)框架,通过多角色多轮协作的智能体工作流,在First Proof基准上解决80%的研究级数学问题,优于GPT-5.2R等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18721 2026-05-22 cs.LG cs.CL 73%

General Preference Reinforcement Learning

通用偏好强化学习

Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal, Arslan Chaudhry, Andreas Haupt, Sanmi Koyejo, Emily Fox, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08819 2026-05-21 cs.LG cs.CL 73%

Bayesian Preference Learning for Test-Time Steerable Reward Models

基于测试时间可调节的贝叶斯偏好学习的奖励模型

Jiwoo Hong, Shao Tang, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司) Nubank

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的贝叶斯奖励建模目标,即变分上下文奖励建模(ICRM),通过上下文偏好演示实现测试时间可调节性,从而适应未见过的偏好分布,提高了奖励模型的准确性和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18795 2026-05-20 cs.LG cs.AI 73%

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

机构 * Department of Computer Science and Technlogy(计算机科学与技术系) Tsinghua University(清华大学) School of Computer Science and Technlogy(计算机科学与技术系) Xi’an Jiaotong University(西安交通大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17570 2026-05-19 cs.LG cs.CL 73%

How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning

GRPO在离线策略下的可能性:Mu-GRPO用于高效的大语言模型强化学习

Minghao Tian, Yunfei Xie, Chen Wei

机构 * Rice University(里士大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了GRPO在离线策略下的可行性,提出Mu-GRPO方法,通过减少rollout-optimization切换开销,实现高效的LLM强化学习,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13870 2026-05-19 cs.CL cs.AI 73%

Unlocking the Potential of Diffusion Language Models through Template Infilling

通过模板填充解锁扩散语言模型的潜力

Junhoo Lee, Seungyeon Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。

Comments ACL 2026 Main Conference - Long Paper, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10973 2026-05-13 cs.LG cs.AI 73%

Rotation-Preserving Supervised Fine-Tuning

保持旋转的监督微调

Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏