Online Safety Monitoring for LLMs
LLMs的在线安全监控
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。
Comments ICML 2026 Hypothesis Testing Workshop
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
LLMs的在线安全监控
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。
Comments ICML 2026 Hypothesis Testing Workshop
VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Honor Device Co., Ltd(荣耀设备有限公司) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。
规范性缩放揭示语言模型能力的演变
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。
Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling
同时多目标对齐:可验证与不可验证奖励
机构 * ucsd(加州大学圣地亚哥分校)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。
Comments ICML 2026
未来KL正则化GRPO:基于f-散度正则化的过程级信用分配
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出未来KL正则化策略优化(FRPO),通过因果未来正则化回报修正GRPO中局部KL损失缺失的梯度信号,在数学推理任务中提升pass@16并保持更高熵和更低策略漂移。
Universal Reasoner: 一个单一、可组合的即插即用推理器用于冻结的LLM
机构 * Graduate School of Artificial Intelligence, Korea Advanced Institute of Science and Technology(人工智能研究生院,韩国科学技术院)
专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Universal Reasoner,一种可组合且即插即用的推理模块,能够在冻结的大规模语言模型上提供专门的推理能力,通过共享或对齐的token空间实现弱到强的泛化,实验表明其在数学推理和机器翻译中优于现有微调方法。
Comments ICML 2026
解耦KL与轨迹:为LLM蒸馏中的SFT、DAgger、离线RL和OPD提供统一视角
机构 * Eastern Institute of Technology(东技术院) ; The Hong Kong Polytechnic University(香港理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,香港科学与技术大学(广州))
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文探讨了知识蒸馏中KL散度与轨迹之间的耦合问题,通过解耦两个轴向,提出了四种有效的蒸馏目标,并通过实验揭示了KL方向、前缀源和训练长度之间的权衡关系,提出了KL混合和熵门长度课程等实用方法。
Comments Code available at https://github.com/EIT-NLP/Decoupled-Distill
DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习
机构 * The Ohio State University(俄亥俄州立大学) ; Apple(苹果公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。
GRLO:从零开始在开放环境中的通用强化学习
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。
基于熵引导的步骤选择和分步优势的扩散语言模型强化学习
机构 * Department of Electrical & Computer Engineering(电气与计算机工程系)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种针对扩散语言模型的强化学习方法,通过熵引导选择步骤和分步优势估计,实现无偏策略梯度,提升生成效果和计算效率。
OPT-Engine:通过复杂度扩展评估大语言模型在优化建模中的极限
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Booth School of Business, University of Chicago(芝加哥大学商学院) ; Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过OPT-ENGINE框架评估大语言模型在优化建模中的能力与扩展性,发现纯文本推理在任务复杂度增加时存在鲁棒性差距,外部工具无法满足全局优化约束,指出约束自动建模是当前SOTA范式的瓶颈。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
你的语言模型就是其自身的批评者:具有从演员内部状态估计价值的强化学习
机构 * Graduate School of Data Science(数据科学研究生院) ; Seoul National University(首尔国立大学) ; Computer Science and Engineering(计算机科学与工程)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出POISE方法,通过利用策略模型内部信号在强化学习中实现高效的基线估计,减少方差并提高训练稳定性,适用于数学推理任务。
Comments Under Review; Project Page: https://elijah0430.github.io/poise/
重新思考多LoRAs的参数共享用于LLM微调
机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ALoRA和Fed-ALoRA,通过异构矩阵分解策略,在多任务和联邦微调中实现更平衡的性能,优于现有多LoRA方法。
Comments Accepted to ACL 2026 Findings
潜在相位偏移回滚:通过残差流监控和KV-缓存引导进行推理时的误差校正
机构 * BITS Pilani, Pilani Campus(比斯派恩大学,帕利尼校区)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LPSR方法,通过监控残差流和引导KV缓存来校正大语言模型中的推理错误,显著提升在MATH-500上的性能,同时在参数和token成本上更具优势。
Comments Under Review
RL-PLUS: 通过混合策略优化对抗LLMs在强化学习中的能力边界崩溃
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RL-PLUS通过混合策略优化解决LLMs在强化学习中的能力边界崩溃问题,结合内部利用与外部数据提升推理能力,实验表明其在数学推理和分布外任务中表现优异。
Comments Accepted to ACL 2026 (main)
数据混合代理:学习重新加权领域以实现持续预训练
机构 * The University of Manchester(曼彻斯特大学) ; Microsoft Research(微软研究院) ; Imperial College London(伦敦帝国学院) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。
Comments Accepted by the ACL 2026 main conference
我们是否需要前沿模型来验证数学证明?
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究评估了开源和前沿LLM在验证数学证明中的表现,发现较小模型在准确性上接近前沿模型,但一致性较差,通过定制提示词提升性能。
Comments 21 pages, 11 figures
基于条件期望奖励的强化学习
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于大语言模型自身作为隐式验证器的条件期望奖励方法,用于提升一般领域推理任务的准确性与适用性。
无提示被忽视:通过熵引导的优势塑造利用零方差提示进行LLM强化学习
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过熵引导的优势塑造,RL-ZVP利用零方差提示提升LLM推理能力,显著优于GRPO及其他基线方法。
Comments ICLR 2026 camera-ready version
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化
机构 * NVIDIA
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。
Comments NVIDIA-Tech Report
从序列层面视角出发的扩散大语言模型原理化强化学习
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) ; Stanford University(斯坦福大学) ; Lambda, Inc(Lambda公司) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ESPO,一种基于序列级优化的原理化强化学习框架,用于提升扩散大语言模型的生成能力,通过ELBO作为似然代理,显著优于token级方法。
机构 * Samsung Research(三星研究院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments Accepted by NeurIPS 2025 as a spotlight
机构 * University of Cambridge(剑桥大学) ; The University of Hong Kong(香港大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 23 pages
机构 * Salesforce AI Research(Salesforce AI研究)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 21 pages, 8 figures, 5 tables
机构 * Tongji University(同济大学) ; Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages, 5 figures
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学、技术和研究局高性能计算研究所) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/24x9t7s1
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute for AI(人工智能矢量研究所)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code: https://github.com/YuweiYin/SWI
机构 * Technical University of Munich(慕尼黑技术大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; University of Cambridge(剑桥大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This paper is a preprint under review. arXiv admin note: text overlap with arXiv:2411.08212
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2025 Camera Ready. Code: https://github.com/The-Inscrutable-X/TACQ