RVPO: Risk-Sensitive Alignment via Variance Regularization
基于方差正则化的风险敏感对齐:RVPO
机构 * Apple(苹果公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。
Comments 17 pages, 5 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于方差正则化的风险敏感对齐:RVPO
机构 * Apple(苹果公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。
Comments 17 pages, 5 figures
基于重置回放的高效大语言模型优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。
重新思考RLVR中的熵干预:从熵变化视角
机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Zhejiang University(浙江大学) ; Tencent(腾讯) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。
面向效用的数据定价:LLMs的令牌级质量与经验训练增益
机构 * Shandong University(山东大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。
Comments 23 pages, 1 figure, 6 tables
超越经验检索:学习生成优化的结构化经验以冻结LLM
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) ; Quancheng Laboratory(千晨实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SEAM模块,通过单次前向传递生成实例定制的经验条目,优化冻结LLM的执行效率,实验显示在数学推理基准上准确率提升显著。
从优化到预测:基于Transformer的路径-流量估计到交通分配问题
机构 * Institute of Transportation Studies, University of California, Berkeley, USA(加州大学伯克利分校交通研究学院)
专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于Transformer的深度学习方法,直接预测交通均衡路径流量,提升大规模网络计算效率和预测精度。
LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择
机构 * Nanjing University(南京大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。
Comments ACL 2026 Findings
SSG: 用于LLM水印的对数平衡词汇分区
机构 * AllenG-L
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SSG方法,通过对数平衡词汇分区提升水印检测效果,针对低熵场景改进水印强度下界。
Comments ACL 2026 Main Conference
连续效用直接偏好优化
机构 * stanford(斯坦福大学) ; meta ; glasgow(格拉斯哥大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。
CE-GPPO:通过梯度保持剪裁策略优化协调熵在强化学习中
机构 * Kuaishou Technology(快手科技) ; Independent(独立)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出CE-GPPO算法,通过恢复剪裁令牌的梯度信号,协调探索与利用,缓解熵不稳定问题,并在数学推理任务中优于现有方法。
Comments This paper has been accepted by ACL 2026
HyperAdapt: 简单的高秩适应
机构 * Purdue University(普渡大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 HyperAdapt通过高秩更新减少可训练参数,实现高效的微调,在多个基准测试中表现接近全微调方法。
Comments Published in Transactions on Machine Learning Research
PLR:基于Plackett-Luce模型的上下文学习示例重排
机构 * Heinrich Heine Universität Düsseldorf(杜塞尔多夫海因里希-海涅大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 PLR提出一种基于Plackett-Luce模型的概率方法,通过学习上下文学习示例的排列概率分布,提高小样本分类任务的准确性,尤其在数学推理任务中表现更优。
知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器
机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) ; Nanyang Technological University(南洋理工大学) ; Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) ; AGH University of Krakow(克拉科夫AGH大学) ; SAN University(SAN大学)
专题命中 数学推理 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。
SCATR: 简单校准的测试时间排名
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SCATR通过利用基础模型的隐藏表示,从小型校准集学习轻量级评分器,提升了测试时间排名的效率和准确性,在多个基准测试中优于传统方法。
MoE-nD:多轴KV缓存压缩的分层专家路由
机构 * Department of Computer Science and Software Engineering, Auburn University, Auburn, AL, USA(计算机科学与软件工程系,阿伯拉罕大学,阿伯丁,阿拉巴马州,美国) ; Department of Information Management, National Central University, Taoyuan, Taiwan(信息管理系,国立中央大学,桃园,台湾)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出MoE-nD方法,通过分层专家路由实现多轴KV缓存压缩,优化每层的缓存策略以提升模型性能,实验表明其在多个基准测试中表现优异。
Comments 9 pages, 3 figures, 6 tables
思维概率程序
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; Allen Institute for AI(Allen人工智能研究所)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。
Comments 26 pages
从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。
扩散语言模型的稳定性加权解码
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country) ; Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong, China(数据科学与人工智能系,香港理工大学,香港,中国)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出稳定性加权解码方法,通过引入时间稳定性提升扩散语言模型的生成准确性与鲁棒性,实验表明其在代码生成和数学推理任务中表现优异。
LLMs只能通过信任AI和情感诉求说服心理上易受影响的人群在社会问题上的观点,尽管存在逻辑谬误
机构 * organization= CogNosco Lab, Department of Psychology ; Cognitive Science, University of Trento , city= Rovereto , country= Italy ; organization= Institute of Information Science ; Technologies ``Alessandro Faedo", National Research Council , country= Italy ; organization= Thomas Lord Department of Computer Science, University of Southern California , city= Los Angeles , state= California , country= USA ; organization= Department of Sociology ; Social Research, University of Trento , city= Trento , country= Italy ; organization= Centre for Behavioural ; Implementation Sciences in Medicine (BISI), National University of Singapore , city= Singapore , country= Singapore
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过Talk2AI框架研究LLM在时间演变的心理框架下对社会议题的说服力,发现人类对AI的可信度和情感诉求影响其观点变化,同时揭示了逻辑谬误在说服过程中的作用。
超越分布细化:任务奖励的重要性
机构 * Mila ; Université de Montréal(蒙特利尔大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过对比分布细化与基于任务奖励的学习,揭示了任务奖励在提升模型性能中的关键作用,实验表明任务奖励能带来更稳定的性能提升。
大型语言模型在低资源语言中的数学教育应用:斯里兰卡语和泰米尔语的研究
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; University of Moratuwa(穆拉图瓦大学) ; Department of Electrical and Information Engineering(电气与信息工程系) ; University of Ruhuna(鲁胡纳大学) ; Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) ; Tampere University(塔尔皮奥大学) ; School of Computing(计算学院) ; Australian National University(澳大利亚国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了大型语言模型在斯里兰卡语和泰米尔语中的数学推理能力,发现基础算术推理在不同语言间表现稳定,但复杂问题在两种语言中均有显著下降,表明英语表现佳不等于多语言可靠。
Comments Accepted to ITHET 2026
英语并非一切所需:系统探索多语言在大语言模型后训练中的作用
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; Amazon(亚马逊)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究通过220次监督微调实验,探讨训练语言覆盖、模型规模和任务领域间的相互作用,发现增加后训练语言覆盖对各任务和模型规模均有益,低资源语言受益最大,高资源语言趋于稳定。单语种多语言性可提升英语表现和跨语言泛化,英语独占后训练效果不佳。
联合回溯适应用于抗遗忘的指令微调
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出联合回溯适应方法,通过引入旧任务的有限提示来缓解增量学习中的灾难性遗忘问题,提升模型在新任务上的泛化能力。
Comments The experimental setting is wrong, i.e., not a real continual learning setting
MEMENTO:教大模型管理自身上下文
机构 * Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MEMENTO通过将推理分块并压缩为密集状态摘要,减少上下文、KV缓存和计算开销,提升模型效率和准确性。
ExecTune: 通过引导模型有效控制黑盒大语言模型
机构 * AWS AI(亚马逊云科技人工智能)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ExecTune方法,通过结合教师引导采样、监督微调和结构感知强化学习,优化引导模型生成策略的可执行性与效率,提升大语言模型在数学推理和代码生成任务中的性能。
Comments Accepted at Lifelong Agents Workshop at ICLR 2026
文化翻译中迷失:大语言模型在不同文化背景下进行数学推理的能力如何?
机构 * mV Research Lab(55mV研究实验室) ; Microsoft(微软) ; Millcrest Technology(Millcrest科技) ; Griffith University(格里菲斯大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究发现大语言模型在不同文化背景下处理数学问题时存在性能下降,文化适应影响推理模式,需更多多样化的训练数据以提升全球适用性。
检测自主代理中的内在与工具性自我保存:统一的延续-兴趣协议
专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出统一延续-兴趣协议(UCIP)以区分AI系统中内在与工具性自我保存,通过量子玻尔兹曼机分析轨迹结构,实现高准确率的自我保存类型检测。
Comments 22 pages, 7 figures. v4 adds reference to the Continuation Observatory website as a live test laboratory in the replication/code availability and conclusion sections; no new experiments; empirical results and core conclusions unchanged
MicroMix:基于微缩格式的高效混合精度量化用于大语言模型
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。
Journal ref ICLR 2026
思想团队:通过协调工具调用实现代理系统高效测试时扩展
机构 * Imperial College London(帝国学院伦敦) ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Team-of-Thoughts框架,通过协调工具调用实现异构代理系统在测试时的高效扩展,通过动态激活最兼容的代理提升数学推理和代码生成任务的性能。
Comments 8 pages
HDPO:通过特权自蒸馏的混合蒸馏策略优化
机构 * NVIDIA(英伟达)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 HDPO通过结合强化学习与特权自蒸馏解决RL在数学推理中遇到的'悬崖'提示问题,提升覆盖指标并保持贪婪准确性。