Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification
形式数学验证中生成式奖励建模的期望值对齐
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
形式数学验证中生成式奖励建模的期望值对齐
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。
从规模到结构化表达能力:重新思考用于CTR预测的Transformer
机构 * Alibaba Group(阿里巴巴集团)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。
Comments KDD 2026; The first four authors contributed equally to this work
通过数据为中心的编译对抗在线金融问答中的数值幻觉
机构 * Shenzhen Technology University(深圳科技大学) ; FiT, Tencent(腾讯金融科技部) ; South China University of Technology(华南理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Huazhong University of Science and Technology(华中科技大学) ; McGill University(麦吉尔大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出数据为中心推理编译器(DCRC),通过对抗数据构建、多阶段训练和编译执行推理流程,解决在线金融问答中检索增强生成面临的噪声敏感、计算脆弱和可审计性危机,实现可靠的数值推理。
Comments Accepted by KDD 2026 ADS track
用强化学习和递归推理自动化形式验证
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG
AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。
Comments Master's thesis, 140 pages, 16 figures, 17 tables
蒸馏LLM反馈用于Lean定理证明
机构 * FAIR at Meta(Meta 的 FAIR 部门) ; Inria(法国国家科学与技术研究院) ; Sorbonne Université(索邦大学) ; Institut universitaire de France(法国国家科学研究院) ; CERMICS École des Ponts ParisTech(巴黎理工学院 CERMICS 实验室) ; ENS, PSL Research University(巴黎高等师范学院与巴黎科学实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出反馈蒸馏方法,通过让模型在token级别匹配自身分布(基于语言模型提供的特权反馈)来训练,以解决GRPO在推理后训练中的稀疏奖励和模式崩溃问题,并在Lean4定理证明中取得更好效果。
AgentSchool:基于LLM的多智能体教育模拟系统
机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) ; School of Computer Science and Technology(计算机科学与技术学院) ; East China Normal University(东华大学) ; School of Design(设计学院) ; Faculty of Education(教育学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出AgentSchool,一种LLM驱动的多智能体模拟器,通过可成长的学生智能体(带知识图谱、思维工作流和错误概念)与自适应教师智能体(基于最近发展区)模拟学习过程,支持多尺度模拟,实验验证了其生成差异化掌握轨迹和符合课堂社会理论的行为模式。
Comments 39 pages, 10 figures
利用智能体引导的树搜索自动化形式验证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。
Comments 78 pages, 8 figures
MerLean-Prover:用于 Lean 4 定理证明的递归循环框架
机构 * Northeastern University(东北大学) ; Stony Brook University(石溪大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码与定理证明 :planning(abstract);分类 cs.CL
AI总结 提出一种基于递归循环框架的端到端 Lean4 定理证明器 MerLean-Prover,通过规划、检查与证明三种智能体协作,无需微调或定制强化学习,在 FormalQualBench 和 Putnam2025 上超越现有开源基线。
建模代理技术债务与随机税:一个用于测量、模拟和仪表盘展示的独立框架
机构 * School of Business, University of Pittsburgh(匹兹堡大学商学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一个形式化且可管理的框架,区分代理技术债务(累积的设计与治理负债存量)与随机税(使用随机代理时产生的运营负担流),并通过应付账款模拟和电子表格说明其应用。
ConVer:使用合约和循环不变式合成实现可扩展的形式化软件验证
机构 * The University of Manchester(曼彻斯特大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出一种自上而下的组合验证工具ConVer,利用大语言模型合成函数合约,并通过CEGAR-CEGIS循环迭代精炼合约,以解决大规模C程序形式化验证中的状态空间爆炸问题。
Comments 12 pages; 6 figures
声明式数据服务:用于组合数据系统的结构化智能体发现
机构 * Northeastern University(东北大学) ; Brown University(布朗大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。
Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026
可发现的智能体知识——智能体知识图谱能力的形式化框架(扩展版)
机构 * School of Computer Science and Informatics, University of Liverpool, UK(利物浦大学计算机科学与信息学学院) ; Open University(开放大学)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 本文提出一个四维形式化框架(语义表达性、智能体可发现性、任务相对基础性和认知信任范围),并从中推导出智能体能力概况(AAP),作为VoID和DCAT之上的语义层,支持智能体在规划时进行原则性的知识图谱选择、组合和故障诊断。
PathMem: 面向病理学多模态大模型的认知对齐记忆转换
机构 * University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; Nanyang Technological University(南洋理工大学) ; Imperial College London(伦敦帝国学院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。
从下一个词预测到(STRIPS)世界模型
机构 * RWTH Aachen University, Germany(亚琛工业大学,德国) ; Universitat Pompeu Fabra, Spain(庞培法华大学,西班牙)
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 研究下一个词预测能否产生支持规划的世界模型,提出STRIPS Transformer和标准Transformer两种架构,在五个经典规划领域评估训练准确率、泛化能力和规划性能。
从仿真轨迹中发现高层次模式
机构 * University of Edinburgh(爱丁堡大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种通过程序合成进行无监督学习的方法,将仿真轨迹转换为稀疏的高层次模式表示,以提升大语言模型对物理系统的推理能力。
用于密集奖励的领域可适应强化学习代码生成
机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 代码与定理证明 :planning(abstract);分类 cs.LG
AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。
Comments 10 pages, 2 figures, under review
在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架
机构 * College of Intelligent Science and Engineering(智能科学与工程学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。
可访问性能力边界:AI生成浏览器原生可访问性系统的操作极限与扩展潜力
机构 * NUST Business School, NUST(NUST商学院,NUST) ; Kiara Inc.(Kiara公司)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出可访问性能力边界(ACB)理论框架,探讨AI生成浏览器原生可访问性系统在操作极限和扩展潜力方面的核心问题,并通过实证原型分析,定义了可访问性能力空间中的可达区域和不可达区域,为自主可访问性计算的可扩展性提供了理论基础。
Comments 21 pages, 4 figures
形式技能:用于高效且准确LLM代理的可编程运行时技能
机构 * FairyClaw
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。
通过提示注入在黑盒聊天机器人环境中研究隐私泄露链的实证研究
机构 * Department of Information Security(信息安全系) ; Soongsil University(松山大学) ; AI Safety Center(人工智能安全中心) ; Department of AI Software(人工智能软件系)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了通过间接提示注入在黑盒聊天机器人环境中存在的隐私泄露攻击链,分析了攻击者如何通过构造看似无害的外部内容来劫持代理任务,并评估了新的提示注入技术'exemplification'的攻击成功率,最终展示了使用虚构个人信息的证明概念数据外泄链。
Comments 9 pages, 2 figures
A-ProS:通过多模型反馈实现可靠的自主编程
机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) ; Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。
Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)
CAM-Bench: 一个用于Lean中的计算与应用数学的基准测试
机构 * Fudan University(复旦大学) ; Qingdao University(青岛大学) ; Peking University(北京大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出CAM-Bench,一个包含1000个Lean证明目标的基准测试,涵盖优化、数值线性代数和数值分析等领域,旨在补充现有形式化数学基准测试,通过针对依赖教科书概念和基本定理的应用数学问题进行评估。
Comments Preprint. 44 pages, 7 figures
大语言模型与不可能的语言习得:"虚假承诺"或对当前人工智能观点的颠覆
机构 * New Talent Academy(新人才学院) ; Institute of Software, University of Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 代码与定理证明 :self-correction(abstract);分类 cs.CL
AI总结 本文通过实验探讨大语言模型学习可能与不可能语言的能力,发现GPT-2模型在自然语言任务上表现优于不可能语言任务,而LSTM模型则无显著差异,挑战了Chomsky对AI的理性主义基础观点。
在混合DeltaNet-注意力解码器中证明更短的scratchpad
机构 * Centre for Credible AI(可信人工智能中心) ; Warsaw University of Technology(华沙理工大学)
专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.LG
AI总结 研究混合递归-注意力解码器的表达能力,证明混合架构在模型表达性和效率上有优势,使用常数精度假设,Qwen风格的混合模型能以常数scratchpad解决parity-conditioned检索任务,而纯DeltaNet或纯注意力模型需多项式scratchpad。
Comments Under review at a ML conference
从LLM生成的猜想到Lean形式化:通过求和平方证书实现自动多项式不等式证明
机构 * School of Software Engineering, East China Normal University, Shanghai, China(东华大学软件工程学院) ; College of Computer Science and Technology, National University of Defense Technology, Changsha, China(国防科技大学计算机科学与技术学院) ; School of Computer and Information Engineering, Henan University, Kaifeng, China(河南大学计算机与信息工程学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出NSPI框架,结合LLM和符号计算,通过求和平方证书实现多项式不等式证明,展示其在10变量多项式上的有效性与可扩展性。
Comments Accepted to ICML 2026. Preprint version
Solvita:通过代理进化增强大型语言模型以应对编程竞赛
机构 * Nanjing University(南京大学) ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 Solvita通过闭环系统和可训练知识网络,使代理动态学习,提升编程竞赛任务的准确性和经验积累。
基于生成式人工智能的RISC-V供应链探索方法
机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) ; Technical University of Munich(慕尼黑技术大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。
提示分割与标注优化:通过优化段级标注控制大语言模型行为
机构 * Commonwealth Bank of Australia(澳大利亚全国银行)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出PSAO框架,通过段级标注提升提示优化的可控性和效率,实验证明标注能提高LLM推理准确性和自一致性。
(如何)大型语言模型理解高层次消息序列图?
机构 * Department of Informatics, King's College London(伦敦国王学院信息学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨大型语言模型对高层次消息序列图(HMSC)语义的理解程度,通过129个语义任务测试三个模型,发现其在基本概念上准确率较高,但在抽象、组合及轨迹计算等任务上表现较差。
BRIDGE: 在领域引导的程序合成中构建表示
机构 * California Institute of Technology(加州理工学院) ; Amazon(亚马逊)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG
AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。
Comments 41 pages, 10 figures, 3 tables. Preprint