Post-Proceedings of the First International Workshop on Learning and Nonmonotonic Reasoning
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments 67 pages, 5 papers, 1 abstract, 1 cover
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments 67 pages, 5 papers, 1 abstract, 1 cover
S-AI-Recursive:一种生物启发式且时间稀疏的AI架构,用于迭代、反思和节能推理
机构 * Mohammed V University(穆莱·伊斯梅尔大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出S-AI-Recursive架构,通过激素闭环迭代而非单向传递实现推理,结合生物启发式方法和数学模型,验证了时间稀疏性原理。
Comments Preprint. 51 pages. No figures. S-AI-Recursive: A bio-inspired sparse AI architecture for iterative, introspective, and energy-efficient reasoning
NormCode: 一种用于可审计AI规划的半形式语言
机构 * Center for Long-Term AI(长期人工智能中心) ; Shenzhen University(深圳大学) ; University College London(伦敦大学学院)
专题命中 代码与定理证明 :planning(title,comments);reasoning(abstract);分类 cs.AI
AI总结 NormCode是一种半形式语言,通过强制数据隔离和严格区分语义与语法操作,实现AI工作流的可审计性,确保透明性和可验证性。
Comments Archive name: NormCode: A Semi Formal Language for Context Isolated AI Planning
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
Comments NeurIPS 2025 Workshop on Deep Learning for Code (DL4C), Project page: https://collinear.ai/valley-of-reasoning
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
Comments 34 pages. Shorter version: in Proceedings of the 21st International Workshop on Non-Monotonic Reasoning (NMR-2023)
Journal ref Theory and Practice of Logic Programming, vol.24(1), January 2024, pp. 157-192
递归治理:智能体人工智能系统中风险传播与漂移检测的图论框架
专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对金融机构模型风险管理问题,提出动态IaC治理循环,贡献包括引入校准DoA得分、构建DAG定义算法、开发轨迹监测协议及解决版本变化等实际复杂性问题,用于智能体人工智能系统风险传播与漂移检测。
链式思维与潜在思维的正式比较
机构 * Department of Computer Science, The University of Tokyo, Japan(东京大学计算机科学系)
专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文对比了链式思维与潜在思维,发现潜在思维在并行计算上更高效,而链式思维能通过随机解码实现近似计数与采样。
Comments Camera-ready version for ICML 2026
通过扩大种子训练集来降低Rust系统证明合成的成本
专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出VeruSyn数据合成管道,通过自合成和教程合成扩大Verus验证工具的数据集,生成690万Rust程序及其形式化规格证明,提升代码生成模型的性价比和性能。
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref ICLR 2024 spotlight
GridCodex:一种用于电网规则推理与合规性的RAG驱动AI框架
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 针对电网规则缺乏自动化解读的问题,提出结合大语言模型、RAG及RAPTOR的GridCodex框架,经验证其答案质量提升26.4%、召回率超10倍,可助力电网合规性提升。
ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。
立场:AI道德推理的评估仍遗漏了一半关键内容
机构 * University of Connecticut(康涅狄格大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Hugging Face
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究指出现有LLM道德推理评估聚焦道德价值问题而忽视规范问题,识别出三大缺口并提出含规范表征、标注数据集及分层评估的研究议程,以推动规范推理的系统研究。
Comments 8 pages, 1 figure. Accepted for archival publication at the ACL 2026 Workshop on Evaluating Evaluations (EvalEval)
SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。
P³:用于验证代码生成的程序与证明联合规划
机构 * Apodex ; Princeton University(普林斯顿大学) ; Caltech(加州理工学院) ; University of Toronto(多伦多大学)
专题命中 代码与定理证明 :planning(title,abstract);分类 cs.AI
AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。
感知天气与位置的智能体餐饮推荐:利用大语言模型世界知识开展区域敏感语境推理
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出感知天气与位置的智能体餐饮推荐系统,利用LLM的世界知识生成区域敏感的适配天气的餐饮推荐,为智能体推荐提供了可扩展的架构模式。
Comments 5 pages. An agentic LLM system that reasons over combined location and weather context for region-sensitive dining recommendation. Working prototype implemented and briefly deployed end-to-end
反事实推理在概率多智能体系统中的因果责任归因
机构 * University of Aberdeen(阿伯丁大学) ; Heriot-Watt University(赫瑞瓦特大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出基于反事实推理的因果责任归因方法,利用Shapley值确保公平性和一致性,构建了支持责任感知多智能体系统验证与策略推理的框架,并通过纳什均衡计算稳定策略配置。
Comments Accepted at IJCAI 2026. This is the full version containing all proofs
具有灵活生成意义和表达替代方案的语用推理计算模型
机构 * University of Tübingen(图宾根大学) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
AI总结 研究提出SAGE框架,结合认知模型与语言模型,将语用过程分解为提议者、评估者和选择器模块。通过三个案例研究评估,该模型取得高精度且常超基线,不过组件分析有不对称性,还探讨了神经符号模型在语用语言使用中的前景与局限。
Comments 27 pages main text, 9 figures; 25 pages supplementary materials
FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。
Comments Accepted to IEEE VTS'26
TreeThink:用于大语言模型数学推理的模块化树搜索库
机构 * Bogazici University(博阿齐奇大学) ; Codeway Studios(Codeway工作室) ; Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) ; Koç University(科克大学) ; KUIS AI Lab(KUIS人工智能实验室)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
AI总结 介绍开源Python库TreeThink,用于神经定理证明的模块化全异步树搜索,集成多种方法技术,支持多种语言,连接REPL服务器,经评估在miniF2F和MATH500上有跨语言证明搜索等优势及异步加速。
ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架
机构 * Columbia University(哥伦比亚大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Northeastern University(东北大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。
ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。
Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea
内在奖励何时对代码推理有效?一项全面研究
机构 * Purdue University(普渡大学) ; UC Berkeley(加州大学伯克利分校) ; UC Santa Barbara(加州大学圣塔芭芭拉分校)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。
Comments 18 pages, 45 figures
RACL:用于连续元启发式学习的推理代理控制层
机构 * Independent Researcher(独立研究者)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出RACL方法,在元启发式优化器之上添加推理代理,通过观察、推理和干预控制搜索行为,在车辆路径问题上平均成本降低0.641%-8.337%。
Comments 10 pages, 5 tables
FM-Agent: 通过基于LLM的Hoare风格推理将形式化方法扩展到大型系统
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出FM-Agent框架,利用LLM自动生成函数级规范,实现大型系统的组合式推理,在143k行代码的系统中2天内发现522个新bug。
从酝酿到解析:追踪LLM中代码推理的内部生命周期
机构 * South China University of Technology(华南理工大学) ; Sun Yat-sen University(中山大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hangzhou Dianzi University(杭州电子科技大学) ; Guangzhou College of Technology and Business(广州工商学院)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。
学习增强的形式化推理:从合约合成到工件复用和形式语义
机构 * Department of Computer Science(计算机科学系)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出将形式化方法与人工智能融合的长期研究愿景,通过自动化合约合成、语义工件复用和精化理论,构建知识驱动的验证生态系统,加速未来保障。
Comments LNCS Proceedings Submitted Version. 17 pages. Accepted and presented at VERIFAI-2026: The Interplay between Artificial Intelligence and Software Verification LASER center, Villebrumier, France, March 8-11, 2026
告密范数:$\ell_2$ 幅度作为大语言模型推理动态的信号
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出隐藏状态的 $\ell_2$ 范数作为大语言模型推理强度的内生信号,并通过稀疏自编码器分析、理论证明和因果干预验证其有效性,进而引入三种基于 $\ell_2$ 范数的测试时缩放技术以提升推理性能。
Comments ICML
X-RAY: 通过形式化与校准探针映射大语言模型推理能力
机构 * National University of Singapore(新加坡国立大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 提出X-RAY系统,利用形式化工具生成结构可控的校准探针,通过分析约束交互、推理深度和解空间几何等属性,揭示LLM在约束细化与解空间重构下的推理不对称性。
Comments Accepted by KDD 2026
ReasonOps: 可信验证的LLM推理的统一操作范式
机构 * School of Electrical Engineering(电子工程学院) ; Computer Science (SEECS) National University of Sciences(计算机科学(SEECS)国家 Sciences and Technology)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出ReasonOps,一种将推理视为持续监控、可验证、可靠性感知的操作过程的统一范式,整合语义解释、自动形式化、符号推理、定理证明、运行时保证、概率可靠性估计和自适应修正,以解决当前LLM推理中的逻辑不一致、幻觉符号转换等问题。
Comments 5 Pages
弥合AI与临床推理:针对关键症状对齐的溯因解释
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文利用形式溯因解释,通过最小充分特征集提供一致且保证的推理,使AI决策与临床推理对齐,在保持预测准确性的同时提供可操作的临床见解,建立可信AI框架。
Comments The Algorithm 1 is not entirely correct and they may affect the results as well. We are restarting the experimentations and will upload the new version as soon as possible