GENESIS: Towards Explainable Causal Discovery
GENESIS:迈向可解释的因果发现
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。
Comments 13 pages, 2 figures, 13 tables, 1 algorithm
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
GENESIS:迈向可解释的因果发现
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。
Comments 13 pages, 2 figures, 13 tables, 1 algorithm
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
从‘我们’到‘我’:基于演绎推理的理论指导叙事转变
机构 * Syracuse University(苏塞克斯大学) ; Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。
HLE多项选择子集的维度与测量精度
机构 * Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。
适配器合并重新激活潜在推理痕迹:一种机制分析
机构 * Zjydiary Group(Zjydiary小组)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。
Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress
Loong:通过验证器大规模合成长思维链
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。
AoA:基于重新设计语言抽象语法树的定理证明智能体
机构 * Nanyang Technological University Singapore(南洋理工大学新加坡分校) ; Imperial College London London, UK(伦敦帝国理工学院伦敦分校) ; University of Edinburgh Edinburgh, UK(爱丁堡大学爱丁堡分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 研究针对交互式定理证明中人工操作限制可扩展性及基于LLM的证明智能体成本高的问题,提出将智能体从源文本提升到抽象语法树的方法,实现了AoA,在多个方面有显著提升且解决更多难题。
Comments 13 pages
自动演化特定任务优化的提示指南
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型提示指南优化问题,提出AGOPS方法,利用现有任务示例隐含信息,通过优化方案自动演化特定任务指南,提升下游任务性能,弥补提示不明确导致的性能损失。
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。
不确定时验证:超越黑盒幻觉检测中的自一致性
机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。
多表问答的潜在桥梁
机构 * EURECOM ; University of Antwerp(安特卫普大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出GRAB管道,通过图编码器和潜在桥梁将关系数据转化为紧凑表示,冻结LLM以保持推理能力,在多表问答中显著提升性能。
形式化公理系统中的自监督定理发现
机构 * The University of Tokyo, Japan(东京大学,日本) ; RIKEN AIP, Japan(日本RIKEN AIP)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。
Comments AI for Math Workshop @ ICML 2026
将神经符号程序蒸馏到3D多模态大语言模型中
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。
Comments To appear in ICML 2026
在拜占庭故障下鲁棒的多智能体大语言模型
机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) ; Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。
预测影响,缺失分布:评估LLMs作为运营管理中的人类行为模拟器
机构 * Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文评估LLMs在运营管理中模拟人类行为的能力,通过九个实验发现LLMs能复制假设效应,但分布不匹配问题显著,轻量策略可缓解此问题。
三狼人杀:大型语言模型中多跳心智理论的丑角角色
专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。
爱因斯坦世界模型
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) ; Tohoku University(东北大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。
Comments 12 pages (9 without references), 2 figures, 1 algorithm
智能体模型批判
机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。
量化RAG系统中的先验主导性
机构 * ArtificialGate Ltd.(ArtificialGate有限公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract_cn)
AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。
Comments 15 pages, Preprint
EmoFSM:一种用于情感支持对话的有限状态机
机构 * Geely AI Lab(吉利人工智能实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。
Comments 15 pages, 4 figures. PAKDD 2026
智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。
虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗
机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) ; Microsoft / Vocametrix(微软 / Vocametrix) ; IAI, TCG CREST(IAI,TCG CREST) ; Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) ; Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) ; Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) ; CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) ; GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。
Comments Under Review
Operadic一致性:LLM中组合推理失败的无标签信号
机构 * Incubilate ; University of Cambridge(剑桥大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 推理与问题求解 :LLM(title_cn,abstract);分类 cs.CL、cs.LG
AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。
知识图谱与推理大语言模型用于寻找简单而有效的转录组扰动预测因子
机构 * University College London(伦敦大学学院) ; University of Manchester(曼彻斯特大学) ; Valence Labs(Valence实验室) ; Recursion(Recursion公司)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 利用知识图谱的K近邻方法在基因敲除扰动预测中表现优异,结合强化学习优化的LLM可达到最先进性能。
基于评论的异构多智能体推理用于可靠的数学问题求解
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于评论的异构多智能体框架,通过生成器-验证器结构和自适应学习系统,利用中间反馈评估和引导推理过程,在GSM8K基准上实现高达13%的准确率提升,并减少对大模型的依赖。
Comments 6 pages
企业智能体系统中的本体约束神经推理:一种面向领域 grounded AI 智能体的神经符号架构
机构 * Golden Gate University, San Francisco Foundation(金门大学,旧金山基金会) ; AgenticOS (FAOS)(AgenticOS(FAOS)) ; Associate Director, Data, Digital & IT Novartis Healthcare Pvt. Ltd.(数据、数字与IT部门,诺华健康有限公司) ; Novartis Healthcare Pvt. Ltd., Hyderabad, India(诺华健康有限公司,海得拉巴,印度)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种神经符号架构,通过本体约束神经推理解决企业大语言模型在幻觉、领域漂移和无法在推理层面强制执行监管合规性方面的限制,展示了该架构在提升智能体的指标准确性和角色一致性方面的显著效果。
Comments 24 pages, 6 tables, 6 figures, 1 algorithm, 65 references. Replication study: 1,800 runs (600 per model) across 5 regulated industries (3 English, 2 Vietnamese) and 3 LLMs (Claude Sonnet 4, Qwen 2.5 72B, Gemma 4 26B). v3 changes: deep-review trim from 34pp. Code and data: https://github.com/frank-luongt/faos-research/tree/main/RA-3
不变梯度对齐用于鲁棒推理蒸馏
机构 * University of Oxford(牛津大学) ; FLock.io
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。
Comments 30 Pages
Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026
DAR: 基于智能体框架的道义推理
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出DAR框架,通过让模型按需与法规交互来提升基于LLM的道义推理能力,实验表明智能体框架可提升性能但存在非均匀改进和弱模型数值任务退化问题。
揭秘多智能体辩论:置信度与多样性的作用
机构 * University of Cambridge(剑桥大学) ; University of Sheffield(谢菲尔德大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对多智能体辩论(MAD)在提升大语言模型性能时效果不佳的问题,提出多样性感知初始化和置信度调节辩论协议两种轻量级干预方法,显著提升辩论有效性。
推理路径作为输入仍然有效吗?将后推理与思维链压缩连接起来
机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; City University of Hong Kong(香港城市大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出后推理范式,通过将思维链作为上下文输入来简化推理任务,并设计UCoT框架训练轻量级压缩器生成软令牌形式的上下文思维链,从而在保持推理能力的同时显著压缩输出长度。
Comments ACL 2026 Main Track