On Reasoning-Centric LLM-based Automated Theorem Proving
基于推理的LLM自动定理证明方法
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出ReCent-Prover,通过引入反思验证和规划检索技术,提升自动定理证明能力,在CoqStoq基准测试中实现22.58%的定理证明提升。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
基于推理的LLM自动定理证明方法
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出ReCent-Prover,通过引入反思验证和规划检索技术,提升自动定理证明能力,在CoqStoq基准测试中实现22.58%的定理证明提升。
基于大型语言模型的任务与能力层面探索的强化学习
机构 * RWTH Aachen University(亚琛工业大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。
Comments 8 pages, 7 figures, ICRA 2026
osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航
机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) ; University of Bonn(波恩大学) ; Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title)
AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。
Comments accepted at RA-L 2026
分层多智能体大语言模型推理用于自主功能材料发现
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。
Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry
专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title)
Comments 26 Pages, 6 Figures
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments 150 pages, 18 figures, 3 tables
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Large Language Models; Reasoning; Alignment
从单个词到数学:语言模型中数学推理学习动态
机构 * Department of Computer Science 1 and Psychology 2(计算机科学系和心理学系) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)
AI总结 本研究分析了语言模型在预训练和后训练过程中数学推理能力的发展,揭示了数学技能学习顺序与课程设计的相关性,并探讨了指令微调对不同数学技能的影响。
Comments Accepted to COLM 2025. Dataset and code: https://github.com/gpoesia/mathcamps/
Journal ref Conference on Language Modeling (COLM), Montreal, Canada, October 7-10, 2025
多模态大语言模型时代的容积放射学人工智能
机构 * Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Southern Medical University(南方医科大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院) ; Westlake University(西湖大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI
AI总结 该综述梳理截至2026年7月的200余篇文献,探讨多模态大语言模型时代容积放射学AI的表征、智能体系统及临床评估,提出相关框架以明确原生容积建模的适用场景。
Comments 9 Figures, 6 tables
大语言模型及其对力学与空间几何的认知能力
机构 * University of Innsbruck(因斯布鲁克大学) ; University of Augsburg(奥格斯堡大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。
嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。
Comments Accepted to COLM 2026
关于智能体大语言模型漏洞的理解、识别与缓解
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。
推理链长度如何影响LLM对答案事实性的判断
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing University of Post and Telecommunications(北京邮电大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。
Comments ACL2026 Main
AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Shanghai Jiaotong University(上海交通大学)
专题命中 推理与问题求解 :language model(title,abstract);post-training(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。
小型语言模型代理实现高效高质量的知识挖掘
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Carneigie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)
AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。
Comments Code available: https://github.com/LongfeiYun17/falconer
Evo-DKD:用于大语言模型中自主本体进化的双知识解码
机构 * Radian Group Inc.(Radian集团) ; Sri Sivasubramaniya Nadar College Of Engineering(纳德工程学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究针对本体和知识图谱进化难题,提出Evo-DKD双解码器框架,结合结构化遍历与非结构化推理,通过动态注意力机制协调,经模拟在单流模式下近似双解码,实验证明其在多领域用例中优于基线,为知识库维护提供新范式。
Comments 6 pages, 6 figures, 2 tables. Accepted for publication at IEEE ICMLA 2026
CMCTS:一种用于大语言模型数学推理的约束蒙特卡洛树搜索框架
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 CMCTS通过约束动作空间、过程奖励模型和偏序规则提升大语言模型的数学推理能力,实验表明其在多个基准测试中表现优异。
Journal ref Applied Intelligence 56, 13 (2026)
CLMASP:将大语言模型与答案集编程耦合用于机器人任务规划
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出CLMASP方法,结合大语言模型和答案集编程,解决机器人任务规划中计划落地问题,实验显示其执行率显著提升。
Comments 9 pages, accepted to IJCAI 2025 Main Track
GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试
机构 * Southeast University(东南大学) ; Ahsanullah University of Science and Technology(阿山努拉科技大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。
打破似然陷阱:面向大语言模型解码的方差校准调制
机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) ; Department of Statistics, LMU Munich(慕尼黑大学统计系) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL
AI总结 提出方差校准调制(VCM),通过上下文PMI搜索和自适应自去偏置两种动态机制,在截断前重塑概率分布,以缓解LLM的似然陷阱问题,提升生成多样性、连贯性和推理准确性。
Comments Under Review
利用元记忆智能体增强大语言模型的无数据代码生成
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) ; School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) ; The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) ; Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) ; School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) ; School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。
推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法
机构 * IIIT Delhi(印度信息技术学院德里分校) ; IIT BHU(印度理工学院(巴纳拉斯印度教大学)) ; IIT Kanpur(印度理工学院坎普尔分校) ; NII Tokyo(日本国立情报学研究所) ; Microsoft Research India(微软印度研究院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。
关于强化学习中奖励函数对大语言模型置信度校准的有效性
机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) ; Institute of Advanced Intelligence and Computing(高级智能与计算研究所) ; Agency for Science, Technology and Research(科技研究局) ; Department of Electrical & Computer Engineering(电气与计算机工程系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。
Comments 50 pages, 8 figures
基于多模态大语言模型的第一视角事故视频中的责任分配估计
机构 * Keio University(庆应大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。
BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型
机构 * Chungnam National University(全南国立大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG
AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。
从识别到理解:利用LLM解锁认知时间序列推理
机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) ; Zhejiang University(浙江大学) ; Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。