A Survey of Reasoning with Foundation Models
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 Figures, 160 Pages, 750+ References, Project Page https://github.com/reasoning-survey/Awesome-Reasoning-Foundation-Models
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 Figures, 160 Pages, 750+ References, Project Page https://github.com/reasoning-survey/Awesome-Reasoning-Foundation-Models
纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) ; Huazhong University of Science and Technology(华中科技大学) ; Jilin University(吉林大学)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。
评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答
机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) ; Prince Sultan University(普森国王大学) ; Al-Baha University(阿勒巴哈大学)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。
Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025
Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada
可解释的轨迹,意外的结果:探讨基于轨迹的知识蒸馏中的断层
机构 * School of Computing & AI, Arizona State University(计算与人工智能学院,亚利桑那州立大学)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文通过规则问题分解设计实验,探讨基于轨迹的知识蒸馏中轨迹语义正确性与可解释性之间的断层,发现轨迹正确性并不能保证最终答案正确,且可解释的分解轨迹在准确性上不具优势。
Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
CROP:通过正则化提示优化实现大语言模型的token高效推理
机构 * Google LLC(谷歌公司) ; Purdue University(普渡大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI;logical reasoning(comments)
AI总结 CROP通过正则化提示优化,在保持准确性的同时显著降低token消耗,适用于复杂推理任务。
Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models
学习链式思维提示以预测知识图谱中的实体、关系以及甚至字面量
机构 * Department of Computer Science(计算机科学系)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RALP方法,通过学习基于字符串的链式思维提示作为评分函数,提升知识图谱链接预测的性能,实验表明其在多个基准测试中均取得显著提升。
大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示
机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) ; MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) ; Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) ; AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。
BiomedSQL: 文本到SQL用于生物医学知识库上的科学推理
机构 * Center for Alzheimer’s and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国立卫生研究院) ; DataTecnica LLC(DataTecnica公司) ; Johns Hopkins University(约翰霍普金斯大学) ; Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国立卫生研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BiomedSQL通过评估文本到SQL生成中的科学推理能力,针对生物医学知识库设计了首个基准测试,展示了不同模型在复杂查询任务中的性能差异。
Comments Published as a conference paper at COLM 2026
基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。
Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/
轻量语言模型在复杂计算表型任务中易出现推理错误
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)
AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。
WeedExpert-R1:通过强化学习激励多模态大语言模型进行精准杂草定位的植物推理
机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) ; Panhandle Research and Extension Center(狭长地带研究与推广中心)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 研究针对精准杂草控制问题,提出通过可验证奖励学习视觉基础植物推理的WeedExpert-R1模型,利用特定合成管道生成数据微调,经群体相对策略优化训练。该模型在多种杂草测试中表现优异,优于同类模型,展现开放词汇能力和跨区域部署潜力。
基于原始校正的渐进推理用于组合零样本学习
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。
OmniCoT: 全局与多步骤全景推理基准
机构 * MBZUAI ; Shanghai AI Lab(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 提出OmniCoT基准,通过链式思维标注和两阶段训练策略,增强多模态大模型在全景图像中的全局多步推理能力。
RKSC:面向多步LLM推理的感知推理的KV缓存共享与自信提前退出
机构 * Anirudh Sekar(安尼鲁德·塞卡)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RKSC框架,通过注意力相似性KV共享、置信门控提前退出和推理选择性块缓存管理,消除多分支LLM推理中的结构冗余,实现平均3.008倍加速,错误率仅0.37%。
Comments Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
TRMs中的潜在推理实际上是策略改进算子
机构 * Arip Asadulaev ; Rayan Banerjee ; Fakhri Karray ; Martin Takac
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过将潜在递归推理形式化为策略改进算法,解释了递归步骤何时有效提升性能,并提出结合强化学习和扩散方法的训练方案,在Tiny Recursive Model上实现18倍前向传递减少且保持性能。
具有潜在推理的鲁棒高效防护栏
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出COLAGUARD模型,通过阶段式训练将多步安全推理转移到连续潜在空间,在保持高安全性能的同时实现12.9倍加速和22.4倍令牌减少。
ASTRA: 面向复杂表格问答的自适应语义树推理架构
机构 * Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。
Comments ACL 2026 Main
指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量
机构 * University of Maryland(马里兰大学) ; Allen Institute for AI(Allen人工智能研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。
Comments ACL2026, camera-ready
当思维遇见事实:长上下文语言模型的可重用推理
机构 * KAIST(韩国科学技术院) ; Amazon(亚马逊) ; University of Minnesota(明尼苏达大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Thought Templates用于长上下文语言模型的可重用推理,通过迭代更新策略提升多跳推理能力,并展示其在多种基准测试中的优越表现。
Comments ACL Findings 2026
测试时匹配:在多模态模型中解锁组合推理
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。
Comments To appear at ICLR 2026; extended results to generative multimodal models
ReasonRank: 通过强推理能力增强文档排序
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 分校) ; Baidu Inc., Beijing, China(百度公司,北京,中国) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ReasonRank,通过自动化生成推理密集型训练数据和两阶段训练方法,提升文档排序性能,实验表明其优于现有基线并具有更低延迟。
Comments 25 pages, accepted by ACL2026 main conference
EA-Agent:一种用于实体对齐的结构化多步推理代理
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract)
AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。
Comments ACL 2026,Main Conference
Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理
专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(abstract)
AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。
为何多语言推理模型中会出现多语言推理差距?
机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) ; Agentic AI Lab, KT(KT公司Agentic AI实验室) ; Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文探讨了多语言推理模型中存在多语言推理差距的原因,发现语言理解失败是主因,并提出Selective Translation策略有效缓解了这一问题。
Comments Accepted at Findings of ACL 2026
TokUR:用于大语言模型推理的令牌级不确定性估计
机构 * Rutgers University(罗格斯大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊) ; Red Hat AI Innovation(红帽AI创新)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TokUR框架,通过引入低秩随机权重扰动生成令牌级不确定性分布,提升大语言模型在数学推理中的可靠性和可解释性。
Comments Accepted to International Conference on Learning Representations (ICLR) 2026
从分解视角看大语言模型的长上下文推理
机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) ; Xi'an Jiaotong University(西安交通大学) ; Tencent(腾讯) ; Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文从分解视角出发,将长上下文推理分解为基本原子技能,并通过伪数据集训练提升模型能力,实验证明该方法在多个基准测试中提升了7.7%的性能。
MARVEL:多模态自适应推理-增强扩展-排序和检索
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。
LightThinker++:从推理压缩到内存管理
机构 * Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LightThinker++,通过引入显式自适应内存管理,有效压缩LLM推理过程中的中间思维,减少内存占用并提升推理效率,尤其在长周期智能任务中表现突出。
Comments Work in progress. This is an extended version of LightThinker
链式帧:通过帧感知推理推进多模态大语言模型的视频理解
机构 * New York University(纽约大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)
AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
WorldMM: 动态多模态记忆代理用于长视频推理
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。
Comments CVPR 2026. Project page : https://worldmm.github.io