Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks
双阶段LLM推理:自演化数学框架
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
双阶段LLM推理:自演化数学框架
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。
CoV:基于视角链的立体推理
机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) ; Monash University(墨尔本大学) ; AIML, Adelaide University(阿德莱德大学AIML)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI
AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。
Comments Code link https://github.com/ziplab/CoV
LLM多智能体系统中的从众动力学:拓扑结构与自我-社会权重的作用
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究了LLM多智能体系统中网络拓扑和自我-社会权重对集体决策效率、鲁棒性及失败模式的影响。
Comments Under Review
LIDL: 通过知识图谱增强的多智能体分析进行LLM集成缺陷定位
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 LIDL通过知识图谱增强的多智能体分析,有效定位LLM集成软件中的缺陷,提升准确性和效率。
逻辑参数化神经符号推理:通过可控逻辑形式实现可验证的大语言模型推理
机构 * University of Luxemburg(卢森堡大学) ; University of Sheffield(谢菲尔德大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出逻辑参数化框架,通过可控逻辑形式提升神经符号推理的鲁棒性与适应性,实验表明内部逻辑策略在不同领域具有更优表现。
Comments Work in progress
意图一目了然:通过基础模型实现的注视引导的机器人操作
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)
AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。
Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop
通过整合基于大语言模型的规划和机动性驱动的控制实现非抓取工具-物体 manipulation
机构 * organization= Department of Mechanical Engineering, The Hong Kong Polytechnic University , addressline= KLN, Hong Kong ; organization= School of Advanced Engineering, The Great Bay University , addressline= Dongguan, China ; organization= Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence , addressline= Abu Dhabi, UAE ; organization= Department of Surgery, The Chinese University of Hong Kong , addressline= NT, Hong Kong ; organization= Department of Computer Science, University of Liverpool , addressline= Liverpool, UK
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 本文提出了一种结合大语言模型和机动性驱动控制的方法,用于实现非抓取工具-物体 manipulation任务。
见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) ; MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。
IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化
机构 * DeepSeek-AI
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。
SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of Toronto(多伦多大学) ; University of New South Wales(新南威尔士大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。
Comments Preprint
ART:可解释性声明验证的自适应推理树
机构 * Capital One ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 ART通过自适应推理树提升声明验证的可解释性和可靠性,通过分层论证结构和法官LLM裁决实现透明且可挑战的决策。
Naiad:一种新型智能自主系统用于内陆水体监测
机构 * National Technical University of Athens(希腊国家技术大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。
CHisAgent:一种用于古代中国文化系统事件分类的多智能体框架
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Renmin University of China(中国人民大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 CHisAgent通过多智能体框架实现古代中国历史事件的自动分类,提升历史知识组织与跨文化理解能力。
Comments 22 pages, 13 figures, 7 tables
从错误中学习:负推理样本增强领域外泛化
机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL
AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。
Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW
AtomThink: 多模态慢思考与原子步骤推理
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; ETH Zurich(苏黎世联邦理工学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Hong Kong(香港大学) ; Noah’s Ark Lab(诺亚实验室) ; Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI
AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。
Comments TPAMI accepted
用生成代理模拟城市规划中的多利益相关者决策
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 本研究通过多生成代理系统模拟城市规划中的多利益相关者决策,探讨人口因素对集体决策的影响,并提升决策的公平性和效率。
Journal ref Advances in Transdisciplinary Engineering, Vol. 76, pp. 40-49, IOS Press, 2026
DQ-LoRe:双查询与低秩近似重排序用于上下文学习
机构 * Sun Yat-Sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; MBZUAI ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; DarkMatter AI Research(DarkMatter AI研究)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 DQ-LoRe通过双查询与低秩近似重排序方法提升GPT-4上下文学习性能,实现94.2%的性能提升。
Comments Accepted in ICLR 2024
让我思考!一个长的推理链可能比许多短的链多出指数倍
机构 * UC San Diego(UC圣地亚哥大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Harvard University(哈佛大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文探讨了推理链扩展策略,证明在特定图连通性问题中顺序扩展比并行扩展更有效。
Comments Published at NeurIPS 2025
真相的 facade:揭示并缓解 LLM 对欺骗性证据的易感性
机构 * Xi’an Jiaotong University(西安交通大学) ; National University of Singapore(新加坡国立大学) ; Yunnan University(云南大学)
专题命中 推理与问题求解 :LLM(title);分类 cs.CL
AI总结 本文提出 MisBelief 框架揭示 LLM 对复杂欺骗性证据的脆弱性,并提出 DIS 机制缓解这一问题,提升模型对误导性证据的抵御能力。
对抗 yet 合作:检索增强语言模型中的多视角推理
机构 * East China Normal University(华东师范大学) ; Baidu Inc.(百度公司) ; Southeast University(东南大学)
专题命中 推理与问题求解 :language model(title);分类 cs.AI
AI总结 本文提出对抗推理RAG框架,通过推理与验证的对抗机制提升检索增强语言模型的多视角推理能力与验证严谨性。
更短但不更差:通过易样本作为长度正则化器进行节俭推理
机构 * MBZUAI ; Ecole Polytechnique(巴黎政治学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。
LLMs是否需要在强化学习前具备内在推理能力?韩国自我修正研究
机构 * ETRI
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究探讨LLMs在强化学习前是否需要具备内在推理能力,通过韩国自我修正研究发现,对齐模型内部推理与韩语输入关键,提升多语言推理效果。
Comments IJCNLP-AACL 2025 (Main), Outstanding Paper Award
TIME:面向上下文触发的显式推理的时序智能元推理引擎
机构 * Independent Researcher(独立研究者)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。
Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code
在ARC-AGI-1上使用小型递归模型:归纳偏差、身份条件和测试时计算
机构 * Western University(西部大学) ; Varonova Tech Inc.(Varonova科技公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究分析了TRM在ARC-AGI-1上的表现,发现其性能源于效率、任务特定条件和测试时计算的相互作用,而非深度推理。
Comments 13 pages, 0 figures, 6 tables
从实验室到现实应用:在仓库级别评估代理代码推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen University(中山大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。
GRASP:跨知识图谱的通用推理与SPARQL生成
机构 * University of Freiburg(弗赖堡大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 GRASP通过大型语言模型实现跨知识图谱的通用推理与SPARQL生成,无需微调,在多个基准中达到先进水平。
Comments Accepted for publication at ISWC 2025. This version of the contribution has been accepted for publication, after peer review but is not the Version of Record. The Version of Record is available online at: https://doi.org/10.1007/978-3-032-09527-5_15
Journal ref The Semantic Web - ISWC 2025, LNCS 16140, pp. 271-289 (2026)
利用逻辑编程和大语言模型自动化生成MDP用于机器人应用
机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) ; Department of Industrial Engineering, University of Trento(工业工程系,特伦托大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出结合大语言模型与形式方法,通过逻辑编程自动生成可执行的MDP策略,用于机器人中的概率规划。
Comments 9 pages, 11 figures, 2 tables, 2 algorithms, accepted for publication in IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 2, pp. 1770-1777, Feb. 2026
基于地图的思考:用于地理定位的强化并行地图增强智能体
机构 * Xiamen University(厦门大学) ; AMAP, Alibaba Group(阿里集团AMAP) ; Southern University of Science and Technology(南方科技大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。
QueryGym: 关系数据库中的分步交互
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 QueryGym通过提供关系数据库分步交互环境,促进LLM查询规划代理的透明评估与错误修复研究。
迈向AI原生软件工程(SE 3.0):愿景与挑战路线图
机构 * Queen's University(女王大学) ; Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) ; York University(约克大学)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 本文提出SE 3.0愿景,通过AI原生方法提升软件开发效率,介绍关键技术栈与挑战路线图。