Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Models
专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI
Comments EMNLP Findings 2024
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI
Comments EMNLP Findings 2024
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG
Comments Accepted by CIKM 2024
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments 10 pages, 3 figures
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
Comments In progress
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments ICLR 2024; First two authors equal contribution
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 17 pages, 11 figures, 5 tables
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments 9 pages, 9 figures
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG
Comments AAAI 2024
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments There are unfair comparisons on miniF2F. This will be fixed in the future
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Published at TMLR 2023
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
机构 * University of Amsterdam(阿姆斯特丹大学) ; Meta FAIR ; New York University(纽约大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
机构 * Shanghai Jiao Tong University SII GAIR Lab(上海交通大学SII GAIR实验室)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments 26 pages; The first three authors contribute to this work equally
ThinkRetrieve:用于测试时缩放的检索增强推理轨迹
机构 * IIT Bombay(印度理工学院孟买分校) ; University of Maryland, College Park(马里兰大学帕克分校) ; Adobe Research(奥多比研究院)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 针对大型推理模型测试时缩放的负面效果,提出ThinkRetrieve框架,通过每步动态检索已解决示例注入推理轨迹,在四个数据集上对五个模型实现最高60%的相对准确率提升。
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
从噪声到多样性:在LLM推理中的随机嵌入注入
机构 * Gwangju Institute of Science and Technology(光州科学技术学院) ; Seoul National University(首尔国立大学) ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。
Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)
推理模型中的流体表示
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。
Comments EMNLP 2026
训练后转移置信度:对自训练微调、强化学习和在线策略蒸馏如何塑造思维链前、中、后校准的三阶段分析
机构 * Eastern Institute of Technology(东理工学院) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 数学推理 :CoT(title);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究大型语言模型训练后方法在推理中重塑置信度的情况,提出三阶段校准框架,发现不同方法在不同阶段的置信度特点,基于此提出位置感知置信策略PosConf,提升了强化学习答案聚合及在线策略蒸馏早期停止效果。
CRISP: 通过迭代自策略蒸馏实现压缩推理
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
AI总结 CRISP通过自蒸馏使模型更简洁推理,无需真实答案或预算,在数学和多步骤规划任务中实现显著的token减少和精度提升。
Riazi-8B:用于数学推理的乌尔都语大语言模型
机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) ; National University of Sciences and Technology (NUST)(国家科学与技术大学) ; Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) ; Mid Sweden University(中瑞典大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。
相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。
PragReST:用于语用语言理解的自我强化反事实推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 提出PragReST框架,通过自监督构建语用问答数据、生成反事实推理轨迹,结合监督微调和强化学习提升大语言模型的语用推理能力,在四个基准上显著优于基线模型。
Comments First two authors contributed equally. Code and models: https://github.com/jihyung803/PragReST
定理驱动的可执行本体用于可解释机器推理
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出TGEO框架,将推理建模为可执行状态转换过程,通过定理族识别、本体绑定、语义对象发现等步骤生成可解释推理图,实现可验证、可重放的AI推理。
可观察模式并非解释:潜在推理模型的因果几何分析
机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,信息学实验室) ; Université Paris-Saclay(巴黎-萨克雷大学) ; NAVER LABS Europe(NAVER欧洲实验室)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文通过对照实验和因果干预发现,潜在推理模型中的可观察模式(如BFS前沿)在控制组中也出现且不总是因果影响行为,提出潜在思维的使用是分级的,其因果效应集中在低秩方向,几何结构随行为影响增强而更有序。
DyCon: 通过演化难度建模的动态推理控制
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhongguancun Academy(中关村学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 提出DyCon框架,利用步骤级嵌入动态建模推理过程中的难度演化,无需训练即可控制推理深度,减少冗余步骤,提升效率且不损失准确性。
Comments Accepted at ICML 2026
几何潜在推理诱导LLM生成更短的文本
机构 * Idiap Research Institute(日内瓦研究所) ; EPFL(苏黎世联邦理工学院) ; BUT(布拉格技术大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出几何潜在推理(GLR)方法,通过轻量级过渡头在嵌入空间中预测迭代方向更新,近似离散推理轨迹,从而在不显式优化长度的情况下显著缩短LLM的生成步数。
超越两阶段训练:用于大语言模型推理的协作式SFT与RL
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 提出BRIDGE框架,通过选择性知识迁移使SFT辅助RL训练,在数学推理等任务上优于两阶段和单阶段混合方法。
Comments ICML 2026
超越测试时记忆:用于LLM推理的状态空间最优控制
机构 * vita-group(vita组)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
AI总结 提出测试时控制(TTC)层,通过有限时域LQR规划实现推理,作为适配器集成到预训练LLM中,在数学推理任务上提升高达27.8%的准确率。
Comments ICML 2026
LambdaPO: 一种用于推理语言模型的Lambda风格策略优化
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL
AI总结 针对GRPO因使用群体均值作为基线而丢失细粒度偏好信息的问题,提出LambdaPO方法,通过将优势估计分解为成对偏好结构并引入语义密度奖励,从群体轨迹中挖掘更细粒度的优化信号,提升推理性能。
Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission. Author list and submitter name redacted due to disputed authorship