Unveiling Transformers with LEGO: a synthetic reasoning task
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
大语言模型工具中的部分相关验证级联:凹对数优势、多项式可靠性和盲点上限
机构 * Independent researcher(独立研究者)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型工具中部分相关验证级联,将生成器错误接受率建模为潜在变量,给出理论。包括凹对数优势、多项式可靠性等特性,可测量,通过合成测试对比不同方法效果,指出实际应通过去相关而非加门提升可靠性。
Comments 14 pages, 2 figures. Code and synthetic-recovery experiments: https://github.com/jianganghan/harness-verifier-cascades
ReasoningBank: 通过推理记忆扩展智能体自我进化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google Cloud AI Research(谷歌云人工智能研究) ; Yale University(耶鲁大学) ; Google Cloud AI(谷歌云人工智能)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。
Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank
监控可监控性
机构 * OpenAI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)
AI总结 研究提出评估框架和指标,探讨了不同因素对AI系统可监控性的影响,发现更长的思维链和优化方法能提升监控效果。
机构 * Mila – Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; École de Technologie Supérieure (ETS)(高等技术学院) ; Polytechnique Montréal(蒙特利尔理工学院) ; ServiceNow(ServiceNow公司) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);verifier(abstract)
Comments ICLR 2025
机构 * Center for Advanced AI, Accenture(高级人工智能研究中心,Accenture) ; Rochester Institute of Technology(罗切斯特理工学院) ; UC Berkeley(加州大学伯克利分校)
专题命中 测试时计算 :reasoning(abstract,comments);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Workshop on Efficient Reasoning at NeurIPS 2025
COMET:面向视频多模态大语言模型的对比运动增强时序推理
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-Sen University(中山大学) ; Pingan Technology(平安科技)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。
Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
先验审计-修复上下文调整大语言模型验证器阈值以趋向宽松
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现,LLM检查器上下文中的审计→修复事件会降低误报率,调整了验证器阈值趋向宽松,且该效应与负性不对称性预测相反,不随推理启用而消失。
Comments 12 pages, 2 figures, 4 tables. Code and analysis artefacts: https://github.com/parsa-mz/crtitxer
自引导防御:通过合成指南实现推理模型的自适应安全对齐
机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) ; Beijing Jiaotong University(北京交通大学) ; School of Information Technology and Management(信息科技与管理学院) ; University of International Business and Economics(国际经济贸易大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SGASA框架,通过合成指南实现推理模型的自适应安全对齐,提升对抗性提示防御能力并减少对良性请求的拒绝。
突破探索瓶颈:面向通用大语言模型推理的Rubric引导强化学习
机构 * Zhejiang University(浙江大学) ; Li Auto Inc.(力汽车公司) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Hangzhou City University(杭州市大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Rubric-Scaffolded Reinforcement Learning,通过引入检查表式评分标准作为探索和利用的指导框架,突破通用大语言模型推理的探索瓶颈,提升推理能力。
DualityCert:量子场论中对偶性声明修复的验证器门控语言模型
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对量子场论中对偶性声明修复,提出DualityCert验证器。语言模型代理接收错误声明编辑至通过验证,在预注册基准测试中,验证器门控重试等策略在不同模型上有不同表现,各获胜策略都用低成本证书,还发布了相关内容。
Comments 17 pages, 2 figures, 9 tables. v2: added reference and note on concurrent related work. Code, benchmark, and all per-attempt records: https://github.com/xingyang-yu/QFTCert
通过基于证据的推理进行智能根本原因分析
机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。
Comments 21 pages, 9 figures
答案条件思维链降低大语言模型中的可验证推理蒸馏
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。
Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage
用于无训练语言模型推理的深度熵引导采样
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。
PiCSAR:基于推理链的概率置信度选择与排序
机构 * Imperial College London(伦敦帝国学院) ; University of Edinburgh(爱丁堡大学) ; UCL(伦敦大学学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PiCSAR通过联合对数似然度评估推理链和最终答案的置信度,无需训练即可提升大语言模型和推理模型的准确性,在多个基准测试中表现优异。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026
超越固定表示:开放式人工智能中的词汇与验证差距
机构 * MIT(麻省理工学院)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 研究指出当前人工智能系统虽能力强但表示框架固定,构建开放式智能需新操作。通过词汇和验证差距刻画与真正开放式智能的距离,基于智能行为的认知转换区分不同类型转换,进而提出创新自主性阶梯及推进开放式人工智能的方向。
MILES:用于自我改进的语言模型推理的具有可学习选择的模块化指令内存
机构 * University of New South Wales(新南威尔士大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 研究针对LLMs测试时推理问题,提出MILES框架,通过动态扩展内存及正确性优化的内存组合,利用模块化内存单元与可学习选择头实现粗到细检索机制,实验表明该框架在性能、效率及权衡上表现出色。
上下文搜索何时有用?基于反射驱动推理的采样复杂性理论
机构 * The Hebrew University(希伯来大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究上下文搜索何时有用,通过将其建模为对推理轨迹的近似推理分析采样复杂性,表明反思能定位早期错误时可指数级改进,收益稳健可学习,还在强化学习抽象下验证了理论预测。
CLARity:仅通过推理一致性即可教授强化专家
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 CLARity通过一致性感知奖励机制和两阶段精炼-监控训练流程,提升推理一致性,利用小规模通用LLM有效指导专家模型,实验显示在一致性与准确性上均有显著提升。
Comments ACL 2026 Main Conference
课程强化学习可以激励LLMs超越基础模型的推理能力
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出边界感知课程强化学习方法,通过定位推理能力边界、针对性教师引导和强化学习巩固,在Qwen、Llama和DeepSeek上同时提升pass@1和pass@256,平均pass@256比基础模型提升9.8个百分点。
神经概念验证器:通过概念编码扩展证明者-验证者博弈
机构 * Zuse Institute Berlin, Germany ; AI \& ML Lab, Computer Science Department, TU Darmstadt ; Hessian Center for AI (hessian.AI) ; Lab1141 ; German Research Center for AI (DFKI) ; Institute of Mathematics, Technische Universit\"at Berlin, Germany ; Max Planck Institute for Informatics, SIC
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 提出神经概念验证器(NCV)框架,结合概念编码与证明者-验证者博弈,实现高维输入的可验证分类,优于传统方法并缓解捷径行为。
Comments 28 pages, 5 figures, 12 tables, revised references. An earlier version of this work was presented at the ICML 2025 Workshop on Actionable Interpretability
LEPO:面向大语言模型的潜在推理策略优化
机构 * Tencent(腾讯) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 LEPO通过引入Gumbel-Softmax在大语言模型中实现可控的随机性,提升其探索能力与强化学习兼容性,通过直接在连续潜在表示上应用强化学习,显著优于现有方法。
Reward-SQL:通过逐步执行感知推理和过程监督奖励提升Text-to-SQL
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Alibaba Cloud Computing(阿里云 computing)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 针对强化学习在Text-to-SQL中缺乏逐步执行感知推理和过程级奖励的问题,提出CoCTE框架和Reward-SQL方法,通过中间视图验证、结构化CTE及过程奖励模型,显著提升复杂查询的准确性和可解释性。
面向LEGO空间物理推理的样本高效后训练
机构 * HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZODA
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。
Comments Technical Report V1, 15 pages, 6 figures, 3 tables
从冲突到共识:通过多轮代理RAG提升医疗推理
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出MA-RAG框架,通过多轮代理循环迭代优化外部证据和内部推理历史,提升医疗复杂推理能力,实验显示在7个医疗问答基准上表现优于现有方法。
Comments 27 pages, 8 figures, 18 tables
时间序列预测作为推理:一种基于强化LLM的慢思考方法
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Time-R1框架,通过两阶段强化微调(监督微调+强化学习)训练LLM进行多步推理,以提升时间序列预测的准确性。
大语言模型中用于结构推理的可视化图脚手架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出将图结构作为大语言模型的内部推理辅助而非仅外部知识源,通过多跳问答实验发现视觉图引导相比文本化图在无直接答案提示时仍保持有效性,支持图作为组织推理的可视化脚手架。
ThinkSwitch:基于LoRA和权重插值的上下文蒸馏用于特定目的推理任务
机构 * bellevue High School(贝尔维尤高中) ; DigitalOcean
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出ThinkSwitch方法,通过QLoRA蒸馏和球面权重插值协同训练指令模型和思考模型,在AIME 2026和PubMedQA上分别提升指令模型10/30→20/30和13/30→18/30,思考模型14/30→22/30和18/30→25/30,仅需15个训练提示和$2.86成本。
IAPO:面向令牌高效推理的信息感知策略优化
机构 * University of Virginia(弗吉尼亚大学) ; LinkedIn Inc.(LinkedIn公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出信息感知策略优化框架IAPO,通过基于条件互信息的令牌级优势塑造,在提升推理准确率的同时将推理长度减少高达36%。