BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
BDH-CQ:结合循环潜态推理的上下文学习
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出BDH-CQ模型,结合上下文学习与循环潜态推理,在ARC-AGI-1评估集上实现高成本效率,突破了该基准的成本-准确率帕累托前沿。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
BDH-CQ:结合循环潜态推理的上下文学习
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出BDH-CQ模型,结合上下文学习与循环潜态推理,在ARC-AGI-1评估集上实现高成本效率,突破了该基准的成本-准确率帕累托前沿。
推理大语言模型中的隐藏语言一致性现象
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究以PolyMath基准测试集探究推理模型的语言一致性,发现难度提升会导致多语言模型输出语言一致性骤降,量化对一致性的影响独立于准确率,多语言能力需结合准确率、一致性与难度评估。
社会推理从何而来?语言模型中的能力来源
机构 * Georgia Institute of Technology, College of Computing(佐治亚理工学院计算学院) ; MATS Program(MATS项目) ; EleutherAI ; KAIST AI(韩国科学技术院人工智能学院) ; Georgia Tech AI Safety Initiative(佐治亚理工学院人工智能安全倡议)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 通过训练数据归因方法,发现OLMo3-7B中社会推理和STEM推理依赖于不同的预训练语料区域,且推理层面的差异比知识层面更显著。
Comments 120 pages. Published as a conference paper at COLM 2026
QuArch:评估计算机体系结构中大型语言模型推理的基准
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出QuArch基准,用于评估LLM在计算机体系结构中的推理能力。它包含2671个问答对,发现前沿模型在高阶思维技能上有差距。经微调可提升内存层次结构设计任务性能,为构建和衡量LLM能力提供基础,推动计算系统创新。
推理错误在大语言模型(LLMs)残差流轨迹中具有特定区域与方向
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学) ; Naval Group Pacific(太平洋海军集团) ; Responsible AI Research Centre(负责任人工智能研究中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究针对大语言模型推理错误检测的权衡问题,提出三流检测器,在推理基准上提升选择准确率,还适用于事实类任务,验证了运动、区域、方向信号的互补性。
当缺失即证据:评估大语言模型中对完整性敏感的负向推理能力
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大语言模型的完整性敏感负向推理能力,构建CROWN-QA评估基准,发现模型存在过度闭合等问题,提示无法持续解决错误,且部分覆盖不对称性在真实文档中依然存在。
Comments 19 pages, 2 figures, 20 tables
防泄露遗忘:评估多跳推理一致性与恢复鲁棒性的新基准
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出新基准unlearning评估LLM遗忘的鲁棒性,实验发现现有遗忘方法易受多跳推理路径和恢复攻击影响,还探究了遗忘质量、鲁棒性与模型效用的权衡。
Comments 19 pages, 7 figures
MOON3.0: 基于推理的多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
更短的推理,更早的答案?对推理接口的评估
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。
Comments 52 pages, 13 figures, 30 tables
过滤推理得分:在模型最自信的轨迹上评估推理质量
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。
Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version
正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba DAMO Academy(阿里巴巴达摩院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。
Comments working in progress
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。
用于推理增强型语言模型的综合FP8训练方案
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。
Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented
LLMs 是否坚持其价值观?MANTA:一个用于动物福利推理的多轮对抗性基准
机构 * SPAR ; Compassion Aligned Machine Learning(同情对齐机器学习) ; NUS(新加坡大学) ; Mila(Mila研究所) ; ERA Cambridge(剑桥ERA)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出 MANTA 基准,通过多轮对抗性对话评估大语言模型在动物福利推理中的价值观稳定性和道德敏感性,发现单轮基准无法捕捉的排名变化和物种-压力交互效应。
大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析
机构 * Adelaide University(阿德莱德大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。
一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架
机构 * Shandong University(山东大学) ; University of Auckland(奥克兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) ; Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) ; Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) ; System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) ; Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) ; Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) ; Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) ; School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) ; Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) ; Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。
NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。
用于虚假订单欺诈检测的可追溯大语言模型推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对大规模虚假订单欺诈检测难题,提出基于大语言模型的DeepScrub框架,通过语义统一、持续预训练及SURE机制实现可追溯推理。实验及试点结果显示,该框架提升了欺诈审查精度与召回率,减少工作量并节省成本。
Comments 15 pages, 3 figures
推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Zhejiang University(浙江大学) ; Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对大型推理模型中推理痕迹含噪声影响幻觉检测的问题,提出REDE框架,利用最终答案注意力塑造表示空间去噪,经实验验证,该框架能有效提升幻觉检测性能。
通过截断的思维链审计检测基于大语言模型的教育辅导中的答案驱动推理
机构 * Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; Syracuse University(Syracuse大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究基于大语言模型的教育辅导中,模型能否利用答案信息生成答案驱动的解释,用截断推理AUC评估法在三种辅导情境下评估,发现答案信息能提升模型表现,支持截断思维链审计用于诊断。
TReB:评估大语言模型表格推理能力的综合基准
机构 * JIUTIAN Research(天研机构)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。
Comments published by SIGIR 2026
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275
揭示语言模型中的潜在推理策略
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。
量化递归推理模型
机构 * Integrated Systems Laboratory, ETH Zürich(集成系统实验室,瑞士苏黎世联邦理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究递归推理模型量化问题,发现其因激活缩放粒度致精度崩溃,提出用逐块缩放恢复转换,应用MXInt4格式,该格式在任务中与浮点格式有竞争力,克服架构量化敏感性弱点,还能转移到ARC - AGI基准测试。
Comments Preprint, 27 pages, 4 tables, 12 figures
利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Microsoft(微软) ; Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心) ; Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心) ; Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究旨在增强大语言模型临床推理能力,利用全国脓毒症登记处数据构建问题,通过强化学习微调模型得到C-Reason,该模型在域内测试集表现出色,推理能力能推广到不同任务和疾病,为开发通用临床推理模型提供思路。
Comments Accepted at MLHC 2026
利用指令微调与合并实现推理模型适配
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。
G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架
机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) ; National Key Laboratory of Human Factors Engineering(人因工程重点实验室) ; Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。
高效学习用于多任务算法推理的分支网络
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究旨在实现多任务算法推理,提出分支神经网络架构,通过递归树状划分任务,利用基于梯度的亲和度聚类,降低搜索复杂度。经实验验证,在多个基准测试中性能优于现有方法,减少运行时和内存使用,还可用于重叠社区检测。
Comments 31 pages. Modified the experiments section and improved exposition