Uncovering Latent Reasoning Strategies in Language Models
揭示语言模型中的潜在推理策略
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
揭示语言模型中的潜在推理策略
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究将预训练语言模型响应分布分解为策略条件表示的问题,提出潜在变量分解方法,引入新变分目标,通过多策略算法任务基准验证了该方法能恢复潜在代码并保留基础模型响应分布。
量化递归推理模型
机构 * Integrated Systems Laboratory, ETH Zürich(集成系统实验室,瑞士苏黎世联邦理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究递归推理模型量化问题,发现其因激活缩放粒度致精度崩溃,提出用逐块缩放恢复转换,应用MXInt4格式,该格式在任务中与浮点格式有竞争力,克服架构量化敏感性弱点,还能转移到ARC - AGI基准测试。
Comments Preprint, 27 pages, 4 tables, 12 figures
利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Microsoft(微软) ; Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心) ; Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心) ; Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究旨在增强大语言模型临床推理能力,利用全国脓毒症登记处数据构建问题,通过强化学习微调模型得到C-Reason,该模型在域内测试集表现出色,推理能力能推广到不同任务和疾病,为开发通用临床推理模型提供思路。
Comments Accepted at MLHC 2026
心电图大语言模型:基于心电图的心脏推理基础模型
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 研究针对一线分诊缺乏确定性成像及现有心电图人工智能系统局限的问题,提出ECG-LLM模型,用多模态到语言监督策略训练,能从心电图回答多样心血管问题,恢复测量值、预测表型,在相关任务中表现良好,为临床推理提供支持。
PEARL:科学推理图提取的可审计修复
机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) ; Artificial Intelligence Innovation and Incubation, Fudan University(复旦大学人工智能创新与孵化) ; Department of Computer Science, Faculty of Science, University of Bath(巴斯大学理学院计算机科学系) ; College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对科学推理图提取中LLMs输出有问题的情况,提出无需训练的PEARL框架,通过特定模式和反馈修复推理图。在ARCHE基准测试中,该框架提升了严格通过率和平均REA,为相关工作流程提供可靠性层。
Comments Accepted at WAICA 2026 Multi-Modal Agents for Science Workshop
基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估
机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) ; Guangzhou Polytechnic Normal University(广州技术师范大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。
Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu
GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。
固定训练协议下多模态推理的数据高效整理
机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究固定协议微调下多模态推理的数据整理,以NeurIPS 2025 DCVLR挑战为测试平台,分析多种因素对推理准确性的影响,发现对齐源语料库的难度过滤增益最强,为数据受限的多模态推理微调提供经验方法。
通过生产视觉语言模型在视标图表上进行方向读取:跨推理模式、提示和访问方式的受控多模型评估
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究通过消费者聊天界面评估四个视觉语言模型在视标图表上读取方向的能力,在多种推理模式、提示变体下运行,发现各模型准确率有差异,错误有特定方向,单一准确率掩盖问题,强调应多轴评估视觉语言模型。
Comments 4 figures, 4 supplementary figures
Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测
专题命中 推理评测 :reasoning(title,abstract)
AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。
错误作为透镜:通过合成误解生成探究LLM推理
机构 * CUNY Graduate Center(纽约大学研究生中心) ; CUNY Queens College(纽约市立大学皇后学院)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。
用于生物医学领域研究主题本体生成的资源高效语言模型基准测试
机构 * Knowledge Media Institute, The Open University, Milton Keynes, UK(开放大学知识媒体研究所) ; Department of Business and Law, University of Milano-Bicocca, Milan, IT(米兰-比科卡大学商业与法律系)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文评估五个小型开源LLMs识别生物医学概念语义关系的性能,引入MeSH-Rel-4K数据集并分析三种策略,发现针对性微调使平均F1分数显著提高,突破推理瓶颈,为构建生物医学本体提供准确自动化方法。
DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。
Comments Work in progress
压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性
机构 * National University of Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究在三段论推理基准前加软前缀,探究学习到的上下文压力对模型逻辑判断的影响,发现软前缀能改变正确答案,在多模型测试中效果优于随机对照,主要影响是答案偏好,不同模型有显著差异。
Comments 41 pages, 6 figures
2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛
机构 * University of Memphis(孟菲斯大学) ; QuantaInsight(量子洞察)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。
DS@GT在eRisk 2026的ARC:用于对话式抑郁症筛查的具有结构化算法指导的混合多智能体大语言模型系统
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 介绍DS@GT参加eRisk 2026对话式抑郁症筛查挑战赛,其系统历经三个阶段,最终采用混合配置并添加算法组件。提交三次运行结果,混合运行3表现出色,以低成本超付费基线,验证较弱开源模型经算法监督可与专有模型竞争。
Comments Conference and Labs of the Evaluation Forum (CLEF), 19 pages, 5 figures
RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试
机构 * Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。
Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench
基于混合Transformer-XGBoost框架的新英格兰短期电力需求预测:融合天气、日历和COVID-19指标
机构 * Department of Chemical and Materials Engineering, New Mexico State University(新墨西哥州立大学化学与材料工程系) ; Department of Electrical and Communications Engineering, New Jersey Institute of Technology(新泽西理工学院电气与通信工程系)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出混合Transformer-XGBoost框架,集成天气、日历和COVID-19变量,用于新英格兰短期电力需求预测,测试RMSE为8876 MWh,MAPE为2.05%,并发现COVID-19特征在疫情后成为噪声。
FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文
机构 * Independent Researchers(独立研究者) ; Tencent(腾讯) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出前瞻稀疏注意力(LSA),基于DeepSeek-V4架构的神经记忆索引器,通过预测未来上下文需求仅保留关键KV块,在超长上下文场景下将物理KV缓存压缩至全上下文的13.5%,同时保持或略微提升下游准确率。
Comments Technical report. 11 pages. Code and model available at https://github.com/libertywing/FlashMemory-Deepseek-V4 and https://huggingface.co/libertywing/FlashMemory-Deepseek-V4
FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习
机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) ; Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) ; Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。
当更少的层打破更多的链条:层剪枝损害大语言模型的测试时扩展性
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究层剪枝对大语言模型长链推理中测试时扩展性的影响,经大量实验发现剪枝会严重损害其扩展性,标准微调补救无效,确定了扩展性脆弱机制及应用层剪枝的风险,呼吁重新思考策略并为保推理鲁棒性方法提供见解。
因果软件工程:愿景与路线图
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; University of Sheffield(谢菲尔德大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究软件工程在不确定性下决策的关键问题,提出因果软件工程范式,通过因果模型和推理为软件生命周期活动提供信息,还给出工作流程视图、路线图及评估议程。
Comments Accepted at FSE 2026 - Ideas, Visions and Reflections (IVR) Track
VEHBench:用于大语言模型辅助振动能量采集器设计的阶段局部诊断基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理评测 :verifier(abstract);分类 cs.CL
AI总结 研究针对无电池物联网中振动能量采集器设计,引入VEHBench基准测试,评估大语言模型在耦合物理设计不同阶段的表现,通过763个任务及四个设计角色测试,发现模型能力依赖阶段,为评估、选择等工程大语言模型提供阶段感知基础。
使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器
机构 * Innopolis University(因诺波利斯大学) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。
ESCUCHA:用于异构声学条件的西班牙语语音基准测试
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。
Comments Under review
吴语-环境执法基准:评估大语言模型在环境执法中的基准
机构 * School of Environment, Tsinghua University(清华大学环境学院) ; College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) ; State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) ; Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。
Comments 98 pages, 45 figures,
ProEvent:面向主动智能体的以事件为中心的基准测试
机构 * School of Computing, Peking University(北京大学计算机学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。
表达方式很重要:探索用于人工智能辅助信息评估的修辞模式
机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) ; Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) ; Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) ; School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究人工智能辅助信息评估中修辞模式,通过主体内研究考察八种修辞模式,发现支架式解释与最高准确率提升相关,对抗条件也能适度提高准确率,还探讨了设计不同修辞风格对话代理的意义及相关权衡。
Comments 13 pages, 6 figures, 1 table
变压器真的无所不能吗?论跨任务归纳偏差的兼容性
机构 * Idiap Research Institute(Idiap研究所) ; EPFL(洛桑联邦理工学院) ; Adelaide University(阿德莱德大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 研究探讨变压器对给定任务是否最优,提出为数据集优化变压器架构的方法,在算法玩具任务和代码语言建模数据集上实验,发现标准变压器非局部最优,简单替代方案有优劣,暗示有改进架构可支持多种能力。
Comments Published as a conference paper at ICLR 2026. https://github.com/idiap/lm-afs
弥合信息差距:冷启动预测的语义致密化与事后蒸馏
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对电子商务平台新用户冷启动预测难题,SemRaD框架利用结构化语义推理管道和事后感知蒸馏网络,有效弥合信息差距,提升了LTV和CVR,减少训练数据用量,在工业数据集和在线测试中均取得良好效果。