arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2509.16656 2026-01-29 cs.AI 79%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19773 2026-01-28 cs.CL 79%

Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis

强推理并不足够:评估交互诊断中的证据获取

Zhuohan Long, Zhijie Bao, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出REFINE策略,通过诊断验证引导代理主动解决不确定性,提升交互诊断中证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02091 2026-01-28 cs.AI 79%

Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning

解析大语言模型中层的作用:检索、知识与推理

Xinyuan Song, Keyu Wang, PengXiang Li, Lu Yin, Shiwei Liu

机构 * Emory University(埃默里大学) University of Tuebingen(图宾根大学) University of Surrey(萨里大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究解析了大语言模型中不同深度层在检索、知识和推理中的作用,发现浅层主导知识和检索,深层影响推理,且不同评估方法下深度利用存在显著差异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 79%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 79%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18132 2026-01-27 cs.AI 79%

RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening

RareAlert: 对齐异构大语言模型推理以实现早期罕见病风险筛查

Xi Chen, Hongru Zhou, Huahui Yi, Shiyu Feng, Hanyu Zhou, Tiancheng He, Mingke You, Li Wang, Qiankun Li, Kun Wang, Weili Fu, Kang Li, Jian Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RareAlert通过整合多个LLM推理并校准后生成单一模型,实现早期罕见病风险筛查,其AUC达到0.917,优于现有方法。

Comments 28 page, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13545 2026-01-27 cs.AI cs.ET cs.MA 79%

TruthTensor: Evaluating LLMs through Human Imitation on Prediction Market under Drift and Holistic Reasoning

TruthTensor:通过人类模仿在预测市场中评估LLM的漂移和整体推理

Shirin Shahabi, Spencer Graham, Haruna Isah

机构 * Inference Labs Inc(Inference Labs公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TruthTensor通过人类模仿在预测市场中评估LLM的漂移和整体推理,提供多维度的评估方法。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13095 2026-01-27 cs.CL 79%

BeDiscovER: The Benchmark of Discourse Understanding in the Era of Reasoning Language Models

BeDiscovER:推理语言模型时代 discourse 理解的基准

Chuyuan Li, Giuseppe Carenini

机构 * Department of Computer Science University of British Columbia(计算机科学系加拿大不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BeDiscovER是一个用于评估推理语言模型 discourse 理解能力的基准,涵盖多个 discourse 任务,评估了多个开源模型的表现。

Comments Camera-ready version of eacl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16685 2026-01-26 cs.AI 79%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13753 2026-01-23 cs.CL 79%

SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning

SCALAR: 基于科学引用的长上下文学术推理实时评估

Renxi Wang, Honglin Mu, Liqun Ma, Lizhi Lin, Yunlong Feng, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SCALAR通过基于学术引用的长上下文推理评估框架,评估模型在学术写作中的推理能力,发现多项选择任务能有效区分模型性能,而填空式引用预测任务更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08134 2026-01-22 cs.CL 79%

How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains

大型推理模型的置信度估计有多可靠?对高风险领域的系统基准测试

Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Ivan Brugere, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过系统基准测试,评估了大型推理模型置信度估计方法的可靠性,发现基于文本的编码器在歧视方面表现最佳,而结构感知模型在校准方面表现最佳,揭示了当前方法的局限性。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026) main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14700 2026-01-22 cs.CL 79%

DARL: Encouraging Diverse Answers for General Reasoning without Verifiers

DARL: 促进无验证者的一般推理中的多样化答案

Chongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Kuaishou Technology(快手科技) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化和旅游部)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DARL通过鼓励在参考答案可控偏差范围内生成多样化答案,提升大语言模型在一般推理任务中的性能和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14479 2026-01-22 cs.CL 79%

Can LLM Reasoning Be Trusted? A Comparative Study: Using Human Benchmarking on Statistical Tasks

大语言模型的推理能力是否可信?:通过统计任务的人类基准测试

Crish Nagarkar, Leonid Bogachev, Serge Sharoff

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过统计任务的人类基准测试,评估了大语言模型在统计推理和自我评估能力上的表现,发现微调后的模型在统计任务上表现优异,且能更有效地评估答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14349 2026-01-22 cs.MA cs.LG 79%

MARBLE: Multi-Agent Reasoning for Bioinformatics Learning and Evolution

MARBLE: 多智能体推理用于生物信息学学习与进化

Sunghyun Kim, Seokwoo Yun, Youngseo Yun, Youngrak Lee, Sangsoo Lim

机构 * Division of AI Convergence, Dongguk University, Seoul, South Korea(东国大学人工智能融合系) AI Research Team, Ar-ge Inc., Seoul, South Korea(Ar-ge公司人工智能研究团队) Department of Biomedical Engineering, Dongguk University, Goyang-si, Gyeonggi-do, South Korea(东国大学生物医学工程系) Department of Computer Science and Artificial Intelligence, Dongguk University, Seoul, South Korea(东国大学计算机科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MARBLE通过多智能体推理实现生物信息学模型的稳定优化,提升性能并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13690 2026-01-21 cs.CL 79%

Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning

通过结构化诊断推理数据和强化学习增强临床诊断探究

Yue Guo, Fanfu Wang, Jianwei Lv, Xincheng Shi, Yuchen Li, Youya Wang, Yunsheng Zeng, Yujing Liu, Yunhao Qiao, Gen Li, Junfeng Wang, Bo Yuan

机构 * Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Dr. Assistant通过结构化诊断推理数据和强化学习提升临床诊断能力,优于开放源代码模型并接近闭源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13546 2026-01-21 cs.AI 79%

ChatAD: Reasoning-Enhanced Time-Series Anomaly Detection with Multi-Turn Instruction Evolution

ChatAD: 基于推理增强的多轮指令演化的时序异常检测

Hui Sun, Chang Xu, Haonan Xie, Hao Li, Yuhao Huang, Chuheng Zhang, Ming Jin, Xiaoguang Liu, Gang Wang, Jiang Bian

机构 * Nankai University(南开大学) Microsoft Research Asia(微软亚洲研究院) Huanjiang Laboratory(焕江实验室) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatAD通过多智能体演化算法和Kahneman-Tversky优化,提升了时序异常检测的推理能力和跨任务泛化性能,实现了显著的准确率和F1值提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13183 2026-01-21 cs.CL 79%

OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand

OpenExempt:法律推理的诊断基准及自定义基准框架

Sergio Servantez, Sarah B. Lawsky, Rajiv Jain, Daniel W. Linna, Kristian Hammond

机构 * Northwestern University(西北大学) Adobe Research(Adobe研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OpenExempt通过动态生成法律推理任务和解决方案,提供一个用于诊断评估的基准和框架,揭示模型在复杂推理中的性能差异。

Comments 25 pages, 9 Figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12618 2026-01-21 cs.CL 79%

Disagreement as Data: Reasoning Trace Analytics in Multi-Agent Systems

分歧作为数据:多智能体系统中的推理轨迹分析

Elham Tajik, Conrad Borchers, Bahar Shahrokhian, Sebastian Simon, Ali Keramati, Sonika Pal, Sreecharan Sankaranarayanan

机构 * University at Albany(纽约州立大学阿尔巴尼分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学) Le Mans University(勒曼大学) University of California, Irvine(加州大学尔湾分校) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出利用LLM代理生成的推理轨迹分析分歧,通过余弦相似度检测和量化代理间的分歧,提升定性编码的解释实践和方法论严谨性。

Comments LAK 2026 conference paper, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11866 2026-01-21 cs.CL 79%

Advances in LLM Reasoning Enable Flexibility in Clinical Problem-Solving

大语言模型推理能力的进步促进了临床问题解决的灵活性

Kie Shidara, Preethi Prem, Jonathan Kim, Anna Podlasek, Feng Liu, Ahmed Alaa, Danilo Bernardo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 大语言模型推理能力的提升增强了其在临床问题解决中的灵活性,使其在医学推理任务中表现接近人类水平。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11831 2026-01-19 cs.AI 79%

ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems

ARC-AGI-2:前沿人工智能推理系统的全新挑战

Francois Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers, Henry Pinkard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARC-AGI-2通过更细致的任务设计,为评估人工智能的抽象推理和问题解决能力提供更高级的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 79%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08988 2026-01-15 cs.AI 79%

ART: Action-based Reasoning Task Benchmarking for Medical AI Agents

ART:面向医疗AI代理的基于动作的推理任务基准测试

Ananya Mantravadi, Shivali Dalmia, Abhishek Mukherji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ART通过挖掘真实EHR数据创建挑战性任务,评估医疗AI代理在阈值评估、时间聚合和条件逻辑方面的表现,揭示其推理弱点,推动更可靠的临床决策支持系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 79%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM 79%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :CoT(title);reasoning(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 79%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07342 2026-01-13 cs.AI 79%

Agentic Diagnostic Reasoning over Telecom and Datacenter Infrastructure

基于电信和数据中心基础设施的代理诊断推理

Nicolas Tacheny

机构 * Ni2 Innovation Lab(Ni2创新实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的诊断框架,利用LLM通过MCP协议自主导航基础设施模型,实现故障诊断与影响发现,为自主事件解决和风险预测提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 79%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08344 2026-01-13 cs.AI 79%

What Breaks Knowledge Graph based RAG? Benchmarking and Empirical Insights into Reasoning under Incomplete Knowledge

什么破坏了基于知识图谱的RAG?对在不完整知识下推理的基准测试和经验洞察

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Yuan He, Jiaoyan Chen, Steffen Staab, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) University of Oxford(牛津大学) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BRINK基准测试,揭示了当前KG-RAG方法在知识不完整时推理能力有限,依赖内部记忆且泛化能力各异。

Comments Accepted as a main conference paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14523 2026-01-13 cs.AI 79%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏