arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-21 至 2025-11-21 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 15 篇

2506.06941 2025-11-21 cs.AI cs.CL cs.LG 82%

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

思维的幻觉:通过问题复杂性的视角理解推理模型的优势与局限

Parshin Shojaee, Iman Mirzadeh, Keivan Alizadeh, Maxwell Horton, Samy Bengio, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过问题复杂性分析,研究揭示大规模推理模型在不同复杂度任务中的表现差异及局限性。

Comments NeurIPS 2025. camera-ready version + additional discussion in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15994 2025-11-21 cs.AI cs.CL 81%

CARE-RAG - Clinical Assessment and Reasoning in RAG

CARE-RAG - 临床评估与推理中的RAG

Deepthi Potluri, Aby Mammen Mathew, Jeffrey B DeWitt, Alexander L. Rasgon, Yide Hao, Junyuan Hong, Ying Ding

机构 * Department of Computer Science(计算机科学系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Behavioral Science and Psychiatry(行为科学与精神病学) Department of Statistics(统计学系) University of Michigan(密歇根大学) School of Information(信息学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CARE-RAG研究了检索增强生成在临床环境中的推理能力,提出评估框架以确保推理的准确性和一致性。

Comments The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 81%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16198 2025-11-21 cs.CL cs.DL 79%

SemanticCite: Citation Verification with AI-Powered Full-Text Analysis and Evidence-Based Reasoning

SemanticCite: 借助AI全文本分析和基于证据的推理进行引文验证

Sebastian Haan

机构 * The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SemanticCite通过AI全文本分析和证据推理,提供高效的引文验证系统,结合多种检索方法和四类分类系统,实现精准的引文准确性验证,并开源数据集和模型以促进研究诚信。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15717 2025-11-21 cs.AI cs.CV cs.MA 79%

How Modality Shapes Perception and Reasoning: A Study of Error Propagation in ARC-AGI

模态如何塑造感知与推理:ARC-AGI中误差传播的研究

Bo Wen, Chen Wang, Erhan Bilal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过对比文本和图像模态,发现结构化文本能精确获取稀疏特征,图像对分辨率敏感,结合两者可提升执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14366 2025-11-21 cs.CL 79%

ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning

ATLAS:面向前沿科学推理的高难度、多学科基准

Hongwei Liu, Junnan Liu, Shudong Liu, Haodong Duan, Yuqiang Li, Mao Su, Xiaohong Liu, Guangtao Zhai, Xinyu Fang, Qianhong Ma, Taolin Zhang, Zihan Ma, Yufeng Zhao, Peiheng Zhou, Linchen Xiao, Wenlong Zhang, Shijie Zhou, Xingjian Ma, Siqi Sun, Jiaye Ge, Meng Li, Yuhong Liu, Jianxin Dong, Jiaying Li, Hui Wu, Hanwen Liang, Jintai Lin, Yanting Wang, Jie Dong, Tong Zhu, Tianfan Fu, Conghui He, Qi Zhang, Songyang Zhang, Lei Bai, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ATLAS是一个由领域专家开发的高难度、跨学科科学推理基准,通过原创问题和严格质量控制,评估模型在多领域知识整合和复杂推理能力上的表现。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16150 2025-11-21 cs.CV 78%

Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval

基于推理的嵌入:利用多模态大语言模型推理提升多模态检索

Chunxu Liu, Jiyuan Yang, Ruopeng Gao, Yuhan Zhu, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于推理的嵌入方法,利用多模态大语言模型的推理能力提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16356 2025-11-21 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

CaKE: Circuit-aware Editing Enables Generalizable Knowledge Learners

CaKE:电路感知编辑实现通用知识学习

Yunzhi Yao, Jizhan Fang, Jia-Chen Gu, Ningyu Zhang, Shumin Deng, Huajun Chen, Nanyun Peng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CaKE通过电路感知编辑提升LLMs对更新知识的多跳推理能力,实现20%的准确率提升并降低内存消耗

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16267 2025-11-21 cs.CL cs.AI 62%

From Confidence to Collapse in LLM Factual Robustness

从信心到崩溃:大语言模型事实鲁棒性的研究

Alina Fastowski, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种通过分析令牌分布熵和温度缩放敏感性来评估大语言模型事实鲁棒性的新方法,并通过实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16438 2025-11-21 cs.CL cs.IR 57%

ESGBench: A Benchmark for Explainable ESG Question Answering in Corporate Sustainability Reports

ESGBench:用于企业可持续发展报告中可解释ESG问答的基准

Sherine George, Nithish Saji

机构 * BNY FedEx

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ESGBench是一个用于评估企业可持续发展报告中可解释ESG问答系统性能的基准,通过领域相关问题和人工整理答案来评估模型推理能力,揭示了事实一致性、可追溯性和领域对齐等关键挑战。

Comments Workshop paper accepted at AI4DF 2025 (part of ACM ICAIF 2025). 3 pages including tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16231 2025-11-21 cs.LG 57%

Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective

Pass@k指标用于RLVR:探索的诊断工具,而非目标

Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文分析了pass@k指标作为强化学习中探索诊断工具的优劣,指出其作为优化目标的局限性,并提出鼓励高效探索的机制作为替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14813 2025-11-21 cs.LG 57%

DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models

DEVAL:一个用于评估和提升大语言模型推导能力的框架

Yifan Li, Qin Li, Min Zhang, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 DEVAL框架通过评估和提升大语言模型的推导能力,提出了一种新的提示工程方法DP,显著提高了模型在问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 57%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20470 2025-11-21 cs.CV 50%

Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence

Conan:基于多尺度视觉证据的逐步学习以像侦探一样推理

Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 推理评测 :reasoning(abstract)

AI总结 Conan通过多阶段渐进冷启动策略和AIR RLVR框架,实现证据基础的多步视频推理,超越基线模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏