arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2605.29001 2026-05-29 cs.LG cs.AI 76%

FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

FormInv:数学推理基准中语义不变性的测量协议

Nishal Thomas, Noel Thomas

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 提出FormInv协议,通过跨模型一致性审计检测语义错误,并引入语义一致性率(SCR)和Cochran's Q指标,揭示标准基准无法捕捉的排名变化和模型不一致性。

Comments 18 pages, 3 figures. Under review for the 3rd AI for Math Workshop (AI4Math), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07231 2026-05-27 cs.CL cs.AI 76%

EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models

EconCausal: 面向大语言模型的上下文感知经济推理基准

Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) Data Science for Humanity Group, MPI-SP(马克斯·普朗克所际数据科学为人类集团) School of Computing, KAIST(韩国科学技术院计算学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 提出EconCausal基准,包含从顶级经济金融期刊提取的10,490个上下文标注因果三元组,评估大语言模型在指定上下文中推断因果方向及随上下文变化调整判断的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11453 2026-05-15 cs.MA cs.AI cs.LG cs.SI math.SP 76%

Predictive Maps of Multi-Agent Reasoning: A Successor-Representation Spectrum for LLM Communication Topologies

多智能体推理的预测地图:一种用于LLM通信拓扑的后继表示谱

Ethan Parks, Dalal Alharthi

机构 * University of Arizona(亚利桑那大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于后继表示谱的结构诊断方法,用于评估多智能体LLM通信拓扑的性能,通过分析谱半径、谱间隙和条件数等指标,预测拓扑在漂移、共识和扰动鲁棒性方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04825 2026-04-21 cs.CL cs.AI 76%

Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not

可解释性作为常识推理:人类成功,大语言模型却不成功

Sercan Karakaş

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型是否能像人类一样在歧义解析中结合世界知识与句法结构。通过土耳其前置定语从句附着歧义,发现人类表现出显著的可解释性效应,而大语言模型则表现不一致。

Comments Accepted to The Workshop on Cognitive Modeling and Computational Linguistics co-located with LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20586 2026-03-25 cs.LG cs.AI 76%

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

MKA:用于高效长上下文推理的内存键注意

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出MKA机制,通过多级KV缓存和动态路由提升长上下文推理效率,FastMKA在保持准确率的同时显著提升训练速度和评估效率。

Comments Accepted to the ACM Computing Frontiers 2026 Conference (Oral Presentation) and the ICML 2025 Long Context Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20969 2026-03-24 cs.LG cs.CL 76%

Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge

理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理

Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis

机构 * University of Southern California(南加州大学) University of British Columbia(不列颠哥伦比亚大学) Flatiron Institute(Flatiron研究所)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 76%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13159 2025-12-16 cs.AI cs.CL 76%

SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning

SpeakRL: 在语言模型中协同推理、说话与行动以增强强化学习

Emre Can Acikgoz, Jinoh Oh, Jie Hao, Joo Hyuk Jeon, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur, Xiang Li, Chengyuan Ma, Xing Fan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Alexa(亚马逊Alexa)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SpeakRL通过强化学习提升语言模型的对话能力,通过奖励主动互动提高任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17584 2025-11-25 cs.LG cs.AI 76%

LLM-Powered Text-Attributed Graph Anomaly Detection via Retrieval-Augmented Reasoning

通过检索增强推理的大型语言模型驱动的文本属性图异常检测

Haoyan Xu, Ruizhi Qian, Zhengtao Yao, Ziyi Liu, Li Li, Yuqi Li, Yanshu Li, Wenqing Zheng, Daniele Rosa, Daniel Barcklow, Senthil Kumar, Jieyu Zhao, Yue Zhao

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于检索增强推理的LLM驱动文本属性图异常检测框架,通过生成语义连贯但上下文不一致的异常节点,提升异常检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26205 2025-11-05 cs.CL cs.AI 76%

Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning

Qi Luo, Xiaonan Li, Tingshuo Fan, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06915 2025-10-28 cs.CL cs.AI 76%

DocFinQA: A Long-Context Financial Reasoning Dataset

Varshini Reddy, Rik Koncel-Kedziorski, Viet Dac Lai, Michael Krumdick, Charles Lovering, Chris Tanner

机构 * Kensho Technologies(肯斯霍技术公司)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20193 2025-10-24 cs.IR cs.CL cs.CV cs.LG 76%

Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures

Rahul Raja, Arpita Vats

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07243 2025-10-09 cs.CL cs.AI 76%

LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation

Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha, Arijit Ghosh Chowdhury, Prashanth Kallur Ramaswamy, Jeremy Roghair, Hannah R Marlowe, Carina Suzana Negreanu, Kitty Boxall, Diana Mincu

机构 * Robin AI Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments Published in Natural Legal Language Processing - EMNLP Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14279 2025-09-30 cs.CL cs.CY cs.LG 76%

GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs

Adrian-Marius Dumitran, Alexandra-Mihaela Danila, Angela-Liliana Dumitran

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯大学数学与计算机科学学院)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

Comments Accepted as long paper @RANLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21464 2025-03-28 cs.CL cs.AI cs.PF 76%

Harnessing Chain-of-Thought Metadata for Task Routing and Adversarial Prompt Detection

Ryan Marinelli, Josef Pichlmeier, Tamas Bisztray

专题命中 推理评测 :chain-of-thought(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03490 2025-03-24 cs.AI cs.LG 76%

Examining Two Hop Reasoning Through Information Content Scaling

David Johnston, Nora Belrose

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00355 2025-03-04 cs.CL cs.AI 76%

Structured Reasoning for Fairness: A Multi-Agent Approach to Bias Detection in Textual Data

Tianyi Huang, Elsa Fan

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments Accepted Paper (Oral Presentation) in the Workshop on the Social Impact of AI: Research, Diversity and Inclusion Frameworks at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15815 2025-02-25 cs.LG astro-ph.CO cs.AI hep-ph hep-th 76%

Theoretical Physics Benchmark (TPBench) -- a Dataset and Study of AI Reasoning Capabilities in Theoretical Physics

Daniel J. H. Chung, Zhiqi Gao, Yurii Kvasiuk, Tianyi Li, Moritz Münchmeyer, Maja Rudolph, Frederic Sala, Sai Chaitanya Tadepalli

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

Comments 48 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12844 2025-02-21 cs.CL cs.LG stat.ML 76%

metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models

Alex Kipnis, Konstantinos Voudouris, Luca M. Schulze Buschoff, Eric Schulz

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

Comments accepted for publication at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17785 2025-01-30 cs.CL cs.LG 76%

Reasoning Over the Glyphs: Evaluation of LLM's Decipherment of Rare Scripts

Yu-Fei Shih, Zheng-Lin Lin, Shu-Kai Hsieh

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13125 2024-12-16 cs.CL cs.AI 76%

TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning

Xiang Li, Yunshi Lan, Chao Yang

专题命中 推理评测 :planning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00922 2024-11-08 cs.CL cs.AI 76%

MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning

Shuyue Stella Li, Vidhisha Balachandran, Shangbin Feng, Jonathan S. Ilgen, Emma Pierson, Pang Wei Koh, Yulia Tsvetkov

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01246 2024-10-03 cs.CL cs.AI 76%

AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses

Xiaotian Lu, Jiyi Li, Koh Takeuchi, Hisashi Kashima

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments Accepted for EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03175 2024-09-25 cs.LG cs.AI 76%

Beyond the Black Box: A Statistical Model for LLM Reasoning and Inference

Siddhartha Dalal, Vishal Misra

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06044 2024-06-04 cs.AI cs.CL 76%

OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models

Hainiu Xu, Runcong Zhao, Lixing Zhu, Jinhua Du, Yulan He

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07859 2024-02-21 cs.CL cs.AI 76%

Lissard: Long and Simple Sequential Reasoning Datasets

Mirelle Bueno, Roberto Lotufo, Rodrigo Nogueira

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07295 2023-02-09 cs.CL cs.LG 76%

Joint Reasoning on Hybrid-knowledge sources for Task-Oriented Dialog

Mayank Mishra, Danish Contractor, Dinesh Raghu

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 75%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 75%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: https://orarl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 75%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏