arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2602.10787 2026-02-12 cs.SE cs.AI cs.CR cs.IR 79%

VulReaD: Knowledge-Graph-guided Software Vulnerability Reasoning and Detection

VulReaD: 基于知识图谱的软件漏洞推理与检测

Samal Mukhtar, Yinghua Yao, Zhu Sun, Mustafa Mustafa, Yew Soon Ong, Youcheng Sun

机构 * The University of Manchester(曼彻斯特大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VulReaD通过知识图谱引导的推理方法,在软件漏洞检测中实现CWE级别的分类,提升二元和多类检测性能,增强可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 79%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10210 2026-02-12 cs.LG 79%

How Much Reasoning Do Retrieval-Augmented Models Add beyond LLMs? A Benchmarking Framework for Multi-Hop Inference over Hybrid Knowledge

检索增强模型在大语言模型之上添加多少推理能力?一种用于混合知识多跳推理的基准评估框架

Junhong Lin, Bing Zhang, Song Wang, Ziyan Liu, Dan Gutfreund, Julian Shun, Yada Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 HybridRAG-Bench通过混合知识和多跳推理评估框架,有效区分真实检索与参数回忆,为混合知识增强推理系统提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10092 2026-02-11 cs.CL 79%

Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing

量子审计:评估大语言模型在量子计算上的推理极限

Mohamed Afane, Kayla Laufer, Wenqi Wei, Ying Mao, Junaid Farooq, Ying Wang, Juntao Chen

机构 * Fordham University(福特汉姆大学) University of Michigan-Dearborn(密歇根大学-迪尔本分校) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09147 2026-02-11 cs.CL 79%

Overview of PAN 2026: Voight-Kampff Generative AI Detection, Text Watermarking, Multi-Author Writing Style Analysis, Generative Plagiarism Detection, and Reasoning Trajectory Detection

PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测

Janek Bevendorff, Maik Fröbe, André Greiner-Petter, Andreas Jakoby, Maximilian Mayerl, Preslav Nakov, Henry Plutz, Martin Potthast, Benno Stein, Minh Ngoc Ta, Yuxia Wang, Eva Zangerle

机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) University of Applied Sciences BFI(应用科学大学BFI) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) University of Kassel(卡塞尔大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08321 2026-02-11 cs.CL 79%

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

改进大型语言模型中的数据与奖励设计以提升科学推理能力

Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08675 2026-02-10 cs.NI cs.AI 79%

6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18715 2026-02-10 cs.AI 79%

HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions

HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架

Shaoyin Ma, Chenggong Hu, Huiqiong Wang, Li Sun, Mingli Song, Jie Song

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22443 2026-02-10 cs.CL 79%

Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis

在大型语言模型中进行会计推理:概念、评估与实证分析

Jie Zhou, Xin Chen, Jie Zhang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了会计推理的概念、评估方法及实证分析,发现GPT-4在会计推理任务中表现最佳,但现有LLMs仍需优化以满足实际应用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06319 2026-02-09 cs.AI 79%

Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems

通过图算法问题揭示大推理模型的弱点

Qifan Zhang, Jianhao Ruan, Aochuan Chen, Kang Zeng, Nuo Chen, Jing Tang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GrAlgoBench通过图算法问题揭示大推理模型在长上下文推理和过度思考方面的不足,为改进推理研究提供严格测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05496 2026-02-06 cs.MM cs.AI cs.CV 79%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16048 2026-02-06 cs.AI 79%

SPhyR: Spatial-Physical Reasoning Benchmark on Material Distribution

SPhyR:基于材料分布的空间-物理推理基准

Philipp D. Siedler

机构 * Aleph Alpha Research(Aleph Alpha研究机构)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPhyR数据集通过拓扑优化任务评估LLM在空间和物理推理方面的能力,无需模拟工具即可推断最优材料分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05120 2026-02-06 cs.CC cs.LG 79%

Certifiable Boolean Reasoning Is Universal

可验证的布尔推理是通用的

Wenhao Li, Anastasis Kratsios, Hrad Ghoukasian, Dennis Zvigelsky

机构 * University of Toronto(多伦多大学) McMaster University(麦基尔大学) Vector Institute(向量研究所) Scuola Normale Superiore di Pisa(比萨normal高等学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种深度学习架构,能够确证性地推理并通用性地处理任何布尔任务,且在简单布尔任务中参数需求低。

Comments Submitted to COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 79%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04112 2026-02-05 cs.CL 79%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03340 2026-02-04 cs.AI 79%

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis

MentalSeek-Dx: 向现实世界精神病诊断的渐进性假说-演绎推理迈进

Xiao Sun, Yuming Yang, Junnan Zhu, Jiang Zhong, Xinyu Zhou, Kaiwen Wei

机构 * School of Computer Science Chongqing University(重庆大学计算机学院) MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MentalSeek-Dx通过监督轨迹构建和课程强化学习,实现了在现实世界精神病诊断中的渐进性假说-演绎推理,以提升临床诊断的可靠性。

Comments 36 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 79%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 79%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02295 2026-02-03 cs.LG 79%

EvalQReason: A Framework for Step-Level Reasoning Evaluation in Large Language Models

EvalQReason: 一种用于大型语言模型中分步推理评估的框架

Shaima Ahmad Freja, Ferhat Ozgur Catak, Betul Yurdem, Chunming Rong

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger(电子工程与计算机科学系,斯塔万格大学) Department of Electrical and Electronics Engineering, Izmir Bakircay University(电子与电气工程系,伊兹密尔巴克伊大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 EvalQReason通过分步概率分布分析评估大型语言模型的推理质量,展示了在数学和医学领域中对推理可靠性的有效评估方法。

Comments 15 pages (including appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02136 2026-02-03 cs.AI 79%

Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models

通过基于分布的细化缓解安全税在大推理模型中的影响

Yingsha Xie, Tiansheng Huang, Enneng Yang, Rui Min, Wenjie Lu, Xiaochun Cao, Naiqiang Tan, Li Shen

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区计算机科学与技术学院) Hong Kong University of Science(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DGR方法,通过基于分布的细化缓解大推理模型中的安全税,提升推理准确性和安全性。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02004 2026-02-03 cs.CV cs.AI 79%

ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning

ClueTracer: 问题到视觉线索追踪用于无训练 hallucination 抑制在多模态推理

Gongli Xi, Kun Wang, Zeming Gao, Huahui Yi, Haolang Lu, Ye Tian, Wendong Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) West China Biomedical Big Data Center(西京生物大数据中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ClueTracer通过问题到视觉线索追踪,无训练抑制多模态推理中的幻觉,提升推理和非推理任务性能。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01779 2026-02-03 cs.AI 79%

LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning

LingLanMiDian: LLMs在中医知识与临床推理上的系统评估

Rui Hua, Yu Wei, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Zeyu Liu, Hui Zhu, Shujie Song, Mingzhong Xiao, Xiaodong Li, Dongmei Jia, Zhuye Gao, Yanyan Meng, Naixuan Zhao, Yu Fu, Haibin Yu, Benman Yu, Yuanyuan Chen, Fei Dong, Zhizhou Meng, Pengcheng Yang, Songxue Zhao, Lijuan Pei, Yunhui Hu, Kan Ding, Jiayuan Duan, Wenmao Yin, Yang Gu, Runshun Zhang, Qiang Zhu, Jian Yu, Jiansheng Li, Baoyan Liu, Wenjia Wang, Xuezhong Zhou

机构 * Department of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(北京交通大学计算机科学与技术学院) Tianjin Tasly Digital Chinese Medicine Technology Co., Ltd.(天津塔斯丽数字中医科技有限公司) Tasly Biopharmaceuticals Co., Ltd.(塔斯丽生物医药有限公司) State Key Laboratory of Chinese Medicine Modernization, Tianjin, China(中药现代化国家工程实验室,天津,中国) Institute of Liver Diseases, Hubei Key Laboratory of the theory and application research of liver and kidney in traditional Chinese medicine, Hubei Provincial Hospital of Traditional Chinese Medicine, Wuhan, China(肝病研究所,湖北省中医肝肾理论与应用研究重点实验室,湖北省中医药研究院,武汉,中国) Affiliated Hospital of Hubei University of Chinese Medicine, Wuhan, China(湖北中医药大学附属医院,武汉,中国) Hubei Province Academy of Traditional Chinese Medicine, Wuhan, China(湖北省中医药研究院,武汉,中国) Department of Gastroenterology, Guang’anmen Hospital, China Academy of Chinese Medical Sciences, Beijing, China(消化内科,广安门医院,中国中医科学院,北京,中国) China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院,北京,中国) China Institute for History of Medicine and Medical Literature, China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院中国医学史与医学文献研究所,北京,中国) Beijing Research Institute of Chinese Medicine, Beijing University of Chinese Medicine, Beijing, China(北京中医研究院,北京中医药大学,北京,中国) Beijing University of Chinese Medicine Third Affiliated Hospital, Beijing University of Chinese Medicine, Beijing 100029, China(北京中医药大学第三附属医院,北京中医药大学,北京100029,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 LingLan基准测试系统评估了LLMs在中医知识和临床推理上的表现,揭示了当前模型与专家在专门推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00543 2026-02-03 cs.CL 79%

Reasoning by Commented Code for Table Question Answering

通过注释代码进行表格问题回答

Seho Pyo, Jiheon Seok, Jaejin Lee

机构 * Department of Data Science, Seoul National University, Seoul, Republic of Korea(数据科学系,首尔国立大学,首尔,大韩民国) Department of Computer Science(计算机科学系) Engineering, Seoul National University, Seoul, Republic of Korea(工程系,首尔国立大学,首尔,大韩民国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过注释代码生成框架提升表格问题回答的准确率,结合端到端模型实现84.3%的高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16286 2026-02-03 cs.AI cs.MA 79%

SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems

SemanticALLI: 在智能体系统中缓存推理,而非仅响应

Varun Chillara, Dylan Kline, Christopher Alvares, Evan Wooten, Huan Yang, Shlok Khetan, Cade Bauer, Tré Guillory, Tanishka Shah, Yashodhara Dhariwal, Volodymyr Pavlov, George Popstefanov

机构 * PMG

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SemanticALLI通过分解生成过程,实现智能体系统中结构化中间表示的缓存,提升推理效率并减少LLM调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22742 2026-02-02 cs.CL 79%

AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction

AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试

Yifei Li, Richong Zhang, Wanyu Tu, Zhijie Nie, Haokun Luo, Chuantao Yin, Pengchong Li

机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) SCCE University of Science and Technology Beijing(北京科技大学计算机学院) Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) People’s Procuratorate of Beijing Municipality(北京市人民检察院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 79%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 79%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 79%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏