arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2606.15107 2026-06-16 cs.AI 新提交 74%

Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning

迈向可验证的自主数据科学:通过基于工具的推理解决不规则时间序列问答

Sanhorn Chen, Xiaoyang Chen, Boyu Liu, Roy Zhao

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 针对现实世界时间序列数据的不规则性,提出IRTS-ToolBench基准(1700个问题,10种任务类型,13个领域),通过标准化输入和可复现评估协议,研究LLM和AI代理在不规则条件下的表现。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04806 2026-06-04 cs.CV cs.AI 74%

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

机构 * The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学) RMIT University(皇家墨尔本理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30344 2026-05-29 cs.AI 74%

Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection

小巧但可信:面向时间序列异常检测的高效视觉-语言推理

Xiaona Zhou, Muntasir Wahed, Tianjiao Yu, Constantin Brif, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sandia National Laboratories(桑迪亚国家实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 针对时间序列异常检测中缺乏自然语言解释的问题,构建VisAnomBench基准并微调参数高效的视觉-语言模型VisAnomReasoner,在准确性和泛化性上显著超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22047 2026-05-22 cs.AI 74%

Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

大语言模型在临床决策支持中的主动证据获取与诊断推理

Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu, Lu Gan

机构 * Tencent Youtu Lab(腾讯优图实验室) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 研究探讨了大语言模型在临床决策支持中的主动证据获取与诊断推理问题,提出了一种基于OSCE的标准化患者模拟器和可控可复现的基准测试,发现多轮证据获取会降低诊断准确性并降低支持证据质量,表明静态全上下文基准可能高估交互证据获取场景中的性能,需引入互补的交互评估以提高临床决策安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 74%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10032 2026-05-13 cs.CL 74%

PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

PlantMarkerBench: 一个多物种证据导向植物标记推理基准

Sajib Acharjee Dip, Song Li, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) School of Plant and Environmental Sciences, Virginia Tech(弗吉尼亚理工学院植物与环境科学学院) Fralin Biomedical Research Institute, Virginia Tech(弗吉尼亚理工学院弗拉林生物医学研究学院) FBRI Cancer Research Center, Washington, DC(华盛顿特区FBRI癌症研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出PlantMarkerBench,通过整合文献检索与生物 grounding,构建了包含4种植物的基准,评估文献支持的植物标记证据解释,发现模型在功能、间接和弱支持证据上表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09618 2026-05-12 cs.CL cs.CY 74%

Statistical Scouting Finds Debate-Safe but Not Debate-Useful Cases: A Matched-Ceiling Study of Open-Weight LLM Reasoning Protocols

统计 scouting 找到辩论安全但不实用的案例:开放权重 LLM 推理协议的匹配天花板研究

Julia Hu, Alfred Shen, Kumar Lakshmipathi

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 研究探讨在生成 token 数限制下,不同推理协议的路由头寸及恢复潜力,发现辩论安全性和实用性不一致,需更复杂的信号来优化。

Comments 14 pages, 5 figures. Technical report / preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08815 2026-05-12 cs.LG q-bio.BM q-bio.GN q-bio.QM 74%

MicroFuse: Protein-to-Genome Expert Fusion for Microbial Operon Reasoning

MicroFuse:用于微生物启动子推理的蛋白质到基因组专家融合

Seungik Cho

机构 * Department of Physics and Astronomy, Rice University, Texas, USA(物理与天文学系,里士满大学,德克萨斯州,美国)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 本文提出MicroFuse框架,通过融合蛋白质结构表示和基因组上下文表示,提升微生物启动子预测的准确性。在OG-Operon100K数据集上,MicroFuse在多个评估指标上表现最优,尤其在生物上模糊的情况中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI 74%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22136 2026-04-27 cs.CR cs.LG 74%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17114 2026-04-21 cs.CL 74%

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richard Röttger

机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) Universitätsmedizin Göttingen(哥廷根大学医学中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。

Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28325 2026-04-15 cs.CE cs.AI 74%

Building evidence-based knowledge bases from full-text literature for disease-specific biomedical reasoning

从全文文献构建基于证据的知识库以支持疾病特定的生物医学推理

Chang Zong, Sicheng Lv, Si-tu Xue, Huilin Zheng, Jian Wan, Lei Zhang

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) Institute of Medicinal Biotechnology, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院药物生物技术研究所) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology(浙江省生物医学智能计算技术重点实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出EvidenceNet,一个基于全文文献构建的疾病特定知识库,通过大语言模型提取实验支持的结构化证据记录,用于生物医学推理任务。

Comments 30 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10658 2026-04-14 cs.AI cs.CY cs.MA 74%

Governed Reasoning for Institutional AI

机构AI中的受控推理

Mamadou Seck

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出Cognitive Core,通过九种类型认知原语和四层治理模型,解决机构决策中需要的AI架构问题,实现高准确率和零静默错误,引入治理性作为评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 74%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12665 2026-02-16 cs.AI 74%

Evaluating Robustness of Reasoning Models on Parameterized Logical Problems

评估参数化逻辑问题上推理模型的鲁棒性

Naïm Es-sebbani, Esteban Marquer, Yakoub Salhi, Zied Bouraoui

机构 * CRIL UMR 8188, Univ Artois, CNRS, France(CRIL UMR 8188,阿维尼翁大学,法国国家科学研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出了一种针对2-SAT的诊断基准,用于评估推理模型在参数化逻辑问题上的鲁棒性,通过隔离不同能力与失败模式,揭示模型在结构干预下的性能变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11409 2026-02-13 cs.AI 74%

TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning

TRACER:轨迹风险聚合用于代理推理中的关键事件

Sina Tayebati, Divake Kumar, Nastaran Darabi, Davide Ettori, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) AI Labs at Capital One(Capital One 人工智能实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 TRACER通过轨迹级不确定性度量提升复杂对话工具使用中的不确定性检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 74%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00352 2026-02-03 cs.CL 74%

DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning

DETOUR:双智能体搜索与推理的交互基准

Li Siyan, Darshan Deshpande, Anand Kannappan, Rebecca Qian

机构 * Patronus AI DAP Lab(DAP实验室) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 74%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21422 2026-02-02 cs.CL 74%

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架

Nils Dycke, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。

Comments accepted to TACL 2026 (presented at EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20757 2026-01-29 cs.CL 74%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03369 2026-01-22 cs.CV cs.CL 74%

RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models

RiskCueBench: 视频语言模型中早期风险信号的前瞻性推理基准测试

Sha Luo, Yogesh Prabhu, Timothy Ossowski, Kaiping Chen, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 RiskCueBench通过标注早期风险信号片段,评估视频语言模型在预测未来风险事件中的能力,揭示了现有系统在解读动态情境方面的不足。

Comments *updated author email in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16202 2026-01-06 cs.AI 74%

Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning

多智能体协作奖励设计以增强强化学习中的推理

Pei Yang, Ke Zhang, Ji Wang, Xiao Chen, Yuxin Tang, Eric Yang, Lynn Ai, Bill Shi

机构 * Gradient Waseda University(早稻田大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Rice University(莱斯大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21878 2025-12-29 cs.MA cs.AI 74%

MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting

MASFIN:一种用于分解金融推理和预测的多智能体系统

Marc S. Montalvo, Hamed Yaghoobian

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 MASFIN通过整合LLMs与结构化财务指标和非结构化新闻,提出了一种模块化的多智能体系统,以提高金融预测的透明性和可重复性,实现优于基准的短期投资回报。

Comments Accepted to the NeurIPS 2025 Workshop on Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21431 2025-12-29 cs.SE cs.LG 74%

Cerberus: Multi-Agent Reasoning and Coverage-Guided Exploration for Static Detection of Runtime Errors

Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测

Hridya Dhulipala, Xiaokai Rong, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 74%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12596 2025-12-16 cs.CV cs.AI 74%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 推理评测 :chain-of-thought(title);分类 cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12208 2025-12-08 cs.AI 74%

Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering

混合知识辩论:一种用于不完整知识图谱问答的鲁棒多智能体推理框架

Jilong Liu, Pengyang Shao, Wei Qin, Fei Liu, Yonghui Yang, Richang Hong

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出DoM框架,通过多智能体辩论机制整合结构化和非结构化知识,解决不完整知识图谱问答中的知识互补性问题,并引入新数据集提升基准挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 74%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17267 2025-11-04 cs.CL 74%

GreekBarBench: A Challenging Benchmark for Free-Text Legal Reasoning and Citations

Odysseas S. Chlapanis, Dimitrios Galanis, Nikolaos Aletras, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(信息学院,雅典经济与商业大学) Archimedes, Athena Research Center(阿提卡研究中心-阿基米德) Athena Research Center(阿提卡研究中心) University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments 19 pages, 17 figures, accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏