arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 79%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20133 2026-04-30 cs.CL 79%

Reasoning Gets Harder for LLMs Inside A Dialogue

在对话中LLM的推理变得更难

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了在对话场景中LLM的推理能力,通过BOULDER基准测试发现,对话环境显著影响LLM性能,揭示了对话多轮交互对推理能力的挑战。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01297 2026-04-30 cs.AI 79%

RE-MCDF: Closed-Loop Multi-Expert LLM Reasoning for Knowledge-Grounded Clinical Diagnosis

RE-MCDF:闭环多专家LLM推理用于知识驱动的临床诊断

Shaowei Shen, Xiaohong Yang, Jie Yang, Lianfen Huang, Yongcai Zhang, Yang Zou, Seyyedali Hosseinalipour

机构 * School of Informatics, Xiamen University, China(厦门大学信息学系, 中国) National Institute for Data Science in Health and Medicine, Xiamen University, China(健康医学数据科学国家研究院, 厦门大学, 中国) Key Laboratory of Intelligent Manufacturing Equipment and Industrial Internet Technology, Fujian Provincial Universities, the School of Information Science and Technology, Xiamen University Tan Kah Kee College, and also with the Department of Informatics and Communication Engineering, Xiamen University, China(福建省智能制造装备与工业互联网技术重点实验室, 福建省高校, 厦门大学信息科学系, 厦门大学坦克 Kee 学院, 以及厦门大学信息与通信工程系, 中国) School of Medicine, Xiamen University, China(厦门大学医学院, 中国) School of Electronic and Information Engineering, Tongji University, China(同济大学电子与信息工程学院, 中国) department of Electrical Engineering, University at Buffalo-SUNY, Buffalo, NY, USA(University at Buffalo-SUNY 电气工程系, Buffalo, NY, 美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对神经科电子病历异质性、稀疏性和噪声问题,提出RE-MCDF框架,通过闭环架构整合三个互补组件,强化疾病间逻辑约束,提升复杂诊断场景性能。

Comments Accepted by International Joint Conference on Neural Networks (IJCNN 2026); 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 79%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 79%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 79%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 79%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 79%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 79%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL 79%

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 79%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10298 2026-04-28 cs.CL 79%

On Emergent Social World Models -- Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models

关于涌现的社会世界模型——证据显示语言模型中理论思维与语用推理的功能整合

Polina Tsvilodub, Jan-Felix Klumpp, Amir Mohammadpour, Jennifer Hu, Michael Franke

机构 * Department of Linguistics University of Tübingen(语言学系图宾根大学) Department of Cognitive Science Johns Hopkins University(认知科学系约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究语言模型是否通过共享的计算机制整合一般理论思维与语言特定的语用推理,以支持语言模型是否具备涌现的社会世界模型。通过行为评估和因果机制实验,分析语言模型在七种理论思维能力子类别上的表现,发现支持功能整合假说。

Comments 39 pages, 20 figures, accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23348 2026-04-28 cs.CV cs.AI 79%

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试

He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Queen Mary University of London(女王学院伦敦大学) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18563 2026-04-28 cs.AI cs.MA econ.TH 79%

Reasonably reasoning AI agents can avoid game-theoretic failures in zero-shot, provably

合理推理的AI代理可以在零样本情况下避免博弈论失败并得到证明

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了AI代理在重复博弈中的稳定性,证明了基于贝叶斯后验采样的代理能趋近纳什均衡,且在未知收益情况下仍保持收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI 79%

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27820 2026-04-24 cs.CL 79%

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

通过反事实多智能体推理提升临床诊断

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) Leaning machines(Leanings machines)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10312 2026-04-23 cs.LG 79%

Training-free retrieval-augmented generation with reinforced reasoning for flood damage nowcasting

无需训练的检索增强生成与强化推理用于洪水损害现在预测

Lipai Huang, Kai Yin, Chia-Fu Liu, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering(城市韧性.AI实验室,土木与环境工程系) Department of Computer Science and Engineering(计算机科学与工程系) Department of Civil, Environmental and Architectural Engineering(土木、环境与建筑工程系) Institute for a Disaster Resilient Texas(德克萨斯灾害韧性研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出R2RAG-Flood框架,通过强化推理实现无需训练的洪水损害现在预测,利用结构化预测器、文本摘要和推理轨迹构建知识库,在推理阶段通过地理邻近和自由样本支持案例推理,提升预测准确性与成本效率。

Comments 18 pages, 3 figures, 8 tables, submitted to CACAIE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 79%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18964 2026-04-22 cs.AI cs.DB 79%

DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

DW-Bench:基于数据仓库图拓扑推理的大型语言模型基准测试

Ahmed G. A. H Ahmed, C. Okan Sakar

机构 * Innosol / Bahçeşehir University(Innosol / 巴赫切希尔大学) Department of Computer Engineering, Bahcesehir University, Turkey(计算机工程系,巴赫切希尔大学,土耳其)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DW-Bench评估LLM在数据仓库模式上的图拓扑推理能力,包含1046个验证正确的问题,实验显示工具增强方法在复杂组合子类型上表现稳定。

Comments 24 pages, 6 figures. Datasets and evaluation code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 79%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18234 2026-04-21 cs.IR cs.AI 79%

Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

评估基于检索增强生成系统的多跳推理:LLM检索评估策略的比较

Lorenz Brehme, Thomas Ströhle, Ruth Breu

机构 * Universität Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过对比三种LLM评估策略,提出上下文感知检索评估(CARE),证明其在提升RAG系统多跳推理能力方面效果显著,尤其在参数多和上下文长的模型中表现更优。

Comments 15 Pages, Accepted for publication at the SynIRgy Workshop, ECIR 2026 (48th European Conference on Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18176 2026-04-21 cs.AI quant-ph 79%

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

量子QA:通过物理一致的数据集和验证意识强化学习增强科学推理

Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Physics, University of Science and Technology of China(中国科学技术大学物理学院) School of Electronics and Information Engineering, Anhui University(安徽大学电子与信息工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出量子QA数据集和验证意识奖励模型,通过物理一致的数据集和强化学习提升科学推理能力,实验证明其在科学领域表现优异。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12320 2026-04-21 cs.CV cs.AI cs.MM 79%

EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports

EgoEsportsQA:一种用于电子竞技感知与推理的视角视频基准

Jianzhe Ma, Zhonghao Cao, Shangkui Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EgoEsportsQA基准,通过六阶段流程收集1745对高质量问答对,评估视频大语言模型在虚拟环境中的感知与推理能力,揭示模型在战术推理和微操作方面的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS 79%

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04809 2026-04-21 cs.AI 79%

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

SCALER:合成可扩展自适应学习环境用于推理

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SCALER通过自适应环境设计维持有效学习信号,解决RL训练中任务难度与模型能力不匹配及训练模式狭窄的问题,提升推理能力。

Comments 22 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09351 2026-04-21 cs.CL 79%

ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering

ReTraceQA:评估小语言模型在常识问答中的推理轨迹

Francesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎大学自然语言处理小组) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ReTraceQA通过引入过程级评估,揭示小语言模型在常识推理中存在大量推理过程错误,但最终答案正确的情况,表明现有评价方法高估了模型能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17186 2026-04-21 cs.SE cs.AI cs.ET cs.HC cs.MA 79%

Persona-Based Requirements Engineering for Explainable Multi-Agent Educational Systems: A Scenario Simulator for Clinical Reasoning Training

基于角色的可解释多智能体教育系统需求工程:用于临床推理训练的场景模拟器

Weibing Zheng, Laurah Turner, Jess Kropczynski, Matthew Kelleher, Murat Ozer, Shane Halse

机构 * School of Information Technology University of Cincinnati, OH Cincinnati, USA(信息科技学院 奥地利辛辛那提大学) College of Medicine University of Cincinnati, OH Cincinnati, USA(医学院 奥地利辛辛那提大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于角色的可解释多智能体教育系统需求工程框架,通过临床推理训练系统展示如何利用角色和用户故事捕捉多方需求,提升系统可解释性和临床场景真实性。

Comments 7 pages, 2 figures, CSTE2026: https://cste.net/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11161 2026-04-21 cs.HC cs.CL 79%

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

Althea:面向事实核查和批判性推理的人机协作

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee

机构 * Centre for Trusted Internet & Community (CTIC)(可信互联网与社区中心) National University of Singapore (NUS)(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Althea通过整合问题生成、证据检索和结构化推理,提升在线主张的核查效率与准确性,其在AVeriteC基准测试中达到宏F1值0.44,且在用户研究中显示指导性交互对短期准确性和长期改进均有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16929 2026-04-21 cs.CL 79%

MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning

MeasHalu:通过增强推理缓解大型语言模型中的科学测量幻觉

Ruijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li, Jiahao Zhao, Minghuan Tan, Feng Jiang, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MeasHalu框架,通过增强推理和针对性优化缓解LLM的科学测量幻觉问题,改进测量提取的准确性。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏