arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2510.01925 2026-08-04 cs.CL 版本更新 79%

Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey

用奖励模型增强大语言模型推理能力:一项分析性综述

Qiyuan Liu, Hao Xu, Xuhong Chen, Wei Chen, Yee Whye Teh, Ning Miao

机构 * Department of Data Science and Hong Kong Institute of AI for Science, City University of Hong Kong(数据科学系和香港人工智能科学研究所,香港城市大学) Li Auto Inc., China(中国利汽车公司) Department of Statistics, University of Oxford(统计系,牛津大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该综述系统介绍奖励模型(RMs)的概念、训练与评估方法,梳理其在大语言模型(LLMs)推理中的三类核心应用,并探讨RMs相关开放问题,为其有效部署提供见解。

Comments Accepted for publication in Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 79%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28478 2026-07-31 cs.CL 新提交 79%

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差

Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 79%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 79%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-07-30 cs.AI 新提交 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 79%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16129 2026-07-30 cs.AI 版本更新 79%

Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning

缩小眼科人工智能的差距:MM-Retinal-Reason数据集与OphthaReason模型用于动态多模态推理

Ruiqi Wu, Yuang Yao, Tengfei Ma, Chenran Zhang, Na Su, Tao Zhou, Geng Chen, Wen Fan, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科学系) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对现有眼科AI仅聚焦基础推理的问题,构建首个眼科多模态数据集MM-Retinal-Reason,并提出带UADT方法的OphthaReason模型,实现眼科多模态推理性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25145 2026-07-29 quant-ph cs.AI 新提交 79%

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

用于自主量子传感实验中科学推理的智能体人工智能

Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。

Comments 11 pages, 4 figures + Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06276 2026-07-29 cs.CV cs.AI 版本更新 79%

RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension

RefBench-PRO:面向感知与推理的指称表达理解基准

Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室) National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom(中国电信) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RefBench-PRO提出一个面向感知与推理的指称表达理解基准,通过分解指称表达为感知和推理两个维度,设计六个逐步递增的挑战任务,并引入Ref-R1强化学习方案提升定位精度,实现对多模态大语言模型的可解释评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24471 2026-07-28 cs.CL 新提交 79%

Grounding latent algorithm routing in transformer reasoning

在变压器推理中为潜在算法路由建立基础

Xiangbo Zhang, Xiaoxu Ma

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 79%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交 79%

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 79%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22555 2026-07-28 cs.AI 新提交 79%

DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs

深度镜头诊断代理:代理工作流程设计使小型推理模型能够与前沿语言模型竞争

Mahmood Bayeshi, Veysel Kocaman, Muhammed Ali Naqvi, Yigit Gul, David Talby

机构 * John Snow Labs(约翰·斯诺实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对医疗诊断中前沿语言模型单步提示诊断推理脆弱的问题,提出以小型医疗推理模型和检索增强生成的深度镜头诊断代理五阶段利用管道,提升了诊断准确率,降低成本,还产生结构化工件支持高风险设置。

Comments 20 pages, 5 figures, 5 tables. Technical report, John Snow Labs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17412 2026-07-28 cs.CV cs.AI 版本更新 79%

Enhancing Pathological VLMs with Cross-scale Reasoning

增强病理视觉语言模型的跨尺度推理能力

Chi Phan, Tianyi Zhang, Qiaochu Xue, Yufeng Wu, Dan Hu, Zeyu Liu, Sudong Wang, Yueming Jin

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) PuzzleLogic Pte Ltd(PuzzleLogic私人有限公司) Department of Pathology, Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院病理科暨福建省肿瘤医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出首个跨尺度训练与评估范式,通过多倍率视觉问答任务增强病理视觉语言模型的跨尺度推理能力,并构建高质量基准数据集Scale-VQA及模型ScaleReasoner-R1,实现最优性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07889 2026-07-28 cs.CL 版本更新 79%

BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science

BioProBench: 一个全面的数据集和生物协议理解与推理基准

Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BioProBench通过构建大规模数据集和基准,提升生物协议理解与推理的LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24125 2026-07-28 cs.RO cs.AI 版本更新 79%

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training

通过自回归离散预训练实现机器人动作的统一具身VLM推理

Yi Liu, Sukai Wang, Dafeng Wei, Xiaowei Cai, Linqing Zhong, Jiange Yang, Guanghui Ren, Jinyu Zhang, Maoqing Yao, Chuankang Li, Xindong He, Liliang Chen, Jianlan Luo

机构 * AgiBot Research(AgiBot研究机构) AgiBot(AgiBot公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 79%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20425 2026-07-24 cs.CL 新提交 79%

What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces

什么是好的?从大语言模型推理痕迹中提取并测试文学质量的隐含理论

Birger Moëll

机构 * Uppsala University(乌普萨拉大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过构建含30篇文本的基准从大语言模型推理痕迹提取文学质量隐含理论,经五次复制实验得模型判断写作质量的相关结论;还通过对经典散文段落退化探究该理论,发现其判断整体、作者特定且对结构更敏感,对相关领域有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21028 2026-07-24 cs.AI 版本更新 79%

SciTrek: Evaluating and Improving Long-Context Numerical Reasoning over Scientific Articles

谁被引用最多?在科学文章上基准测试长上下文数值推理

Miao Li, Alexander Gurung, Irina Saparina, Mirella Lapata

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SciTrek基准测试通过长上下文科学文章问题探索LLM的数值推理能力,发现即使最佳模型在长上下文下也面临显著挑战,尤其在处理引用和复合逻辑问题时表现不佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20166 2026-07-23 cs.SD cs.AI 新提交 79%

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

Audio-Zero:用于细粒度音频推理的无标签自我进化

Siqian Tong, Xuan Li, Chaozhuo Li, Baolong Bi, Yiwei Wang, Yujun Cai, Shenghua Liu, Chengpeng Hao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大型音频语言模型细粒度音频推理难题,提出无标签自我进化框架Audio-Zero,通过构建听觉自博弈游戏,利用无标签音频对比对让模型生成线索并推理,实验证明其能提升细粒度音频推理且保持广泛音频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 79%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06550 2026-07-23 cs.CV cs.AI 版本更新 79%

Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework

生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架

Pan Liao, Feng Yang, Di Wu, Jinwen Yu, Wang Zhao, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19326 2026-07-22 cs.CL 新提交 79%

Selective State-Space Adaptation and Retrieval for Language Model Reasoning

用于语言模型推理的选择性状态空间适应与检索

Atahan Dokme, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对语言模型推理,提出一类含MaLoRA和MaRA的适配器,通过在令牌和上下文级别引入选择性状态空间递归实现适应,在多个冻结主干和推理基准上提升了推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19235 2026-07-22 cs.CL cs.CV 新提交 79%

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18777 2026-07-22 cs.LG q-bio.MN 新提交 79%

PertReason: A Knowledge-Grounded Benchmark and Framework for Cell-State-Conditioned Mechanistic Reasoning of Perturbation Effects

PertReason:用于细胞状态条件下扰动效应机制推理的知识基础基准和框架

Dongkwan Kim, Yiming Gao, Yining Yang, Yang Shen

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对科学领域机器学习评估难题,引入PertReason基准和框架套件,通过PertReasonQA测试模型,结合多数据与知识图谱,发现现有模型预测与推理差距,提出PertReasonLM,为科学系统中忠实推理失败提供诊断框架。

Comments Preprint; 31 pages; Dongkwan Kim and Yiming Gao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16323 2026-07-21 eess.SP cs.CV cs.LG eess.IV 新提交 79%

ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning

心电图大语言模型:基于心电图的心脏推理基础模型

Alexander Selivanov, Friederike Jungmann, Jan Kehrer, Karl-Ludwig Laugwitz, Eimo Martens, Daniel Rueckert

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对一线分诊缺乏确定性成像及现有心电图人工智能系统局限的问题,提出ECG-LLM模型,用多模态到语言监督策略训练,能从心电图回答多样心血管问题,恢复测量值、预测表型,在相关任务中表现良好,为临床推理提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17917 2026-07-21 cs.AI 新提交 79%

PEARL: Auditable Repair for Scientific Reasoning Graph Extraction

PEARL:科学推理图提取的可审计修复

Bohan Su, Pengze Li, Yuchen Lu, Xi Chen

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) Artificial Intelligence Innovation and Incubation, Fudan University(复旦大学人工智能创新与孵化) Department of Computer Science, Faculty of Science, University of Bath(巴斯大学理学院计算机科学系) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对科学推理图提取中LLMs输出有问题的情况,提出无需训练的PEARL框架,通过特定模式和反馈修复推理图。在ARCHE基准测试中,该框架提升了严格通过率和平均REA,为相关工作流程提供可靠性层。

Comments Accepted at WAICA 2026 Multi-Modal Agents for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17269 2026-07-21 cs.AI cs.DB 新提交 79%

An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估

Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai

机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) Guangzhou Polytechnic Normal University(广州技术师范大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。

Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu

详情

展开后加载摘要…

URL PDF HTML 收藏