arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2605.08942 2026-05-12 cs.CL 57%

Decomposing and Steering Functional Metacognition in Large Language Models

分解与引导大型语言模型中的功能元认知

Yanshi Li, Xueru Bai, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee Shanghai China(Shopee上海中国) Shopee Beijing China(Shopee北京中国) Shopee Singapore Singapore(Shopee新加坡新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过分析大型语言模型的内部激活,揭示功能元认知状态的可分解性,并展示如何通过引导激活方向来调控推理行为。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08941 2026-05-12 cs.AI 57%

MDGYM: Benchmarking AI Agents on Molecular Simulations

MDGYM:在分子模拟上评估AI代理的基准测试

Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI 57%

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08533 2026-05-12 cs.AI 57%

Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care

人类与大语言模型对话提高急诊护理的诊断准确性

Burcu Sayin, Ngoc Vo Hong, Ipek Baris Schlicht, Jacopo Staiano, Pasquale Minervini, Sara Allievi, Nicola Susca, Nicola Osti, Alberto Maino, Vito Racanelli, Andrea Passerini

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Department of Medicine, Azienda Sanitaria Universitaria Integrata del Trentino (ASUIT)(特伦托大学整合卫生机构医学部) Center for Medical Sciences (CISMed), University of Trento(特伦托大学医学科学中心) Universitat Politècnica de València(瓦伦西亚理工大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨人类与大语言模型对话在急诊护理中的应用,通过对比基线和AI辅助会话,发现住院医师在复杂病例中的诊断准确性显著提升,且交互式LLM支持显著增强了诊断推理能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08503 2026-05-12 cs.CL cs.CY cs.HC 57%

NARRA-Gym for Evaluating Interactive Narrative Agents

NARRA-Gym用于评估交互叙事代理

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong He, Zhengqing Yuan, Yujun Zhou, Kehan Guo, Chaoran Chen, Toby Jia-Jun Li, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Pennsylvania(宾夕法尼亚大学) Lehigh University(莱恩大学) Massachusetts Institute of Technology(麻省理工学院) Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) University of Washington(华盛顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 57%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 57%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20909 2026-05-12 cs.CL 57%

LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories

LogitTrace:通过层间logit轨迹检测基准污染

Zirui He, Haiyan Zhao, Yingcong Li, Ali Payani, Mengnan du

机构 * New Jersey Institute of Technology(新泽西理工学院) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LogitTrace框架,通过分析中间logit轨迹检测记忆化决策动态,发现污染样本更早承诺,而干净样本证据积累更渐进,帮助区分污染与干净样本。

Comments 23pages, 10 figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08441 2026-05-12 q-bio.QM cs.CE cs.LG 57%

SpectraLLM: Uncovering the Ability of LLMs for Molecular Structure Elucidation from Multi-Spectral Data

SpectraLLM:从多光谱数据中揭示LLMs对分子结构解析的能力

Yunyue Su, Jiahui Chen, Zao Jiang, Zhenyi Zhong, Liang Wang, Qiang Liu, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院) The Hong Kong Polytechnic University(香港理工大学) Tianjin University Peiyangyuan Campus(天津大学-pieceyang Campus)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpectraLLM通过多光谱数据端到端预测分子结构,优于传统方法,具有鲁棒性和跨模态推理能力。

Comments 42 pages, 6 figures, 30 tables; Accepted to ICLR 2026

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 57%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 57%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 57%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08113 2026-05-12 cs.LG cs.CV 57%

Do Foundation Model Embeddings Improve Cross-Country Crop Yield Generalisation? A Leave-One-Country-Out Evaluation in Sub-Saharan Africa

基础模型嵌入是否能提升跨国家作物产量泛化?一种留一国家法的撒哈拉以南非洲评估

Yaw Osei Adjei

机构 * Department of Computer Science, Kwame Nkrumah University of Science and Technology(计算机科学系,库马西技术科学大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文评估了地理空间基础模型嵌入在留一国家法交叉验证中的表现,发现跨国家预测效果不佳,主要受限于产量分布差异。

Comments 9 pages, 10 figures, appendix, code and processed results released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07640 2026-05-11 cs.CV cs.AI 57%

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

LithoBench:用于遥感岩石学解释的大型多模态模型基准测试

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院) PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LithoBench,一个用于评估遥感岩石学解释中地质语义理解的多级基准,包含10000个专家标注实例,涵盖12种岩石类型,通过专家反馈的半自动化流程提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07533 2026-05-11 cs.CL 57%

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

为何大语言模型在低资源翻译中失败?解析大语言模型在机器翻译中的令牌动态

Shenbin Qian, Yves Scherrer

机构 * Language Technology Group, Department of Informatics University of Oslo(奥斯陆大学语言技术组,信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过分析15种模型在22种语言对上的表现,发现非英语语言对翻译质量较低,引入令牌激活率指标揭示语言表示与翻译性能的关系,指出推理模型在低TAR语言中生成更多令牌可能补偿性能差异。

Comments Accepted to the 26th Annual Conference of the European Association for Machine Translation (EAMT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 57%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07422 2026-05-11 cs.SE cs.AI 57%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 57%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07114 2026-05-11 cs.LG 57%

Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

在何处分配 rollout:用于基于组的 RLVR 的 hit-utility 优化 rollout 分配

Tao Wang, Shuo Li, Yan Sun, Dongsheng Ding, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出 HORA 方法,通过最大化 hit-utility 提升 RLVR 的效率,实验证明其在多个基准上优于 GRPO,且兼容其他组基估计器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07112 2026-05-11 cs.AI cs.MA 57%

Switchcraft: AI Model Router for Agentic Tool Calling

Switchcraft:面向代理工具调用的AI模型路由

Sharad Agarwal, Pooria Namyar, Alec Wolman, Rahul Ambavat, Ankur Gupta, Qizheng Zhang

机构 * Microsoft Research(微软研究院) Stanford(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Switchcraft是首个面向代理工具调用优化的模型路由系统,通过选择成本最低且正确的模型,降低推理成本达84%,同时保持准确率与最佳单个模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 57%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06707 2026-05-11 cs.SE cs.AI 57%

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

单文件测试:一项纵向的公共接口评估,评估首次输出LLM网页生成与社交传播跟踪

Diego Cabezas Palacios

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过8周的观察比较,评估了17项公共实验中收集的68个单文件HTML生成,比较了GPT、Gemini、Grok和Claude四种推理模型家族在固定公共接口协议下的表现,发现Claude在性能和一致性上表现最佳,但模型家族对代码冗余的影响大于提示词内容。

Comments 23 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 57%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 57%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 57%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06219 2026-05-08 cs.AI 57%

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

联合一致性:通过能量最小化实现的统一测试时间聚合框架

Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

机构 * EPFL(苏黎世联邦理工学院) SUFE(上海财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出联合一致性框架,通过能量最小化统一测试时间聚合,整合现有投票和加权聚合方法,利用LLM作为裁判进行交互矩阵构建,并在大规模测试中实现高效近似策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06191 2026-05-08 cs.AI 57%

Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction

大型语言模型在出院后临床行动提取中的系统评估

Shivali Dalmia, Ananya Mantravadi, Prasanna Desikan

机构 * Centific AI Research(Centific AI研究) Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统评估了零样本和少样本大型语言模型在安全关键的出院后临床行动提取中的表现,提出两阶段提取框架以提升临床任务的可操作性,并分析标注不一致性和模型推理与标注规范的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05985 2026-05-08 cs.AI cs.MA q-bio.QM 57%

BioResearcher: Scenario-Guided Multi-Agent for Translational Medicine

BioResearcher: 用于转化医学的场景引导多智能体系统

Remigiusz Kinas, Joanna Krawczyk, Rafał Powalski, Przemysław Pietrzak, Agnieszka Kowalewska, Krzysztof Kolmus, Maciej Sypetkowski, Łukasz Smoliński, Tomasz Jetka

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BioResearcher,一种场景引导的多智能体系统,通过版本化研究 playbook 将查询映射到多种工具和机器学习端点,实现跨异构生物医学数据源的可审计、场景特定工作流。系统在单元级能力、开放性生物医学推理和端到端临床发现中均表现优异。

Comments 5 pages (main text), 21 pages (appendix), 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03080 2026-05-08 cs.AI 57%

Beyond Factual Correctness: Mitigating Preference-Inconsistent Explanations in Explainable Recommendation

超越事实正确性:缓解可解释推荐中的偏好不一致解释

Chengkai Wang, Baisong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PURE框架,通过选择-生成范式缓解推荐中因偏好不一致导致的解释问题,提升解释可信度与推荐准确性。

Comments The authors have identified an issue in the evaluation protocol in Section 5.1.3. Feature extraction and semantic matching used to compute P-EHR require correction and re-validation, as they may not have been applied consistently across all generated explanations and baselines. This may affect part of the reported quantitative results and analysis, so the authors withdraw this version

详情

展开后加载摘要…

URL PDF HTML 收藏