arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2603.22846 2026-04-01 cs.AI 57%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 57%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 57%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28062 2026-03-31 cs.AI 57%

SLOW: Strategic Logical-inference Open Workspace for Cognitive Adaptation in AI Tutoring

SLOW:面向AI辅导的认知适应战略逻辑推理开放工作区

Yuang Wei, Ruijia Li, Bo Jiang

机构 * Shanghai Institute of Artificial Intelligence for Education(上海人工智能教育研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SLOW框架通过透明决策工作区实现学习者状态推理与教学决策分离,提升个性化、情感敏感性和清晰度。

Comments 15 pages,3 figures. The 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI 57%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17290 2026-03-31 cs.CL 57%

Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation

爱沙尼亚WinoGrande数据集:大型语言模型在人工和机器翻译上的比较分析

Marii Ojastu, Hele-Andra Kuulmets, Aleksei Dorkin, Marika Borovikova, Dage Särg, Kairit Sirts

机构 * TartuNLP, Institute of Computer Science(塔尔图大学计算机科学研究所TartuNLP实验室) Department of Translation Studies, Institute of Foreign Language and Cultures(塔尔图大学外语与文化研究所翻译研究系) Institute of Genomics(塔尔图大学基因组学研究所) University of Tartu(塔尔图大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍了爱沙尼亚本地化和文化适应的WinoGrande测试集翻译,评估了专有和开源模型在人工翻译基准上的表现,并探讨了通过整合人工翻译过程的见解来设计详细提示以实现高质量机器翻译的可行性。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27694 2026-03-31 cs.CL 57%

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

大语言模型能否超越行为模仿模拟人类认知?

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过217位AI研究者纵向研究轨迹构建基准,评估LLM是否能模拟人类认知,提出多维认知对齐指标,系统评估最新LLM及增强技术,探讨其模拟人类认知的能力及提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27646 2026-03-31 cs.CL hep-lat hep-ph physics.comp-ph physics.optics 57%

PRBench: End-to-end Paper Reproduction in Physics Research

PRBench: 物理研究中的端到端论文复现

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi Lv, Zihan Mo, Yadi Niu, Yiyang Peng, Yu Tian, Yili Wang, Ziyu Wang, Zi-Yu Wang, Jiashen Wei, Liuheng Wu, Aoran Xue, Leyi Yang, Guanglu Yuan, Xiarui Zhan, Jingjun Zhang, Zifan Zheng, Pengfei Liu, Linrui Zhen, Kaiyang Li, Qichang Li, Ziheng Zhou, Guo-En Nian, Yunwei Xiao, Qing-Hong Cao, Linjie Dai, Xu Feng, Peng Gao, Ying Gu, Chang Liu, Jia Liu, Ming-xing Luo, Yan-Qing Ma, Liang-You Peng, Huichao Song, Shufeng Wang, Chenxu Wang, Tao Wang, Yi-Nan Wang, Chengyin Wu, Pengwei Zhao, Hua Xing Zhu

机构 * School of Physics, Peking University(北京大学物理学院) Beijing Computational Science Research Center(北京计算科学研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27360 2026-03-31 cs.AI 57%

Defend: Automated Rebuttals for Peer Review with Minimal Author Guidance

Defend:用于同行评审的自动化反驳与最小作者指导

Jyotsana Khatri, Manasi Patwardhan

机构 * TCS Research(塔塔咨询服务研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DEFEND工具,通过作者引导的结构化推理生成反驳,提升事实准确性与反驳力度,对比三种方法显示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27065 2026-03-31 cs.CL 57%

Story2Proposal: A Scaffold for Structured Scientific Paper Writing

Story2Proposal:一种结构化科学论文写作的支架

Zhuoyang Qian, Wei Shi, Xu Lin, Li Ling, Meng Luo, Ziming Wang, Zhiwei Zhang, Tengyue Xu, Gaoge Liu, Zhentao Zhang, Shuo Zhang, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Biao Wu, Harry Wang, Kris Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26994 2026-03-31 cs.LG q-bio.QM 57%

ImmSET: Sequence-Based Predictor of TCR-pMHC Specificity at Scale

ImmSET:基于序列的TCR-pMHC特异性预测方法

Marco Garcia Noceda, Matthew T Noakes, Andrew FigPope, Daniel E Mattox, Bryan Howie, Harlan Robins

机构 * Adaptive Biotechnologies

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ImmSET模型,通过多序列交互建模提升TCR-pMHC特异性预测精度,展示了其在不同数据规模下的鲁棒性和性能优势。

Comments Accepted to ML4H 2025 (Proceedings Track). To appear in PMLR 297

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15392 2026-03-31 cs.CL 57%

Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations

理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法

Yiming Huang, Biquan Bie, Zuqiu Na, Weilin Ruan, Songxin Lei, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。

Comments Accepted by the HCAIR workshop of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 57%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26449 2026-03-30 cs.CL 57%

ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claims

ClimateCheck 2026:气候相关主张的科学事实核查与虚假信息叙述分类

Raia Abu Ahmad, Max Upravitelev, Aida Usmanova, Veronika Solopova, Georg Rehm

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心) Technische Universität Berlin(柏林工业大学) Leuphana Universität Lüneburg(吕讷堡大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ClimateCheck 2026通过扩大训练数据和新增虚假信息叙述分类任务,挑战气候相关主张的自动核查,揭示传统指标的系统性偏差。

Comments Accepted at NSLP@LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26221 2026-03-30 cs.CR cs.AI cs.ET cs.SE 57%

Clawed and Dangerous: Can We Trust Open Agentic Systems?

带刺且危险:我们能信任开放代理系统吗?

Shiping Chen, Qin Wang, Guangsheng Yu, Xu Wang, Liming Zhu

机构 * CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) University of Technology Sydney(悉尼科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨开放代理系统在安全治理中的挑战,提出六维分析框架和安全建设参考原则,指出当前在部署控制、运营治理等方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 57%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 57%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI 57%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI 57%

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25309 2026-03-27 cs.CL 57%

Separate Before You Compress: The WWHO Tokenization Architecture

在压缩前分离:WHHO标记化架构

Kusal Darshana

机构 * Remeinium Research(Remeinium 研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出WHHO架构和SGPE算法,通过分离语言规则与压缩过程,实现多语言标记化,显著降低复杂Abugida语言的token数量,提升推理效率。

Comments 17 pages, 1 figure, 8 tables. Tokenization Architecture including formal DFA definitions and regular expressions for Sinhala and Devanagari syllabification. Evaluation includes comparisons with OpenAI o200k-base, Llama-4-Scout, and DeepSeek-V3. Source code and datasets: https://github.com/remeinium/WWHO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI 57%

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25105 2026-03-27 cs.CL 57%

OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs

OMIND:面向心理健康大语言模型的知识引导微调与多轮对话基准框架

Suraj Racha, Prashant Harish Joshi, Utkarsh Maurya, Nitin Yadav, Mridul Sharma, Ananya Kunisetty, Saranya Darisipudi, Nirmal Punjabi, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OMIND框架,通过结构化知识检索、模型剪枝和人工审核生成高质量多任务SFT数据集,并引入oMind-Chat多轮对话基准,验证了其在核心能力和对话任务上的优越性能。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 57%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 57%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 57%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM 57%

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 57%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23749 2026-03-26 cs.AI 57%

Efficient Benchmarking of AI Agents

高效评估AI代理

Franck Ndzomga

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 57%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 57%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏