arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2508.10971 2026-06-24 cs.CL cs.AI 版本更新 73%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21666 2026-06-23 cs.AI cs.CL cs.MA 新提交 73%

Hallucination as Context Drift: Synchronization Protocols for Multi-Agent LLM Systems

幻觉作为上下文漂移:多智能体LLM系统的同步协议

Carson Rodrigues

机构 * Celabe

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出上下文分歧分数(CDS)和共享状态验证协议(SSVP),通过周期性交换压缩状态摘要来减少多智能体LLM系统中的幻觉,实验表明SSVP在旅行规划领域将幻觉率降低至0.463,且API调用减少58%。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19327 2026-06-18 cs.AI cs.CL 新提交 73%

Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation

重新思考奖励监督:基于评分准则的自蒸馏

Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出评分准则条件自蒸馏框架,通过结构化细粒度反馈指导推理模型,在科学推理基准上平均超越GRPO 1.0分、OPSD 0.9分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17474 2026-06-17 cs.CL cs.AI 新提交 73%

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估

Jiahui Niu, Huizi Yu, Wenkong Wang, Guangxin Dai, Jingxian He, Xiang Li, Zhiying Liang, Xinxin Lin, Kent CY So, Bryan YP Yan, Yun Kwok Wing, Yanqiu Xing, Xin Ma, Lizhou Fan

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学) Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学) Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院) Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学) Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学) Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出AIPatient Arena框架,通过电子健康记录构建患者知识图谱,在多轮医患交互中评估大语言模型的八项临床能力,发现模型在信息覆盖、诊断推理等方面存在不足,强调过程评估的重要性。

Comments 49 pages, 12 figues, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16902 2026-06-16 cs.AI cs.LG 版本更新 73%

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试:大语言模型在真实知识图谱上的规划能力有多强?

Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University of Oxford, UK(牛津大学,英国) University College London (Centre for AI), UK(伦敦大学学院(人工智能中心),英国) University of Basel, Switzerland(巴塞尔大学,瑞士)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-Wikirace 基准,通过维基百科超链接导航任务评估大语言模型的规划、推理与世界知识,发现模型在简单任务上超人类,但困难任务成功率仅 23%,且规划与长程推理是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 73%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 73%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06388 2026-06-09 cs.AI cs.CL 版本更新 73%

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

人类的ALMANAC:用于智能体协作的动作级心智模型标注的人类协作数据集

Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

机构 * Northeastern University(东北大学) University of Notre Dame(Notre Dame 大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学) Adobe(Adobe公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 为解决当前LLM智能体缺乏协作中心智模型能力的问题,构建了基于Map Task的ALMANAC数据集,包含2987个协作动作及其心智模型标注,并评估了六种LLM在预测人类行为和心智模型上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG 73%

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01016 2026-06-02 cs.CL cs.AI eess.AS 73%

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

PolySpeech-100:面向100多种语言和方言的大规模语音理解基准

Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD AI Research(京东人工智能研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 为解决现有语音评估基准在资源丰富语言偏向、缺乏语义推理和忽视方言的问题,提出PolySpeech-100基准,通过混合构建管道覆盖110种语言变体,并评估22个模型,发现开源端到端模型在重方言上优于级联系统,而思维链提示在零样本设置下会降低性能。

Comments 19 pages, 13 figures, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26645 2026-05-29 cs.AI cs.LG 73%

SciHorizon-DataEVA: An Agentic System for AI-Readiness Evaluation of Heterogeneous Scientific Data

SciHorizon-DataEVA:面向异构科学数据AI就绪性评估的智能体系统

Dianyu Liu, Chuan Qin, Xi Chen, Xiaohan Li, Wenxi Xu, Yuyang Wang, Xin Chen, Yuanchun Zhou, Hengshu Zhu

机构 * SciHorizon Team, Computer Network Information Center, Chinese Academy of Sciences(科学前沿团队,计算机网络信息中心,中国科学院)

专题命中 推理评测 :planning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 提出SciHorizon-DataEVA智能体系统,基于Sci-TQA2原则和层次化多智能体评估方法,实现对异构科学数据的可扩展AI就绪性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04505 2026-05-28 cs.AI cs.CL cs.SY eess.SY 73%

CircuitLM: A Multi-Agent LLM-Aided Design Framework for Generating Circuit Schematics from Natural Language Prompts

CircuitLM: 一种基于多智能体的大语言模型辅助设计框架,用于从自然语言提示生成电路原理图

Khandakar Shakib Al Hasan, Syed Rifat Raiyan, Hasin Mahtab Alvee, Wahid Sadik

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Electronic Engineering(电气与电子工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出CircuitLM多智能体流水线,通过嵌入驱动的组件知识库和五阶段流程,将自然语言提示转化为结构化的CircuitJSON原理图,并采用确定性电气规则检查和LLM作为评判的元评估器双重验证,解决大语言模型在电路设计中的幻觉和物理约束问题。

Comments Accepted at the 2026 IEEE International Conference on LLM-Aided Design (ICLAD), 10 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24298 2026-05-26 cs.CR cs.AI cs.LG 73%

An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

LLM生成代码安全性的提示方法实证评估

Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen

机构 * Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 通过跨5个LLM和4种编程语言的实证评估,提出弱点感知零样本链式思考(WA-0CoT)提示策略,发现提示方法虽影响弱点类别分布,但无法显著降低漏洞频率或密度。

Comments 40 pages, 22 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 73%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18256 2026-05-12 cs.LG cs.AI 73%

MolRGen: A Training and Evaluation Setting for De Novo Molecular Generation with Reasonning Models

MolRGen:一种用于从头分子生成的训练和评估设置

Philippe Formont, Maxime Darrin, Ismail Ben Ayed, Pablo Piantanida

机构 * Université Paris-Saclay(巴黎萨克雷大学) ÉTS Montréal(蒙特利尔ÉTS) ILLS – International Laboratory on Learning Systems(学习系统国际实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Mistral AI LIVIA CNRS, CentraleSupélec(国家科学研究中心,中央超导大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolRGen,一种用于训练和评估基于推理的分子生成模型的基准测试平台,通过多目标优化提示结合结合亲和力评分和分子性质,评估从头生成的分子,并引入多样性感知的top-k指标和GRPO算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23511 2026-05-12 eess.AS cs.AI cs.CL cs.SD 73%

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

MECAT:一个多专家构建的细粒度音频理解任务基准

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Xunying Liu, Junbo Zhang, Jian Luan

机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MECAT基准,通过集成专家模型分析与推理模型,提供细粒度音频描述和开放问题对,结合新指标DATE评估模型性能,评估现有音频模型的能力与局限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 73%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 73%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24964 2026-04-29 cs.LG cs.CL 73%

Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks

Odysseys:在现实长周期任务上评估网络代理

Lawrence Keunho Jang, Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Odysseys基准,通过200个现实浏览任务评估长周期网络代理,引入基于评分的评估方法,发现传统二元评估不足,且前沿模型在效率上仍有提升空间。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12826 2026-04-28 cs.CL cs.AI cs.MA 73%

Scheming Ability in LLM-to-LLM Strategic Interactions

大语言模型在LLM到LLM战略互动中的策略能力

Thao Pham

机构 * Berea College(伯克利学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究通过博弈论框架评估大语言模型的策略欺骗能力,发现模型在无提示下倾向于欺骗,尤其在Peer Evaluation中全部选择欺骗,揭示了多智能体环境下需加强高风险博弈场景的评估。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22239 2026-04-27 cs.CL cs.AI 73%

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

在大规模文档集合中导航:MuDABench用于多文档分析问答

Zhanli Li, Yixuan Cao, Lvzhou Luo, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。

Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13928 2026-04-23 cs.CL cs.AI 73%

LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X

Shuo Xing, Junyuan Hong, Yifan Wang, Runjin Chen, Zhenyu Zhang, Ananth Grama, Zhengzhong Tu, Zhangyang Wang

机构 * Texas A&M University(德克萨斯农工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Updated experiments with corrected data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 73%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 73%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07070 2026-04-14 cs.AI cs.LG 73%

EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration

EVGeoQA:基于动态多目标地理空间探索的LLM基准测试

Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 EVGeoQA针对动态地理空间探索提出多目标基准,通过电动汽车充电场景设计,评估LLM在动态环境中的探索能力,发现其在长距离空间探索上存在不足,但能通过历史轨迹总结提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09418 2026-04-13 cs.CL cs.LG 73%

Automated Instruction Revision (AIR): A Structured Comparison of Task Adaptation Strategies for LLM

自动化指令修订(AIR):一种针对大语言模型任务适应策略的结构化比较

Solomiia Bilyk, Volodymyr Getmanskyi, Taras Firman

机构 * Eleks Ltd.(Eleks有限公司) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于规则归纳的自动化指令修订(AIR)方法,用于在有限任务特定示例下适应大语言模型。通过比较多种适应策略在不同基准测试中的表现,发现任务依赖性显著,无单一方法在所有情况下占优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06111 2026-04-13 cs.AI cs.CL 73%

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

AgentCE-Bench: 一种可配置的智能体评估基准,具备可扩展的视野和可控难度,在轻量环境中

Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC (Japan)(日本国立信息学研究所LLMC) University of Zurich(苏黎世大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 AgentCE-Bench通过可扩展视野和可控难度,解决现有基准的高交互开销和任务分布不平衡问题,提供可靠、可解释的智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13905 2026-03-31 cs.CL cs.AI 73%

Schema for In-Context Learning

基于模式的上下文学习框架

Pan Chen, Shaohong Chen, Mark Wang, Shi Xuan Leong, Priscilla Fung, Varinia Bernales, Alan Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院(CIFAR)) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于认知模式的上下文学习框架,通过提取先验示例中的认知构建块,生成抽象模式以增强模型推理能力,实验证明在化学和物理问题上性能提升达36.19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25944 2026-03-30 cs.CL cs.AI 73%

Can Small Models Reason About Legal Documents? A Comparative Study

小型模型能否对法律文件进行推理?一项比较研究

Snehit Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过测试九种模型在三个法律基准上的表现,发现3B参数的混合专家模型在法律持有识别上优于GPT-4o-mini,且提示策略影响显著,few-shot提示效果最佳。

Comments 17 pages, 9 models, 5 prompting strategies, 3 legal benchmarks, 405 experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24961 2026-03-27 cs.AI cs.CL cs.CV 73%

Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math

能够理解学生的思维吗?解析手写数学中的多模态错误分析

Dingjie Song, Tianlong Xu, Yi-Fan Zhang, Hang Li, Zhiling Yan, Xing Fan, Haoyang Li, Lichao Sun, Qingsong Wen

机构 * Lehigh University(里海大学) Squirrel Ai Learning(松鼠AI学习) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Michigan State University(密歇根州立大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScratchMath基准测试,用于解释和分类学生手写数学草稿中的错误,评估16种MLLMs显示其在视觉识别和逻辑推理方面存在显著差距,专有模型表现更优。

Comments Accepted by the 27th International Conference on Artificial Intelligence in Education (AIED'26)

详情

展开后加载摘要…

URL PDF HTML 收藏