AGI Maze as a Benchmark Framework for World-Modeling Agents
AGI Maze:作为世界建模智能体的基准框架
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AGI Maze:作为世界建模智能体的基准框架
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。
EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准
机构 * AIM Intelligence(AIM智能研究所) ; Seoul National University(首尔国立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。
在Scrum认证问题上提示GPT-5:一项实证准确性研究
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI
AI总结 本研究通过三种提示技术(零样本、思维链、带源引用)测试GPT-5在993个PSM认证问题上的准确性,发现所有提示均达到85%以上准确率,其中带源引用最佳(89.1%),并分析了错误类型。
ATM:基于CID的预写准入机制用于多智能体代码协同合成
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。
Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix
识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; AT&T Chief Data Office(AT&T首席数据办公室)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。
Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA
前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:基于人类专家真实标注的交叉评估框架
机构 * Perle AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出一个交叉评估框架,通过人类专家标注的103个提示-评分标准对,评估前沿LLM在埃及和伊拉克阿拉伯语文化与社会语言学知识上的表现,发现GPT-5.4是最可靠的自动评判者,文化任务比语言任务更难评分,且模型在埃及提示上表现优于伊拉克提示。
对Nature Portfolio元分析文章进行LLM代理基准测试
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。
Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever
Think-Before-Speak: 从内部评估到多智能体社会模拟中的公开表达
机构 * Michigan State University(密歇根州立大学) ; Hankuk University of Foreign Studies(韩国民法大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出TBS框架,通过分离智能体的内部推理与公开话语生成,模拟从内部评估到公开表达的路径,并在气候政策讨论中验证其机制敏感性。
Comments 8 pages of main content, 14 pages including references and appendices, 3 figures. Accepted to the KDD'26 Workshop on SciSoc Agents & LLMs
IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准
机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。
FusionFactory: 融合多LLM日志数据中的大语言模型能力
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学) ; Meta Monetization AI(Meta 变现人工智能) ; NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。
Journal ref TMLR 2026
哪些Token重要?基于相对惊讶指数的自适应Token选择用于RLVR
机构 * ModelScope Team(ModelScope团队) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出相对惊讶指数(RSI)度量,通过自适应Token过滤方法RSI-S解决RLVR中高熵与低概率Token的矛盾,在AIME和AMC基准上提升avg@32准确率2-3个百分点。
Comments 13 pages, 4 figures
AutoTrainess: 教语言模型自主改进语言模型
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。
HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论
机构 * LRE ; EPITA ; EPITECH ; Bpifrance ; CJM
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。
Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain
一种语义层中介的智能体,用于异构企业数据库的自然语言到SQL转换
机构 * DAQUV Corp.(DAQUV公司) ; Chungbuk National University(忠北大学) ; BigDataLabs, Co., Ltd.(BigDataLabs有限公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出一种通过语义层中介的NL2SQL智能体,利用语义模型查询(SMQ)解耦语义与物理SQL,在Spider2-snow基准上达到94.15%执行准确率,排名第三。
Comments Submitted to FITAT 2026 for peer review
法律中的多智能体审议研究
机构 * Bernoulli Institute of Mathematics, Computer Science and Artificial Intelligence, University of Groningen(格罗宁根大学伯努利数学、计算机科学与人工智能研究所) ; Department of Legal Theory, Jagiellonian University(雅盖隆大学法律理论系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究基于大语言模型的多智能体审议方法在法律推理任务中的应用,提出两种受法庭程序和论证启发的框架,实验表明其与基线模型性能相当但答案差异显著,尤其擅长需要多角度批判性思维的问题。
Comments This manuscript has been accepted for presentation at the AIDA2J Workshop during the 21st International Conference of AI & Law in Singapore, June 8 2026
OpenRCA 2.0:从结果标签到因果过程监督
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。
Comments work in progress
RigorBench: 自主AI编码代理中工程过程纪律的基准测试
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。
Comments 9 pages, 7 tables, 1 figure
为工具使用智能体设计的可执行基准测试套件
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 本文提出一个可执行基准测试套件,通过共享证据准入合同明确工作负载、行动生成驱动器和系统面向声明的证据。该套件连接WebArena Verified和MiniWoB++,并提供统一的工作负载适配器、任务清单、事件模式、回放/冻结政策、声明驱动器和报告管道。
Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon
ML代码异味:从规范到检测
机构 * École de technologie supérieure ; Université du Québec à Montréal(魁北克大学蒙特利尔分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究ML代码异味问题,提出基于规范的检测工具SpecDetect4ML,通过声明式DSL和可扩展分析引擎,实现项目级的代码异味检测,提升可复现性和可维护性。
用于训练大语言模型学习模拟电路知识的数据集构建
机构 * Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文构建文本数据集并定制训练技术,使大语言模型学习模拟电路知识;通过多智能体框架生成结构化四元组,结合SFT与KL散度正则化提升性能。
Dynamo: 视觉-语言代理的动态技能-工具演化
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Alibaba Zhejiang University(阿里巴巴浙江大学) ; University of Waterloo(多伦多大学) ; Vector Institute(向量研究所) ; Nanjing University(南京大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。
CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织
机构 * Zhejiang University(浙江大学) ; JIUTIAN Research(JIUTIAN研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。
MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试
机构 * NTU Singapore(南洋理工大学) ; The University of Hong Kong(香港大学) ; Johns Hopkins University(约翰霍普金斯大学) ; AI2(人工智能研究所) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。
Comments Project page: https://musebench.github.io
回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案
机构 * GMLab ; Hong Kong Polytechnic University(香港理工大学) ; XPENG Robotics(XPENG机器人)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。
SafePyramid: 一种用于上下文策略护栏的分层基准
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出SafePyramid基准,包含1000轮多领域对话和3000条应用特定策略,通过三级难度评估LLM在上下文中执行策略护栏的能力,发现当前模型表现有限。
TopoAgent: 医学影像中自动拓扑学习的智能体框架
机构 * Dept. of Computer Science and Engineering, University of Notre Dame(内布拉斯加大学达灵顿分校计算机科学与工程系) ; Dept. of Computer Science, The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出基于大语言模型的智能体框架TopoAgent,通过感知-推理-行动-反思循环和21个领域工具,自动为医学图像选择最优拓扑描述符并生成特征向量。
SFBench:SciFy科学可行性基准
机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出SFBench基准数据集,用于评估系统判断科学声明可行性的能力,包含197条材料科学声明及专家标注的可行性评分与解释,具有任务复杂、声明全新、专家标注和开放式解释等特点。
AURORA:用于大型语言模型中鲁棒幻觉检测的不对称性与更新诱导旋转
机构 * School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, China(北京航空航天大学未来区块链与隐私计算先进创新中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出AURORA框架,利用权重梯度动态(不对称性和旋转比)检测LLM幻觉,跨模型和数据集表现鲁棒。
SAKE:大型语言模型的软件架构知识评估基准
机构 * University of Southern Denmark(丹麦南方大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出SAKE基准,包含2154道专家策划的多选题,评估LLM在八个架构类别和四种上下文长度下的架构知识,揭示专业实践中的能力差距。
Comments 25 pages
用于评估微服务故障诊断中LLM智能体的多数据集基准
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。
Comments 10 pages, 6 figures, 6 tables