paper.json: A Coordination Convention for LLM-Agent-Actionable Papers
为LLM-代理可操作论文的协调约定
机构 * arquicanedo
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
为LLM-代理可操作论文的协调约定
机构 * arquicanedo
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。
SMMBench:一种用于源分布多模态智能体记忆的基准测试
机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) ; OPPO, China(OPPO,中国)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。
RTL-BenchMT:通过代理辅助分析和修订动态维护RTL生成基准
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI
AI总结 本文提出RTL-BenchMT框架,通过自动识别和修正错误案例及检测更新过拟合案例,解决RTL基准中的缺陷和过拟合问题,降低人工维护成本。
Comments This paper has been accepted by DAC 2026
教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。
Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster
代理软件工程在快速开发数字音乐乐器中的案例研究与反思
机构 * Computing, Goldsmiths(Goldsmiths 计算学系)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE
AI总结 本文通过三个案例研究展示代理软件工程在开发数字音乐乐器中的应用,探讨其降低入门门槛和提升软件兼容性与可持续性的潜力。
NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准
机构 * School of Artificial Intelligence(人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。
Comments 30 pages, 11 figures
无需攻击:用于代理技能规范违规的语义模糊测试
机构 * University of California, San Diego(加州大学圣迭戈分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出Sefz框架,通过语义模糊测试发现代理技能中的规范违规问题,揭示了安全规则漏洞对用户信任的影响。
为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘
机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。
Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)
代理基准能否支持其分数?基于证据的交互代理评估的边界
机构 * The University of Sydney(悉尼大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出一种证据报告层,通过验证存储的艺术品来提高交互代理评估的可靠性,明确区分不同失败模式。
通用智能体评估
机构 * IBM Research(IBM研究院) ; MIT(麻省理工学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。
Comments Presented at the ICLR 2026 Workshop on Agents in the Wild
当存储的证据不再可用:基于规模的代理记忆评估
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Duke Kunshan University(杜克昆山大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。
Comments 19 pages, 11 figures, preprint
从早期经验学习代理路由
机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) ; University of Michigan(密歇根大学) ; Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Edinburgh(爱丁堡大学) ; King’s College London(伦敦国王学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。
Comments 17 pages
TeamBench: 在强制角色分离下评估代理协调
机构 * MIT(麻省理工学院) ; Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind) ; Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。
双代理协同训练用于健康教练的隐式对抗偏好优化
机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) ; Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。
AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE
AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。
Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro
部分证据基准:在代理系统中受授权限制的证据基准测试
机构 * KamiwazaAI
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本文提出Partial Evidence Bench,用于评估代理系统在授权限制下的证据处理能力,通过四个维度评估系统表现,展示不同行为模式对完成度的影响。
Comments Benchmark paper with deterministic synthetic corpora, 14 pages, 6 tables
超越静态快照:语言模型在代理前沿的 grounded 评估框架
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。
Comments Submitted for consideration to NeurIPS 2026
在真实环境中评估代理AI:故障模式、漂移模式及生产评估框架
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文针对代理AI在生产环境中持续运行时的评估挑战,提出七种故障模式分类及PAEF框架,揭示传统指标在检测故障模式上的不足。
Comments 11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit
ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。
Comments 32 pages, 15 figures
代理AI用于物质使用教育:整合监管与科学知识源
机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) ; Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) ; School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL
AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。
Comments 22 pages, 6 figures, 2 tables
Semia:通过约束引导的表示合成审计代理技能
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。
什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。
不依赖代理的生产环境SQL准确性评估
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。
一种面向电网的基于代理的模型用于分析电动汽车充电系统
机构 * Lakeside Labs(拉克西德实验室) ; Silicon Austria Labs(硅 Austria 实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出一种可配置的、面向电网的基于代理的模型,用于系统分析电动汽车充电系统在可配置基础设施和运营条件下的表现,通过整合异构的电动汽车行为、充电柱约束和共享的能源沙盒,研究用户导向的充电动态和设施层面的电力行为。
Comments This is the author's version of a paper submitted to SIMULTECH. 12 Pages, 1 Table, 10 Figures
ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式
机构 * Open Gigantic(开放巨型)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。
Comments 12 pages, 4 figures, 4 tables
AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验
机构 * Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)
专题命中 Agent评测 :agentic(title);workflow(abstract);分类 cs.AI
AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。
为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架
机构 * Seoul National University(首尔国立大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。
为设计而可逆:流式LLM代理执行的理论
机构 * Fudan University(复旦大学) ; Guangming Lab(光明实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。
AutoRISE:面向大语言模型的代理驱动策略进化
机构 * Responsible AI, Microsoft(微软责任人工智能)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。
Comments 36 pages, 6 tables, 2 figures
通过多样性引导的用户模拟实现高效的代理评估
机构 * IBM Research(IBM研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出DIVERT框架,通过快照和覆盖引导的方式高效探索代理与用户交互,提升评估效率和覆盖范围。