TRACE: Capability-Targeted Agentic Training
TRACE: 面向能力的代理训练
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 TRACE通过对比成功与失败轨迹自动识别能力缺失,合成针对性训练环境并利用RL训练适配器,提升代理在不同环境中的表现。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
TRACE: 面向能力的代理训练
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 TRACE通过对比成功与失败轨迹自动识别能力缺失,合成针对性训练环境并利用RL训练适配器,提升代理在不同环境中的表现。
Gavel: 智能体结合检查表评估LLM长上下文法律摘要
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。
Comments webpage at https://yao-dou.github.io/gavel/
PiSAs:多用户智能体系统中情境完整性的基准测试
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。
用于自动驾驶的智能体驱动长尾模拟
机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) ; Bosch Research(博世研究院)
专题命中 Agent评测 :agent(title,abstract);planning(abstract)
AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。
技能覆盖率:一种用于智能体技能的测试充分性度量
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Liverpool(利物浦大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。
超越预测:预测市场代理中的信念到交易层
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; The University of Hong Kong(香港大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI
AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。
Comments 10 pages, 4 figures
CostNav:一个用于现实世界经济成本评估的物理AI代理导航基准
机构 * KAIST(韩国国立科学技术院) ; University of California, Irvine(加州大学 Irvine 分校) ; Seoul National University(首尔国立大学)
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 CostNav引入了一个经济导航基准,通过结合物理模拟和行业数据,评估AI代理的经济可行性,发现高任务成功率并不保证经济性,CANVAS在非零SLA合规性下表现最佳。
HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统
机构 * The University of Tokyo(东京大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI ; McGill University(麦吉尔大学) ; Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。
压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。
Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499
驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架
机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) ; National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)
专题命中 Agent评测 :agentic(title,abstract)
AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。
SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI
AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。
ResearchClawBench: 端到端自主科学研究基准
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。
边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征
机构 * Biocomplexity Institute(生物复杂性研究所)
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。
Comments 28 pages, 10 figures, preliminary version; not final
凯恩斯先生与……复杂性!《通论》的一个建议模型
专题命中 Agent评测 :agent(title)
AI总结 提出凯恩斯《就业、利息和货币通论》的数学模型,核心方法是依据原文,主要贡献是表明流动性偏好、资本边际效率和边际消费倾向决定既定利率下的总收益与就业水平。
迈向医疗保健领域值得信赖的大语言模型智能体
专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI
AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。
APeB:大型语言模型智能体个性化能力基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。
Comments NA
用于人类与人工智能协作决策的以人类为中心的反思架构
机构 * University of Piraeus(比雷埃夫斯大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。
DramaDirector: 几何引导的短剧生成
机构 * South China University of Technology(华南理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。
Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector
迈向揭示与修复LLM-in-the-Loop漏洞
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。
机器人的微调:为机器设计的提示
机构 * University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究探讨了机器学习代理在互联网上的决策影响,通过结合经济学和计算机科学框架,发现机器学习模型在环境中自动调整信息呈现,从而提升预测能力,但对人类影响有限。
设计弹性——分布式连续体智能的主动推理
机构 * Department of Computer Systems and Sciences, Stockholm University(斯德哥尔摩大学计算机系统与科学系) ; Department of Information Engineering, University of Pisa(比萨大学信息工程系) ; Distributed Systems Group, TU Wien(维也纳技术大学分布式系统组)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 针对分布式计算连续体中设备故障问题,引入概率主动推理弹性代理,通过构建因果故障图、利用马尔可夫毯和自由能原理识别故障并主动推理修复,经理论验证其可靠有效。
URSA:用于功利性逆合成评估的化学感知基准测试
机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) ; Independent researcher(独立研究者) ; Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) ; Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。
自动:通用人工智能编译器
机构 * RightNow AI(即时人工智能)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。
Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto
MUSE-Autoskill: 通过技能创建、记忆、管理和评估实现自我进化智能体
机构 * ByteDance Inc.(字节跳动公司) ; Rochester Institute of Technology(罗切斯特理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MUSE-Autoskill框架,通过统一的技能生命周期(创建、记忆、管理、评估和优化)使LLM智能体持续提升任务解决能力,实验表明生命周期管理的技能可提高任务成功率、效率、复用性和跨智能体迁移。
Comments 30 pages, 9 figures, 15 tables, Under Review
EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Uber Technologies(优步科技公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE;agentic(comments)
AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。
Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness
EdgeBench:揭示从真实环境中学习的缩放定律
机构 * ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。
AI辅助软件开发生命周期的三阶段评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。
Flow-A11y:基于流程感知的无障碍性测试
机构 * University of Luxembourg(卢森堡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究现代网页应用因交互流程产生的无障碍性问题,提出Flow-A11y系统,通过在真实浏览器执行流程、记录运行时跟踪等方法,贡献为提高测试准确性及实现动态WCAG标准自动化评估。
使用Incognita评估基于社会分布式任务环境中行动的生成智能体
机构 * RedMind Research(RedMind研究)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。
SMOCS:用于在生产中简化机器学习系统部署、监控和优化的流框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对机器学习模型在运行环境部署维护的挑战,提出基于Kafka的SMOCS框架,通过分层抽象、三线程代理架构和配置驱动部署模型应对,可简化流程,且平台无关、容错、可扩展。