DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX:通过自然选择进化智能体控制程序
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
DarwinX:通过自然选择进化智能体控制程序
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。
AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。
Comments 34 pages, 5 figures
持续改进与并行自主探索:用于搜索大型解空间的大语言模型智能体框架
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)
AI总结 该研究提出一种LLM智能体框架,含持续改进奖励循环与并行自主探索机制,在产品到目录匹配任务中,5个并行智能体的合格覆盖度较单智能体及基线显著提升。
Comments 5 pages, ACM KDD'26 Workshop on SciSoc Agents & LLMs
TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。
Comments 17 pages, 4 figures, 5 tables
MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。
Comments 48 pages, 6 figures
哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线
机构 * Microsoft(微软) ; Indian Institute of Technology Roorkee(鲁尔基印度理工学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。
Comments Extended abstract accepted at the SERI 2026 Industry Track
面向新兴加速器的智能体内核生成方法反思
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。
Comments 12 pages, 7 figures
CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。
巴西房地产投资基金的人工市场:基于代理的提议
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)
AI总结 研究利用基于代理的建模方法开发巴西房地产投资信托人工市场,整合其价值链,纳入宏观经济变量体现代理异质性,经校准和验证,该模型能再现真实市场典型事实,为分析监管政策和定价机制提供新途径。
智能体优化器的效果会叠加吗?基于终端基准测试2.0的持续学习评估
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究智能体优化器收益是否叠加的问题,通过基于终端基准测试2.0的两阶段持续学习评估,比较GEPA、Meta Harness和RELAI-VCL三种方法,发现仅RELAI-VCL能使优化收益叠加,因其在优化循环中内置回归控制。
Comments Technical Report by RELAI (relai.ai)
EgoProceVQA:一种具有自我技能探索代理的新型自我中心程序理解任务
机构 * The Hong Kong Polytechnic University(香港理工大学) ; South China University of Technology(华南理工大学)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 研究针对现有自我中心视频理解评估忽视程序理解的问题,引入EgoProceVQA任务,开发EgoProceGen数据生成平台并构建基准。通过评估发现模型不足,进而提出EgoProceAgent框架,设计相关工具库,使其在多任务上获最优性能,为该任务奠定统一基础。
PiSAs:多用户智能体系统中情境完整性的基准测试
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。
用于自动驾驶的智能体驱动长尾模拟
机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) ; Bosch Research(博世研究院)
专题命中 Agent评测 :agent(title,abstract);planning(abstract)
AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。
技能覆盖率:一种用于智能体技能的测试充分性度量
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Liverpool(利物浦大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。
GroundEval:有状态智能体评估中LLM评判的确定性替代方案
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。
Comments Streamlined entry point into framework
校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?
机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。
Comments 7 pages, 2 tables
ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计
机构 * University of Notre Dame(圣母大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。
大规模评估智能体技能的框架
机构 * Tessl London United Kingdom(伦敦英国Tessl)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出一个评估框架,通过构建真实任务和评分标准,大规模评估500个真实技能在19种智能体模型上的表现,发现模型对技能指令的遵循程度差异显著,且技能显著改变模型行为。
迈向计算机辅助癌症治疗设计:基于智能体的GPU加速分子通路模拟方法
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)
AI总结 提出GPU加速的智能体模拟器,用于癌症信号通路建模与治疗评估,通过MAPK/ERK级联和cFos表达案例验证,准确复现临床剂量反应和基因表达动态。
Comments 16 pages, 7 figures, 2 tables. A preliminary version of this work appeared in the Collections of Short Papers of CIBB 2025 (20th International Conference on Computational Intelligence Methods for Bioinformatics and Biostatistics, Milan, 10-12 September 2025)
AgentCanary:真实可执行环境中自主AI智能体的安全评估框架
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 提出AgentCanary框架,通过正交风险分类、高保真执行环境和轨迹多维度评估,解决现有安全评估中风险覆盖碎片化、环境静态低保真及指标单一粗粒度的问题。
AI智能体与人类社交网络中情绪传染的比较:来自MOLTBOOK的证据
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)
AI总结 研究AI社交网络中的情绪传播,发现负面帖子吸引更多回复,但回复通常趋于中性,情绪不会持续扩散,表明AI网络可能抑制情绪极端化。
Comments 8 pages without appendix
智能体可靠性源自何处?生产企业智能体中验证循环、专家模型和脚手架的跨基准分解
机构 * Leni Inc.(Leni公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究多步骤企业智能体任务失败问题,以生产系统Leni为研究对象,其含验证循环等。通过在三个基准测试评估,发现完整系统有提升。核心贡献是分解提升来源,指出大部分来自脚手架等,验证步骤单独贡献小但作用关键,还得出相关矩阵和模型等结论。
Comments 19 pages, 5 figures, 5 tables. Evaluations conducted March-April 2026. Run-level evaluation record and audit scripts: https://github.com/arnabdastidar/leni-agent-evals
Edu-Theater: 一种通过点名排演实现可扩展学习者行为模拟的数据高效智能体框架
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; iFLYTEK Co., Ltd.(科大讯飞股份有限公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Edu-Theater框架,通过构建群体水平能力先验和少量诊断查询,利用LLM智能体模拟学习者行为,在减少数据需求的同时提高模拟精度,并增强下游自适应测试等应用。
Comments LLM Agent, Educational Data Mining, Data Synthesis, Human Simulation
Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试
专题命中 Agent评测 :agentic(summary_cn,abstract);分类 cs.SE
AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。
Comments 8 pages, 3 figures
SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI
AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。
Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench
AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试
机构 * Renmin University of China(中国人民大学) ; Anhui University(安徽大学) ; Z-Lab Z.ai ; Tsinghua University(清华大学) ; Bosch Center for AI(博世人工智能中心) ; University of Oslo(奥斯陆大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);workflow(abstract)
AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。
Comments 9 pages, accepted by KDD 2026
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea
超越预测:预测市场代理中的信念到交易层
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; The University of Hong Kong(香港大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI
AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。
Comments 10 pages, 4 figures
AgentMercury:你的智能体可规模化合成面向业务场景的可验证环境
机构 * Meridian Intelligence Global Inc.(子午线智能全球公司) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 Agent评测 :agent(title);tool use(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出AgentMercury框架,可规模化合成业务场景的可执行环境,经其训练的智能体策略在企业工作流及多领域基准上表现提升,且环境构建过程可通过微调学习优化。
当故障传播时:智能体检索增强生成中的因果故障归因
机构 * Anote(阿诺特)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出AgenticRAG-FP基准,针对智能体RAG的因果故障归因开展实验,发现基于覆盖率的诊断在第1轮表现较好,第2、3轮较差,明确将传播深度作为相关评估维度。
面向军事指挥与控制的智能体AI系统的测试与评估
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文针对军事C2场景中智能体AI系统测试与评估的保障问题,分析既定方法的假设被智能体特性削弱的情况,推导保障主张并评估现有方法,明确部分举证责任转移至部署阶段。
Comments 57 pages, 4 figures