Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents
超越静态排行榜:LLM智能体评估的预测有效性
机构 * IBM
AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。
Comments 17 pages, 2 tables, 5 figures
大厂专区
超越静态排行榜:LLM智能体评估的预测有效性
机构 * IBM
AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。
Comments 17 pages, 2 tables, 5 figures
DynAMO:基于拓扑多智能体调度的动态资产管理编排
机构 * Gati Shakti Vishwavidyalaya(加蒂·沙克蒂大学) ; IBM Research(IBM研究院)
AI总结 提出DynAMO引擎,采用先规划后执行架构生成可验证工作流图,支持顺序与并行执行,通过动态识别独立任务提升效率,在工业基准上实现1.6倍延迟降低,并保持正确性与安全性。
Comments 11 pages, 2 figures, 7 tables, 4 algorithms. Evaluated on the AssetOpsBench industrial benchmark. Code: https://github.com/kushwaha001/DynAMO