Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents
超越静态排行榜:LLM智能体评估的预测有效性
机构 * IBM
AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。
Comments 17 pages, 2 tables, 5 figures
大厂专区
超越静态排行榜:LLM智能体评估的预测有效性
机构 * IBM
AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。
Comments 17 pages, 2 tables, 5 figures
DynAMO:基于拓扑多智能体调度的动态资产管理编排
机构 * Gati Shakti Vishwavidyalaya(加蒂·沙克蒂大学) ; IBM Research(IBM研究院)
AI总结 提出DynAMO引擎,采用先规划后执行架构生成可验证工作流图,支持顺序与并行执行,通过动态识别独立任务提升效率,在工业基准上实现1.6倍延迟降低,并保持正确性与安全性。
Comments 11 pages, 2 figures, 7 tables, 4 algorithms. Evaluated on the AssetOpsBench industrial benchmark. Code: https://github.com/kushwaha001/DynAMO
S2D2:通过免训练自我推测实现扩散LLM的快速解码
机构 * Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Iowa State University(爱荷华州立大学) ; Core AI, IBM(IBM核心AI)
AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。
Comments Code is available at https://github.com/phymhan/S2D2
BLISS: 一种用于语言模型预训练数据选择的轻量级双层影响评分方法
机构 * Department of Computer Science, George Mason University, USA(乔治·马歇尔大学计算机科学系) ; IBM T.J. Watson Research Center, USA(IBM T.J. Watson研究部) ; Department of Statistics, Rice University(里士大学统计系) ; Department of System Engineering & Operations Research, George Mason University, USA(乔治·马歇尔大学系统工程与运营管理系)
AI总结 提出一种无需外部预训练模型的轻量级数据选择方法BLISS,通过双层优化和代理模型估计训练样本的长期影响,实现高效数据筛选,在C4数据集上预训练多种规模模型,显著加速收敛并提升下游任务性能。
TerraMind:面向地球观测的大规模生成式多模态模型
机构 * IBM Research – Europe(IBM欧洲研究院) ; ETH Zurich(苏黎世联邦理工学院) ; Forschungszentrum Jülich(尤利希研究中心) ; European Space Agency(欧洲航天局) ; Φ \Phi -Lab(Φ实验室) ; NASA IMPACT ; University of Iceland(爱沙尼亚大学)
AI总结 提出首个任意到任意生成式多模态基础模型TerraMind,通过双尺度表示(token级和像素级)预训练,实现零样本/少样本应用,并引入“模态思考”能力,在PANGAEA等基准上达到领先性能。
Comments Accepted at ICCV'25