How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks
真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。
Comments 11 pages, 4 figures