不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。
在12个AlphaEvolve数学构造问题中,Station在5个问题上得到相对既有文献的新结果,包括11维604点接吻配置、有限域Kakeya集合新族、离散Kakeya针和符号不确定性的新界。论文另做了Book Ramsey数等案例,并公开原始对话、证明和验证代码。
智能体自己选方向、写论文、读同行工作
Station模拟一个小型科研生态:不同模型家族的智能体可以选择问题、运行代码实验、与其他智能体交流,并把阶段结果写成内部论文。后来的智能体会检索这些论文,继续验证或扩展。系统只给研究目标,不使用为每道题定制的中心流水线。
这种自由也有成本。智能体会重复探索、错过已有线索或过度声称结果。团队使用可执行评分、证明检查与公开工件约束结论,并在论文中区分数值记录、显式构造和定理级解释。
11维接吻数被推到604
接吻数问题问的是,多少个不重叠等半径球可以同时接触一个中心球。Station在11维找到三种两两不同构的604点配置,证明K(11)至少为604;其中一个与同期公开平台上的构造相同,另外两个据作者核查对应新的等距类型。
论文Figure 3:三种11维604点配置投影到三维后的结构,颜色区分共享核心和两类扩展。
智能体先把搜索缩成围绕496点整数核心的有限兼容问题,数分钟内找到604点配置,之后又整理出不依赖计算机搜索的显式代数构造。论文强调,本研究只覆盖可打分的构造任务,不能据此断言系统已经能自主处理任意开放数学问题。
一个下界把开放区间缩短约82%
在Erdős最小重叠问题上,Station把已发表下界从0.37912提高到0.380552;结合当时的已发表上界0.380868,作者计算该结果关闭了此前开放区间约82%。这里提升的是理论界限,不是模型准确率。
论文Figure 2:Station提高下界后,与当时上界之间的开放区间明显缩小。
离散Kakeya针任务中,智能体还在部分规模上减少构造面积,并在n=5时找到打破对称性的更小构造。不同规模分别优化,结果不能写成一个对所有n统一有效的新公式。
论文Figure 4:Station与AlphaEvolve在若干有限规模上的面积比较,以及n=5的对称与非对称构造。
内部文献既推动合作,也会留下断点
超过一半的重点发现涉及多个智能体协作。不同模型往往贡献互补线索,早期内部论文在很久之后被重新利用。Book Ramsey案例中,系统给出三个新无限族,并解决参数1至200范围内原先开放的28个情形。
论文Figure 7:参数1至200范围内,三个Station无限族覆盖的既有与新解决情形。
团队也记录了失败:某些证明需要外部专家把已存在的两条线索连接起来,智能体没有自行完成综合;邻近维度的接吻数搜索也没有同步创纪录。公开对话和验证工件使这些边界可以复查。
下一步是让数学家审阅可复现证据
Station适合目标可评分、实验迭代较快的研究方向。真正进入数学工作流,重点不在智能体写出多少内部论文,而在结果是否能由独立研究者复现、证明是否经同行检查、文献新颖性是否持续成立。
项目已开放代码、完整对话和验证材料。后续最有价值的测试,是在预先登记的问题集上重复运行,统计成功率、算力成本和错误证明比例,并观察外部数学家能否沿着这些构造继续得到可靠结果。
参考资料
https://arxiv.org/abs/2608.23691
https://arxiv.org/html/2608.23691
https://github.com/dualverse-ai/station