论文导读
Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半径圆堆积子问题,不能外推为通用科学发现。
让不同大小的圆塞进方框,答案很容易验证
这项任务要求把N个半径可变的圆放进单位正方形,圆不能重叠,也不能越界,目标是让半径总和尽可能大。它有大量局部最优:稍微移动一个圆,可能给邻居腾出空间,也可能造成新碰撞。Packomania长期维护不同N的最佳已知解,适合检验算法是否真的推进纪录。
论文选择N=101至114中的12个目标,向语言模型提供求解器源码、当前得分和历史尝试。模型每轮提出完整程序修改,系统运行代码、优化候选布局,再用严格几何检查确认可行性。只有分数提高且通过零容差验证的程序,才进入下一轮成为新的起点。
图:论文PDF第2页给出可变半径圆堆积定义、约束及本次实验的主要贡献。
成绩榜和失败历史构成了搜索反馈
循环不是让模型直接“想象”圆的位置,而是让它编辑可执行优化程序。评分器告诉模型总半径、哪些目标改进,以及代码是否报错;历史记录则避免反复尝试同一思路。15轮中出现了盆地跳跃、稀疏惩罚、精英池、随机扰动和局部精修等不同策略组合。
独立检查很关键。若只相信模型自己输出的分数,程序可能利用数值误差或评分漏洞。作者以零容差检查圆间距离与边界,对两项仅有约十万分之一变化的结果没有计入纪录,最终只报告经Packomania维护者接受的改进。
图:论文PDF第5页表1列出10项被接受的纪录改进,表2记录每轮成本、得分与关键修改。
27.72美元换来10项纪录,但收益很早进入平台期
系统总模型调用成本为27.72美元,墙钟时间约8小时,使用单台消费级电脑执行评估。12个目标中10个得到新的最佳已知解,总分从51.814380提高到54.406044;表中单项相对改进约2.43%至5.42%。结果证明个人研究者也能运行这类闭环,而不必使用分布式集群。
迭代日志也显示,主要提升集中在前几轮,后续多次候选被拒绝或只做细小精修。作者分析,如果及时检测平台期,可在几乎不损失解质量的前提下降低约50%成本。因此“低成本”并不代表无限追加调用有效,停止条件本身就是系统设计的一部分。
图:论文PDF第7页比较Discovery Loop与AlphaEvolve、FunSearch的组织、基础设施、成本和开源情况。
下一步:把发现循环扩展到更多可验证优化
圆堆积特别适合自动循环:目标函数明确,候选程序运行快,正确性可用数学约束检查。对编译器调优、排程或组合优化,只要也有便宜可靠的评估器,类似方法可能降低算法搜索门槛。
边界同样来自这种便利。实验只有一个问题域、单一主模型和有限预算,没有证明面对昂贵实验、模糊目标或不可自动核验的科学问题仍然有效。更稳妥的结论是:当反馈客观、执行便宜、失败可恢复时,LLM能成为程序搜索环中的提案器,而最终事实仍由外部验证器决定。