腾讯微信AI与南加州大学提出AlgoWorlds,用240个可验证环境测试工具智能体能否做出全局最优决策。七款前沿模型大多能提交可行方案,但表现最好的Claude Opus 4.8精确最优率也只有38.61%。
现有工具基准常检查智能体是否调用了正确接口、参数是否合法、流程是否完成。路线规划和车队调度却不能止步于“任务做完”:多个选择共享容量、时间和成本,一个局部可行方案可能让整体费用大幅高于最优值。
240个世界都有经过认证的最优答案
AlgoWorlds覆盖十类组合优化问题和四档工作量。每个环境包含一个隐藏实例,模型只能通过任务专用工具逐步查询信息,最后提交一次结构化决策。评分同时检查可行性与最优性,把“能交差”和“做得最好”明确分开。
环境由各问题族的确定性程序生成,精确算法认证全局最优解并划分工作量。相同底层实例还使用两种结构不同的工具接口呈现,以减少模型记住固定查询格式的影响。240个环境因此既可程序化复现,也有可独立核验的答案。
图:项目页Figure 1汇总七款模型的精确最优率、信息充分性和一个路线规划案例。
查到足够信息,仍然常停在次优解
七款模型包括Claude Opus 4.8、GPT-5.6 Sol等。领先模型多数情况下能产出可行决策,说明它们可以理解工具返回并满足基本约束;但最高精确最优率仅38.61%,大多数提交没有达到认证最优值。
论文进一步判断模型收集的信息是否足以重建隐藏实例。即使信息已经充分,失败仍多为“可行但次优”,而非完全无法回答。这把瓶颈从信息获取推进到信息整合、全局约束推理和提交前验证:模型知道了各部分,却没有把它们组合成最省成本的整体。
图:AlgoWorlds项目页的算法世界视觉,用网络结构表示相互耦合的决策路径。
信息充分率与精确最优率相差数十个百分点
补充实验把七款模型的平均信息充分率与精确最优率画在同一条线上。多数模型的信息充分率接近或超过八成,最优率却集中在更低区间;例如GPT-5.6 Sol的信息充分率为89.9%,精确最优率为38.2%。差距说明继续增加查询次数未必能直接解决问题。
一个交通路线案例更直观:模型找到可行的24段路线,旅行时间甚至比认证方案低9.6%,但换乘成本高出241.5%,综合目标值高出63.3%。只优化眼前显眼的指标,会在共享成本里付出更大代价。240个环境来自十类程序化问题,不能代表全部真实企业调度。
图:论文Figure 2页面区域,连接每款模型的信息充分率与精确最优率。
工具智能体部署前应增加最优性复核
AlgoWorlds提示,企业智能体的验收不能只记录工具调用成功率。对排班、库存、物流和资源分配,系统还应报告目标值、约束余量和可比较基线,并在提交前调用求解器或验证器检查是否存在明显更优方案。
项目页和代码已经开放,便于外部模型在同一隐藏实例上复测。下一步可以加入更大规模、动态变化和不完全确定的任务,观察模型能否学会在信息预算、求解成本与决策质量之间取舍,而不是无限查询后仍提交未经全局核验的答案。
部署流程还应保存候选方案而非只留最终提交。若模型能列出多个可行解,传统求解器可以在较小候选空间内复核,或者把目标差距反馈给模型再修正一次。这样的混合系统不要求语言模型独自完成全部优化,却能利用它理解工具语义和处理非结构化要求的优势。
同时,企业任务经常有无法写进单一目标函数的偏好。AlgoWorlds的认证最优值提供清晰标尺,真实部署则应把硬约束、软偏好和人工例外分开记录,避免模型为了一个数字最优而违反业务优先级。
参考资料
https://arxiv.org/abs/2608.29397