arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里让18款大模型经营一年网店,10万启动金最高变143万

作者:arXivDaily编辑部 arXiv 2608.30730 cs · cs.CL · cs.LG

阿里巴巴通义千问团队、香港科技大学和淘宝天猫集团推出E-Commerce Bench,让18款前沿大模型从10万元启动资金出发,连续经营365天线上商店。GPT-5.6 Sol的年末资产最高,均值达到1431425元,但它在欺诈规避维度只排第16名。

这不是把一串短任务简单接长。智能体要同时研究市场、与供应商谈价、采购库存、设定销售策略、履约、处理退货和现金流;促销、自然灾害与供应链冲击还会改变需求。一次早期进货决定,可能数月后才通过库存和资金周转显现后果。

365天里每天都可能改变经营策略

基准把一个模拟年写成持续演化的经营环境。多个店铺并行运行,商品和供应商数据来自真实电商平台,年度日历包含促销节点和外部冲击。智能体可调用18类工具完成调研、谈判、采购、运营和财务动作,每次操作还会推进模拟时间。

为了让不同模型可公平复现,消费者购买和退货由固定需求模型决定,供应商的报价与让步由确定性谈判内核计算,大模型只负责把对方回应转成语言。这样,收益差异主要来自智能体自身的决策序列,而不是随机市场或另一个大模型临场发挥。

图:论文Figure 1页面区域,比较18款模型五次365天经营后的年末总资产。

赚得最多,不代表经营最稳

GPT-5.6 Sol把10万元增至1431425元,是年末资产最高的模型,但欺诈规避排名第16,并在运营效率上落后于Fable5。这个反差说明,单看利润会掩盖高风险支出、资金回撤和工具调用成本。基准因此还评估谈判、风控、偿付、运营效率、学习等六个维度。

18款模型没有一款统治所有指标。有的模型敢于扩大库存,收入高却承担更大现金流压力;有的谈价更稳,但错过销售窗口。长周期经营要求模型记住供应商历史、季节规律和早期失误,并在后续订单中改变策略,而不是每一天都重新做局部最优选择。

图:论文Figure 9页面区域,对比代表模型在利润、谈判、风控、偿付、效率、执行和学习维度的能力轮廓。

开源模型在反复采购中学会压价

开放权重模型中,Qwen3.8-Max-Preview以416252元领先,比GLM 5.2 high高38%。论文观察到它在长期经营中表现出较强学习能力:对同一供应商和商品反复采购时,能够逐渐把成交价谈低。这类跨月累积的行为正是短基准不容易捕捉的能力。

现金流机制也迫使模型理解时间差。成本发生时立即从银行账户扣除,销售收入则要经过托管和平台钱包后延迟到账。账面销量增长并不等于手头现金充裕,错误采购可能让店铺在收入结算前破产。论文用账户流转图明确记录了这种延迟。

图:论文Figure 6页面区域,展示订单成本和销售收入在多个账户间的延迟结算。

从高分经营走向可问责决策

E-Commerce Bench为长期智能体提供了可复现压力测试,但143万元来自确定性模拟市场,不是现实网店收入,也不代表模型可以独立承担采购、消费者权益或财务责任。真实经营还会面对竞争对手、法规、平台规则与不可预测用户行为。

下一步可把基准用于评估人类审批节点:哪些采购必须复核,风控告警能否阻止高利润但危险的策略,模型换代后历史经验是否可迁移。代码已公开,外部团队也能检查排行榜之外的完整轨迹,而不只接受一个年末资产数字。

轨迹级审计尤其重要。同样的年末资产可能来自稳定周转,也可能来自少数高风险押注;只看终点会把两者混在一起。按月报告库存周转、负余额天数、异常采购和谈判让步,能让经营策略的收益来源更透明,也便于判断模型是否真正从早期经验中调整行为。

参考资料

https://arxiv.org/abs/2608.30730

https://github.com/QwenLM/E-CommerceBench