arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI能给植物肉试味?斯坦福等用2.1万次人类评价检验预测

作者:arXivDaily编辑部 arXiv 2610.02599 cs · cs.AI

论文导读

斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1%,品尝者中位为65.0%。配料、营养和照片可以用于前期排序筛选。

AI没有品尝,预测的是人类评价排序

开发植物肉或无乳奶制品,要反复判断新品与目标动物食品有多相似。人类品尝测试成本高,计算模型如果能先挑出值得测的配方,就可以给研发流程增加一道筛选。

TasteBench不让AI“尝到味道”。食品任务输入配料、营养、照片等信息,目标是预测同类产品在人类相似度评价中的先后关系。数据覆盖215款植物食品、24个类别,形成935对类别内部比较。

另一项任务使用超过1.5万种分子,预测甜、苦、酸、鲜等味觉标签。分子味觉分类与完整食品相似度排序,是两层不同问题,不能因为分子判得准就推断新品一定好吃。

图:食品和分子两层任务、输入特征与评价数据的关系。

先问品尝者之间有多一致

口味标签有主观差异。团队先比较个人评价与其他人的汇总结果,在可比样本中,品尝者中位排序准确率为65.0%。人类之间的一致性较低,说明标签本身不是每个人都认同的唯一答案。

把评测人员分为两组再比较汇总排序,得到82.5%的可靠性参考上限。它用于解释这个数据集上的成绩范围,不是人类感官能力的普遍上限。

产品特征公开时还需要保护品牌身份。论文将待评产品混入更大的食品特征池,降低从公开信息推断某品牌低分的风险,比赛使用去标识数据完成评分。

研发成本图把配方描述、仪器分析和大型人类感官测试分层,说明计算预测适合先在哪一环参与。

图:从配方描述、仪器测量到人类感官测试的成本层级。

同组66.1%,全部935对为68.3%

模型比较包含监督学习、大语言模型和组合方案。把统计排序模型与语言模型判断组合后,在与品尝者相同的配对集合上达到66.1%,比个人中位65.0%高1.1个百分点。

在全部935对类别内比较上,同一最佳方案为68.3%。这两个数字对应不同样本集合,不能拿68.3%直接对照65.0%来夸大超过人的幅度,更不能写成“AI味觉胜过人类”。

分子分类实验中,图神经网络在2254个测试分子上准确率90.4%。但更好的分子编码器并没有稳定提高食品排序,复杂食品中的加工、质构和成分相互作用,不能只靠单分子标签概括。

图:品尝者人数变化时的相似度排序准确率曲线与模型参照。

下一步:把计算筛选放在品尝测试之前

这套基准提供了食品特征、排序评价和可核对的结果,适合比较不同预测方法是否真的节省前期筛选工作。人工品尝仍承担最终确认,模型分数不能替代食用体验。

作者公开仓库包含复核论文结果的预测文件;部分品牌对应信息受访问条件限制。继续增加产品类别、加工与质构特征,并在新产品上验证,是计算筛选走向研发使用的下一步,也需要把数据可取得性与复现层级讲清楚。

参考资料

https://arxiv.org/abs/2610.02599

https://arxiv.org/html/2610.02599

https://github.com/Food-Intelligence-Lab/tastebench

↑