假设一个植物基发酵饮品项目有 7 个自由度:三种蛋白的混合比(受“总和为 100%”约束,只占两个自由度)、糖含量、稳定剂用量、均质压力、发酵时间、发酵温度。粗略按每个自由度 5 档估算,组合有 5 的 7 次方,约 7.8 万种(示意);实验室每周做 20 组,全部试完要 75 年上下。生成候选从来不是瓶颈,瓶颈是每周那 20 个名额该给谁。
目标是一个分数,还是一条前沿
如果口感、成本、沉淀率被压成一个加权分,采集函数(acquisition function)只需追一个数,代价是权重悄悄替团队做了决定。多个目标并存时,更合理的选点标准是“这一组实验能把帕累托前沿推出去多远”,常用超体积改进(hypervolume improvement)来衡量。2025 年《Journal of Food Engineering》有一项研究用多目标贝叶斯优化调节植物基肉类似物的质构,在较高维的工艺参数空间中约 15 次迭代内逼近了目标质构。约束也要在选点时就进入:成本上限、原料是否合规、配比之和为 100%,违反约束的点即使预测得分再高,也不该占用名额。前沿与取舍的概念见为什么不存在一个简单的“最佳配方”。
一次选 20 个,和一次选 1 个不是同一个问题
贝叶斯优化的入门例子常常是一次选一个点,做完再选下一个。实验室一周却要同时定下 20 个。若每个点都取采集值最高的,它们会挤在同一个峰值附近,20 个样品其实回答了同一个问题。批量采集(batch acquisition)的思路是:选中一个点以后,先假设它已经有了结果(用预测值代替),再去选下一个,后面的点便会自然分散;也可以在每批里强制留出几个远离已试区域的点。
食品配方还有一个特有的细节,即混合物约束。三种蛋白的比例之和为 100%,如果在无约束空间里搜索、事后再归一化,点与点之间的距离和相似度会被扭曲,宜使用混合物设计(mixture design)的空间表示。项目第一周没有数据,这 20 组更适合用拉丁超立方抽样或 Sobol 序列一类的空间填充设计,让模型先见到尽量分散的样本。
噪声有多大,决定了重复样放几个
假设同一配方在不同日期做了三次,感官得分分别为 6.8、7.3、6.5(示意),波动约 ±0.4。这时模型说 A 比 B 高 0.3,其实无从分辨。采集函数如果不知道噪声水平,就会追着噪声跑。反直觉的一点是“赢者诅咒”:被选为当前最优的配方,多半沾了一点好运,复测时得分往往回落,这是回归均值(regression to the mean),并不是配方变差。对策很朴素:每周固定放 2–3 个重复样,再加一个贯穿所有周的“锚样”,用它校正评价员和批次的漂移。
什么时候把探索换成利用
探索与利用的比例不必固定。可以设想:第 1 周几乎全是空间填充;第 2 到第 3 周探索占大头,专挑模型最拿不准的区域;之后逐步转向围绕有希望的区域微调。停止或转向的判据也应当事先写下:当下一批候选的预期改进(expected improvement)小于评价噪声时,继续加密的边际价值已经很低,该换目标、换变量范围,或者去补充模型缺失的变量。前面提到的 15 次迭代不宜直接套用:那项研究针对的是质构目标,感官喜好类目标的噪声通常更大,所需迭代次数要另行评估。
三种常见的失败情形
| 症状 | 常见原因 | 处理办法 |
|---|---|---|
| 选出的点全挤在一个角落 | 逐点贪心,缺少批量多样性 | 用批量采集;每批强制留出远离已试区域的点 |
| 预测与实测长期对不上 | 缺少关键变量,或不同评价小组的数据混在一起 | 先补记录字段、按评价小组分层,再考虑换模型 |
| 上周的最优配方本周复测变差 | 评价噪声与回归均值 | 复测,并加入重复样与锚样 |
第二行最值得多说一句。模型误差大时,第一反应常常是换算法,可更常见的原因是数据里缺了真正起作用的变量。假设两批同配方饮品的沉淀率相差一倍,追溯下来,是均质压力在两天里被调整过,而这个数没有进数据表;在模型看来,同一配方给出了两个答案,它只能把差异当成噪声。
离自驱实验室还有多远:瓶颈在制样和品尝
自驱实验室的核心是“设计—制造—测试—分析”(DMTA)闭环:算法设计下一批实验,设备制备样品,仪器测试,结果回到模型。已公开的成果主要出自化学与材料领域;食品方面,完整的闭环仍处早期,眼下更常见的是在局部环节做自动化,再配合贝叶斯优化选点。称量、混合,以及用仪器测黏度和粒径,都容易自动化,感官评价却依赖人,制样又受热处理、均质、冷却等工艺细节牵制。更现实的形态是“半闭环”:自动化负责仪器测量与数据入库,人负责品尝和最后的判断。
有一篇 2026 年 6 月的行业媒体报道引用了某厂商案例:谷物棒的改良周期由 12 周降到 6 天。它是单一案例,也未经同行评议,只宜当作方向参考;同一篇报道还强调,AI 能算营养和成本,但不会尝味道。另外,模型给出的不确定度本身未必可靠:2026 年 7 月的食品配方生成科学综述把不确定性量化列为难点之一,并主张用机理模型为 AI 预测“接地”;2026 年另一篇综述则指出,现有食品数字孪生多为孤立的概念验证。这条线的具体做法,可参考数字孪生与自驱实验室怎样决定下一次实验,挤压参数上的应用见植物肉高水分挤压参数优化。
周会上的检查清单
- 看板第一项放“预测值与实测值之差”,并与评价噪声并排显示。
- 本周 20 个名额各归哪一类(空间填充、利用、探索、对照),写明理由。
- 每个候选是否满足硬约束:配比之和为 100%、成本上限、原料合规。
- 数据表字段是否齐全:原料批次、设备参数、评价员分组、样品出场顺序。
还不能下结论的地方
采集函数怎样权衡、每批多大、探索比例多高,最终要看具体项目的噪声与成本。食品原料常常是类别变量,比如“用哪一种蛋白”,而不是连续数值;这类变量在高维空间里的贝叶斯优化表现,目前没有可以直接引用的公开结论。有一件事现在就能做:先花两周只做重复样和锚样,把评价噪声量出来,再谈优化。噪声量不出来,模型说的“下一组最值得做”就缺少判断的尺子。纵横国际整理食品研发AI这一方向时,也倾向把这一步排在算法之前;相邻的筛选逻辑见AI生成上千配方后为什么要筛掉大部分。