2026 年一项面包生产线数字孪生研究给出过两个数字:面团体积的动态预测误差低于 3%,湿度预测落在 ±2% 以内。这样的孪生能回答“这一炉现在走到哪里、再过五分钟会怎样”,却回答不了“下周该改哪个配方参数”。前者靠机理模型加传感器,后者需要专门决定下一次实验的算法。两件事常被混在“食品研发AI”一个词里,值得拆开看。

数字孪生到底是什么,不是什么?

数字孪生(Digital Twin)不是一段三维动画。2026 年 Frontiers in Food Science and Technology 上的综述把它描述为机理模型、传感器与 AI 的连接,为质量、安全和浪费提供近实时的决策支持。以发酵罐为例:机理部分是生长与代谢的动力学方程,传感器给出温度、pH、溶氧和尾气组成,AI 部分持续校正模型参数,并在读数缺失时充当软测量。综述同时指出,现有食品数字孪生多为孤立的概念验证,缺少互操作性和可扩展性。落到工厂里就是:一条线、一个产品、一套传感器,换个品类要重新标定,各系统的数据格式互不相通。

科学机器学习(Scientific Machine Learning)的思路适合这里:让机理方程搭骨架,让数据只去学机理解释不了的残差。食品配方生成科学综述(arXiv 2607.09529)提出要用机理模型为 AI 的预测“接地”,指的也是这个方向。

下一次实验由谁决定?

由主动学习(Active Learning)一类的方法决定,贝叶斯优化是其中最常见的一种。做法是先用已有实验拟合一个代理模型,常用高斯过程,它对每个没试过的参数组合给出预测值和不确定度;再用采集函数(Acquisition Function)在“去预测结果最有利的地方”和“去最不确定的地方”之间折中,选出下一批。《Journal of Food Engineering》2025 年一项研究用多目标贝叶斯优化调节植物基肉类似物的质构,在较高维的工艺参数空间里约 15 次迭代内逼近了目标质构。假设水分、机筒温度、螺杆转速、进料速率、口模温度和蛋白配比 6 个参数各取 5 档(示意),全组合是 15625 组,15 次与它的差距,正是这类方法值钱的地方。当然,这不意味着任何挤压体系都只需十几次,那项研究的设备、原料和目标质构是特定的。具体参数怎样影响纤维结构,可以看植物肉高水分挤压的参数优化拆解

反直觉的是,贝叶斯优化经常建议做一个看上去很差的实验,因为那个角落里模型最不确定,做一次的信息价值最高。这样的建议很容易被误判成算法出错。

自驱实验室要把哪些环节连起来?

自驱实验室的核心是设计—制造—测试—分析(Design–Make–Test–Analyze,DMTA)的闭环:算法选点,设备自动配料并制作样品,仪器自动测量,结果写回数据库,模型更新后再选下一批。目前公开的成果集中在化学与材料领域;食品领域完整的自驱实验室仍处于早期,更常见的形态是局部自动化加贝叶斯优化,比如自动配料台配合固定的黏度或质构测量。

食品比小分子体系难在三处。物料黏稠、含颗粒、容易结块或分层,自动称量和移液的误差比液体试剂大得多;测量慢,发酵滴度可能要离线检测几个小时,感官评价也很难完全交给设备;仪器质构与人类感知之间还存在落差,前面提到的食品配方生成科学综述把它列为难点之一。这些环节里最慢的一个,决定了整个闭环一天能转几圈。

闭环会在哪里断?

  • 目标函数偏了。优化器把仪器质构推到极致,人却不喜欢。植物奶那项机器学习研究里,黏度已接近牛乳,感官评价依然能区分,就是这类风险的现实版本。
  • 噪声大于信号。自动配料对粉体和黏稠物料的误差,如果比配方之间的真实差异还大,优化器会追着噪声跑。先做重复实验估计测量噪声,是廉价的保险。
  • 原料批次变了。代理模型学到的是上一批原料的规律,新批次蛋白溶解性变化后,历史数据的权重需要重新设定。
  • 传感器漂移。在线传感器长期不校准,数字孪生的误差会缓慢积累,出现在最不容易被留意的环节。
  • 约束没写进搜索空间。设备安全限值和法规要求如果不在约束里,算法会推荐做不了或不能做的参数。

人留在哪里?

人负责的部分反而更集中:定义目标和约束,设计盲测与参照样品,解释异常,做合规确认。2026 年 6 月的食品行业媒体报道也强调,AI 能算营养和成本,却不会“尝味道”,感官、工艺放大和策略判断仍需人。放大的问题尤其如此,孪生与机理模型可以给出预测,但实验室配方放大到工厂后的变样,仍要靠中试验证。

纵横国际ai栏目的判断是:在可预见的一段时间里,食品研发更现实的形态是“一条产线的数字孪生”加“一类实验的贝叶斯优化”,两个局部闭环先跑通。闭环的速度不取决于算法多聪明,而取决于最慢的那一次测量,所以最值得先补的,或许是让最慢的测量变快、变可重复。