一次“账面全绿”的试制

先设想一个研发场景,数字全部是示意,不是实测。团队要做一款燕麦与大豆复配的植物基饮料,对标一款巴氏牛乳:蛋白约 3.2 g/100 mL,脂肪约 3.5 g/100 mL。第三轮试制之后,检测表几乎全绿,蛋白和脂肪与目标相差不到 0.2 g,表观黏度落在牛乳的波动范围内,静置 48 小时没有明显分层。会上有人提议直接进入放大试验。

当天下午,十位评价员做了盲评。反馈里出现的词是“豆香偏重”“尾段发涩”“有点像焦糖”,没有一个人写“像牛奶”。检测表和舌头给出了相反的结论,这时要问的不是谁对谁错,而是检测表漏掉了什么。

一项真实研究给出的参照

2026 年 5 月前后,《Journal of Food Science》发表的一项研究把这种矛盾摆上了台面,题目是 Sensory and Physicochemical Evaluation of Dairy-Like Plant-Based Milk Formulations Predicted by Machine Learning。研究用随机森林回归(RFR)和梯度提升回归(GBR)预测“像牛乳”的植物奶配方,做出实物之后,与巴氏牛乳、UHT 牛乳以及椰子、燕麦、大豆、杏仁植物奶对比,测了感官、黏度、稳定性、颜色、粒径和顶空挥发性成分。结果是:预测配方的黏度接近牛乳,并与牛乳共有辛醛、1-戊醇、香草醛等部分挥发物;但感官评价里仍与牛乳有明显区别,被描述为带有香草、焦糖、涩、苦、金属和坚果味,牛乳则偏甜、乳香。

这项研究的价值不在于“机器学习没做成”,而在于它老实地摆出了物理化学指标和感官之间的距离。下面几节把“账面达标而口感不达标”的缺口逐个拆开。研究本身没有逐项给出每种味道的来源,以下机理属于食品科学的一般性解释,需要用自己的样品去验证。

缺口一:共有几种挥发物,不等于同一种气味

顶空分析能列出饮料上方气体里的挥发物清单,可是嗅觉有两层过滤。第一层是浓度:一种物质要被闻到,含量必须超过它自己的感知阈值,不同物质的阈值能差几个数量级,微量的强气味物质可以压过大量的弱气味物质。第二层是组合:大脑识别的是几十种物质叠加出的整体轮廓,而不是逐个成分。牛乳的乳香靠一整组成分的比例撑起来,植物奶里即便测得出辛醛和香草醛,只要“乳香那一块”缺席,多出来的香草和坚果味就被推到了前台。

另一个容易被忽略的细节是基质效应。脂肪含量高的体系会留住脂溶性香气,释放变慢;蛋白也可能结合部分醛类,使顶空浓度低于实际含量。仪器测到的是“飘出来的”,口腔里感受到的是被唾液和体温释放出来的,两者未必同步。

缺口二:涩、苦、金属味可能不在顶空里

顶空只抓得住会挥发的成分。涩感通常与多酚类物质和唾液蛋白的结合有关,苦味可能来自不易挥发的肽、皂苷或某些多酚,金属味则可能与矿物盐或脂质氧化产物有关。这些成分大多不在顶空数据里,却会在尾段留下清晰的印象,评价员往往概括成“发涩、不干净”。

排查时可以换一套办法:把配方拆成“蛋白基础液”“基础液加脂肪”“加全部辅料”三个层级逐步品尝,看涩感是在哪一步冒出来的;对可疑原料单独配水溶液评价。豆类蛋白里醛、酮、醇等异味物质的来源,以及发酵怎样转化其中一部分,可以对照豆腥味、草味和涩味的成因与发酵优化来看。

缺口三:黏度、粒径和稳定性是三件事

黏度接近,只说明宏观流动性像。口腔里的顺滑感更取决于粒径分布:颗粒偏大、分布偏宽,舌面会感到粉感或沙感。稳定性则看放置以后颗粒下不下沉。按斯托克斯定律(Stokes’ law)的一般规律,颗粒沉降速度与粒径的平方成正比,与连续相黏度成反比。假设平均粒径从 1 μm 变成 2 μm(示意),理论沉降速度约变为原来的四倍,而黏度表上的数字可能纹丝不动。这也是均质压力、热处理条件必须和配方一起调的原因:热处理会让蛋白部分变性聚集,粒径分布随之改变,色泽也会受原料色素与褐变反应影响。

用一张表把“像不像”拆开

指标 常用方法能回答 回答不了
黏度 流变仪或旋转黏度计流动性像不像 顺滑感、颗粒感
粒径分布 激光粒度仪 是否细腻、沉降风险 香气与后味
稳定性 静置观察、离心加速试验 分层与沉淀倾向 好不好喝
顶空挥发物 顶空气相色谱-质谱 有哪些挥发物、相对多少 涩、苦;整体气味轮廓
感官评价 训练评价员盲评 整体像不像、差在哪个属性 差异的化学来源

把评价流程改一改

  1. 对照样放两份:巴氏牛乳和 UHT 牛乳的味道本来就不同,只选一个,会改变“像不像”的结论。
  2. 让评价员分项打分:甜味、乳香、豆香与坚果味、涩感、后味、顺滑度各一分,再保留一个总体相似度,便于对照总印象和分项。
  3. 每批样品里混入一个盲重复样,估计评价员自身的波动;配方之间的差异小于波动时,不要下结论。
  4. 仪器数据用来解释差异,不用来宣布达标,模型再训练时把分项感官分和仪器数据一起回灌,而不是只回灌总分。

还不能下结论的地方

这只是一项研究,原料、模型和评价小组都是特定的。它说明机器学习能缩小试错范围,并不说明多做几轮就能补上感官差距;差异到底出在配方、加工还是原料本身的风味,尚无可直接套用的答案。植物奶蛋白含量、稳定性与风味之间的整体取舍,见植物奶最难解决的是蛋白含量、稳定性还是风味;植物基食品为什么总在香味和质构上暴露差异,见植物基食品香味与质构差异的观察。纵横国际整理植物基饮料问题时,习惯把“像不像”当成一份要逐项检查的清单,而不是一个总分。