假设一个候选库里有 800 个样本,来自豆类、油籽、藻类和真菌,实验室一周只能完成二十个溶解性加凝胶测试。这时 AI 要回答的不是“哪个蛋白最好”,而是“这二十个名额给谁”。答案还取决于用途:植物奶看溶解和乳化,凝胶类产品看凝胶强度,蛋泡类产品看起泡,同一个候选在三个场景里的排名可能完全相反。这正是“蛋白质含量最高”往往不是答案的原因。纵横国际整理替代蛋白筛选时的一个体会是:先写清用途,再谈模型。
特征层:能从序列读出的,和必须测出来的
特征可以分三层。序列层最便宜:氨基酸组成、等电点、疏水性分布、半胱氨酸数量(决定可能形成多少二硫键);结构层借助结构预测工具估计二级结构和表面暴露残基;理化层才是在样品上真正测出来的量——表面疏水性、Zeta 电位、未变性蛋白含量、持水力、β-折叠含量。越往下越贵,也越接近食品里的真实状态。
反直觉的地方在于,序列相同的蛋白,两种提取工艺可能给出完全不同的溶解性。序列和预测结构描述的是天然蛋白,而进入食品的是被碱溶、酸沉、加热、喷雾干燥处理过的蛋白,“加工史”并不写在序列里。只用序列预测功能,等于假定所有样品都被同样温和地对待。
预测层:R² 属于哪份数据
2026 年一项机器学习研究(PubMed 收录号 41813604)用可测的结构特征预测植物蛋白的溶解性、乳化活性指数、乳化能力和凝胶强度,把它作为蛋白原料质量的筛选工具。在该研究自己的数据集内,支持向量回归对溶解性和凝胶强度的 R² 约为 0.88–0.89。这个数字只属于那份数据:样品来自哪些作物、在什么 pH 和离子强度下测、蛋白浓度多高,都已经写进了 R²。换一批新原料或另一套测试条件,就必须重新验证,不能把 0.88 当成“AI 预测蛋白功能的精度”。
另一项 2025 年 Foods 研究更极端:只用 α-螺旋、无规卷曲和溶解性三个特征预测植物蛋白的消化性,据报道评估时间缩短约 80%,样品用量约为标准方法的百分之一。它说明少量特征也足以做初筛;但初筛的意思是排序,不是替代最终测试。
多组学补什么
上面的特征描述的是“总蛋白”,而真实原料是混合物。蛋白质组学(proteomics)能说出样品里有哪些蛋白组分、各占多少,例如 7S 与 11S 球蛋白的比例常与凝胶行为有关;代谢组学(metabolomics)和挥发物分析则能找出造成豆腥、苦涩的小分子,以及植酸、单宁这类会与蛋白结合、影响溶解与风味的成分,提示后面要不要脱腥脱苦。两类数据补的是“组分”和“杂质”,序列与理化指标看不到它们。局限同样明显:多组学样本通常不多,批次效应大,进模型前要先做归一化和批次校正。
预测好、加工不行:几个常见断点
“预测很好,一上产线就不行”,多半出在测试条件和真实工艺错位。实验室常在 pH 7、室温、低盐下测溶解性,而植物奶要经过 UHT 与均质,蛋白在高温和剪切下聚集,溶解性高的样品也可能沉淀。凝胶强度多在纯蛋白体系里测,进配方后还要面对脂肪、多糖和盐的干扰。溶解性再好,豆腥味压不住,也进不了产品。批次与季节波动会进一步拉低模型在现场的表现。
所以漏斗要配一套验证阶梯,每一级都用更真实的条件淘汰一批:
- 小试:氮溶解指数、乳化活性与稳定性指数、起泡容量与稳定性、最小凝胶浓度,几克样品即可完成。
- 模拟基质:在目标 pH 和离子强度下做热处理与均质,观察黏度、粒径和沉淀。
- 真实配方与感官:加入脂肪、糖和风味,做感官评价并观察货架期。
- 中试:换成真实设备的剪切与升温速率,检查放大后的一致性。
数据偏差与外推风险
训练数据多来自大豆、豌豆这类研究充分的作物,藻类、微生物蛋白、油籽饼粕的样本很少。模型在见过的区域里内插尚可,遇到新型食品蛋白就是外推,误差往往明显变大,而输出的数字看起来依旧自信。此外,文献数据来自不同实验室、不同测试条件,很难统一;失败样品很少被发表;样本量常常只有几十到几百个,同一批次的样品若被分进训练集和测试集,R² 会虚高。较稳妥的做法是按作物来源或批次分组做交叉验证,让模型给出不确定度,再用主动学习(Active Learning)把下一批实验放在不确定度高又有应用价值的区域,思路与AI 怎样决定下一次实验一致。
评价这样一个漏斗,不必先看 R²,先看命中率:让模型推荐二十个,再随机抽二十个,两组里通过小试的比例差多少?差不多,就说明模型还没派上用场,无论拟合曲线多漂亮。需要在应用里并排比较不同原料时,蛋白对比的思路也是同样的:把测试条件和数据来源一并列出来,再谈排名。