给大语言模型(Large Language Model,LLM)一句需求:“做一款蛋白质 3%、不额外加糖、成本比现有配方低一成的燕麦豌豆植物奶。”几秒钟后,它会交出一张整齐的配料表,每个原料后面都有百分比,还附带均质和杀菌工艺。麻烦在于,表里没有一个数字是算出来的,它们只是读起来合理,而合理和成立之间隔着好几类不同的模型。纵横国际AI整理这一方向时,更愿意把它们看成一个分工明确的班组,而不是一个全能选手。
班组名单:谁擅长什么,谁会在哪里失效
| 岗位 | 擅长的活 | 典型失效方式 |
|---|---|---|
| 大语言模型(LLM) | 读文献和法规,把含糊的需求拆成带单位的约束,起草实验方案,配合检索增强生成(Retrieval-Augmented Generation,RAG)做带出处的问答 | 幻觉:编造参数和文献 |
| 回归与树模型 | 在几十到几百行的小样本表格上预测黏度、粒径、稳定性等可测指标 | 没见过的原料组合,预测立刻失准 |
| 优化器 | 在预测模型之上做多目标搜索,如贝叶斯优化、NSGA-II 遗传算法,输出帕累托前沿 | 专往训练数据的边界以外钻,因为那里的预测值最漂亮 |
| 感官模型 | 把评分、描述词和仪器数据映射到人的感受与偏好 | 受评价员、量表和文化背景影响,换一批人就不准 |
| 工艺模型 | 机理加数据,描述挤压、发酵、热处理中的传热、剪切、停留时间和反应 | 设备或规模一变,参数需要重新标定 |
2026 年 7 月的一篇食品配方生成科学综述(arXiv 2607.09529)用六个动词概括 AI 在配方研究里的工作:预测、发现、生成、组织、模拟、行动。对照上表,预测主要交给回归模型,发现和生成靠生成式 AI(Generative AI)与优化器,组织是 LLM 加检索和知识库的活,模拟属于工艺模型,行动才是把结果送进实验设备。这种对应是纵横国际为了讲清分工做的理解,并非综述原文的划分。
一条需求怎样在班组里流转
仍以那杯植物奶为例,需求大致经过下面几站,数据层的细节见纵横国际大模型怎样连接各类数据。
- LLM 把“高蛋白、低糖、成本可控”翻译成带单位的约束表:每 100 g 蛋白下限、糖上限、每公斤成本上限、禁用原料;声称条件以现行国家标准和法规为准。
- RAG 从内部实验记录和文献里取回相关原料的功能资料与过去失败的配方,答案必须附出处段落。
- 回归模型预测黏度、稳定性、蛋白含量和成本,同时给出不确定度。
- 优化器在原料比例空间里搜索,得到帕累托前沿上的若干候选。
- 感官模型给候选排序,工艺模型检查现有均质与杀菌条件下能不能做出来。
- 人挑出六到八个候选做实验,测得的数据回填模型,LLM 据此起草下一轮实验方案。
这条链里,LLM 只出现在入口和出口,中间所有数字都来自可以被检验的模型。多目标搜索怎样把口感、成本、营养和碳排一起放进同一个问题,可以参考纵横国际绿色食品配方的优化模型。
三种最常见的出错方式
幻觉。LLM 常把“燕麦 β-葡聚糖会增加黏度”这样的通识,说成对某个具体批次原料的定量结论,或引出一篇并不存在的文献。对策很朴素:数字只允许来自回归模型或数据库,LLM 只转述,且每个结论都要能回溯到原文段落。
数据泄漏。假设数据集里有 60 个配方,每个配方测 3 次,共 180 行。把 180 行随机分成训练集和测试集,同一个配方的重复测量就会同时出现在两边,测试 R² 漂亮得不真实,换一个全新的配方立刻掉下来。正确的做法是按配方或按批次分组做交叉验证。
外推。优化器天然偏爱训练数据的边界之外,因为那里没有数据约束,预测值最容易好看。假设训练集里豌豆蛋白只覆盖 1.0%–2.5%,模型却推荐 4.0% 时稳定性最优,这个结论本质上是猜测。对策是给每个候选标出它离训练数据有多远,把远的候选当作探索性实验,而不是答案。
为什么感官岗位不能空着
2026 年《Journal of Food Science》上的一项植物奶研究,用随机森林回归和梯度提升回归预测“像牛乳”的配方,再用黏度、粒径、稳定性、颜色和顶空挥发性成分与牛乳对照。结果是配方的黏度接近牛乳,并与牛乳共有部分挥发物,但感官评价仍能把它与牛乳区分开,描述里出现了香草、焦糖、涩、苦、金属和坚果味。回归模型没有失职,它预测的是仪器指标,人的感受要由另一个岗位判断,植物奶在蛋白、稳定性与风味之间的取舍也因此难以只靠仪器数据解决。同年《npj Science of Food》上的生成式 AI 汉堡研究,同样靠 101 名参与者的盲测检验生成的配方。
给班组加的一条纪律
本站说到的纵横国际模型,指的正是这样一组各司其职的模型;食品配方大模型可以是其中负责统筹与生成的一员,却不是全部。食品研发AI与通用聊天助手的差别,也不在参数量,而在每个数字有没有出处、每个排序有没有被验证过。如果只能加一条纪律,最有用的可能是在每一轮实验里留出两三个“反对票”位置:专门挑模型最不看好的配方也做一次。模型的偏见不会自己暴露,它只会在你从不检验的地方安静地错下去。