假设有一款豌豆蛋白,在五张表里有五种写法:营养表叫“豌豆蛋白分离物”,采购单写“PP80 第三批”,感官记录只有一句“豆味重”,碳排数据库里是一条“豌豆蛋白(通用)”,成本表按“元/公斤”给了三个月前的报价。以上为举例。模型如果不知道这五行指的是同一批东西,再强的算法也只能在错位的数据上找规律。纵横国际大模型这类 Food AI 系统要先解决的,常常不是算法,而是这五张表怎样连起来。

数据层里放什么

连接方式可以画成一条线:原料(Ingredient)、营养(Nutrition)、感官(Sensory)、生命周期评价(LCA)和成本(Cost)五类数据,汇入食品数据层(Food Data Layer),再供各类模型调用,最终产出候选配方(Candidate Formula)。数据层自己不训练任何模型,只做三件事:把同一个对象对齐到同一个编号,让每个数值带上来源和基准,把不确定性一并存起来。2026 年 7 月的食品配方生成科学综述(arXiv 2607.09529)把数据分散和缺少标准化的感官基准列为主要难点,恰好对应数据层最费力的两块。

原料:同名不同物,同物不同批

“豌豆蛋白”可能是蛋白含量 80% 以上的分离蛋白,也可能是蛋白含量只有五成上下的浓缩蛋白或粗提粉。名字相同,性质和价格可以差出一大截,所以原料要有唯一编号,加上作物来源、加工方式、规格和批次,名称只算别名。批次的问题更隐蔽:同一家供应商的两批货,豆腥味也可能不同。2026 年一项机器学习研究用表面疏水性、Zeta 电位、持水力、β-折叠含量等可测特征预测植物蛋白的溶解性、乳化能力和凝胶强度,思路就是让批次层面的可测特征,而不是原料的名字,去承载功能信息。如果还有蛋白质组学(Proteomics)和代谢组学(Metabolomics)数据,“这一批豆腥重”就能落到具体的蛋白组成和挥发物差异上,例如己醛、1-辛烯-3-醇这类常与豆腥联系在一起的成分,发酵与AI怎样参与豆腥味优化可以接着读。

营养与成本:基准决定谁更便宜

假设 A 粉蛋白含量 80%,每公斤 20 元;B 粉蛋白含量 50%,每公斤 14 元(示意数字)。按每公斤原料算,B 更便宜;按每公斤蛋白算,A 是 25 元,B 是 28 元,A 反而更划算。营养数据同理:每 100 g、每份、干基还是湿基,蛋白是由总氮乘以换算系数得到还是单独测定,都会移动数字。成本还有保质期:报价带日期和起订量,半年后价格一变,帕累托前沿的形状也会悄悄变化,所以每个成本都要带日期,超期就降低权重。

碳排:边界不同,数字不能放进同一个目标

生命周期评价(Life Cycle Assessment,LCA)的结果取决于系统边界:只算到农场大门,还是含加工、干燥、包装与运输;副产物的环境负担按质量分配,还是按经济价值分配;是否计入土地利用变化。两个来源各自没错,放在一起比较却没有意义。2026 年《npj Science of Food》的生成式 AI 汉堡研究把营养和环境指标当作设计目标,而不是事后评价,这要求环境数据在生成阶段就能被调用,也就要求边界统一。同年 Frontiers in Nutrition 上有研究对几国膳食指南做营养、温室气体与成本的多目标优化,也用帕累托前沿表达取舍,三类数据同样得站在同一基准上。

感官:最缺尺子的一栏

感官数据是五类里最不标准的。有的用 9 点喜好量表,有的用 100 mm 线段量表;有的来自受过训练的描述分析小组,有的来自随机招募的消费者;有的对照了参照样品,有的没有。把这些分数直接平均,得到的是量表差异,而不是配方差异。数据层至少要保留量表类型、评价员类型、样品编码和参照样品,并优先使用相对参照样品的差值。植物奶机器学习研究里,黏度与部分挥发物接近牛乳的配方,感官上仍带着涩、苦和金属味,所以感官这一栏不能由仪器栏替代。

知识图谱、RAG 与不确定性

对齐之后,可以把关系存成知识图谱:节点是原料、批次、成分、工艺步骤和感官描述词,边是“含有”“经过”“测量于”“导致”。这样才能问出配方研发真正关心的问题,比如“哪些配方用过己醛偏高的批次,并且豆腥评分高于参照样品”。LLM 通过检索增强生成(RAG)在图谱和文献里取回证据,再用自然语言回答,并附上数据来源。公开资源如 USDA FoodData Central、FlavorDB、FooDB、Recipe1M+ 和 Volatile Compounds in Food 数据库,分别覆盖营养、风味分子、食品成分、食谱和挥发性成分,可以提供骨架,但没有哪一个包含企业自己的成本、LCA 与感官数据。这些字段落到使用端,就是读一条配方时看到的营养、成本和碳排估算

每个数字还应带上不确定性。假设两个候选配方的估算碳排相差 4%,而所用 LCA 数据本身的不确定度约为 ±20%(示意),这 4% 就不该决定取舍。模型要把区间一路传递到候选配方的输出:碳排给区间,成本给日期,感官给置信度。这里有个反直觉之处:只有一个数字的通用条目,看起来比带区间的实测条目更“确定”,实际正好相反。

从哪里开始补

对想自己动手的团队,最小的起点是在现有原料表里先加三列:基准、日期、不确定度。更难补齐的是感官这把尺子:如果多家实验室愿意用同一套参照样品和量表来评价,模型才第一次有了共同的标尺。