近红外光谱结合机器学习对白酒的溯源分析

杜艳红1,2,胡春红2,谭昊2,李斯迈2,陈思佳2,李晓2,郭磊2,王胜洁2,徐岩1*,唐柯1*

1(江南大学 生物工程学院,江苏 无锡,214122)2(北京红星股份有限公司,北京,101400)

摘 要 以2025年国家级品酒师培训酒样为实验对象,采用气相色谱、近红外光谱技术结合机器学习解析不同香型、产地和质量等级白酒差异风味物质以及构建其判别模型。结果表明,偏最小判别分析可有效区分不同类别白酒风味物质特征。以VIP值>1,P<0.05为标准,确定对不同香型白酒有重要区分贡献的为β-苯乙醇、正丁醇、乙缩醛等21种,对不同产地酱香型白酒有重要区分贡献的为棕榈酸乙酯、β-苯乙醇、油酸乙酯等27种,对2个品类清香型白酒不同质量等级有重要区分贡献的为异丁醇、β-苯乙醇和丁二酸二乙酯等21种和正戊醇、甲醇和异丁醛等14种挥发性风味物质。相较于随机森林、支持向量机和遗传算法优化的反向传播神经网络(genetic algorithm-optimized backpropagation neural network,GA-BP)模型对于不同香型、产地和质量等级白酒的判别性能表现优异,对测试集样品分类准确率分别为91.33%、94.38%、98.28%和94.83%。夏普利加性解释(Shapley additive explanations,SHAP)解释结果显示,波数为11 996、7 383、5 952,7 128、5 848、5 311,6 935、6 932、5 319,11 996、5 902、5 824 cm-1等对于模型输出的贡献值较高,被确定是预测不同类别白酒的关键光谱点。此项研究提出的近红外光谱结合GA-BP模型对不同类别白酒判别具有较高的准确率,为白酒的快速溯源和不同类别白酒的科学评价提供理论参考。

关键词 近红外光谱;气相色谱;机器学习;香型;产地;质量等级

中国白酒是世界六大蒸馏酒之一,以粮谷为主要原料,以大曲、小曲、麸曲、酶制剂及酵母等为糖化发酵剂,经蒸煮、糖化、发酵、蒸馏、陈酿、勾调而成的蒸馏酒[1]。2025年上半年白酒产量191.59万千升,销售收入3 304.2亿元,在食品市场中占据重要地位。根据独特的原料、工艺和风味特点,白酒被划分为12种香型,包括酱香型、浓香型、清香型和米香型等[2]。独特的气候、水源、土壤、温度、湿度等自然生态和微生物群落组成的微生态构成了不同产区,如汾阳、仁怀、宜宾、泸州和宿迁等[3]。工艺控制、基酒质量以及酒体设计等形成了酒体的不同质量等级[4]。香型、产地和质量等级对白酒市场价值影响显著,而传统的鉴别方法主要依靠品酒师的行业经验,存在效率低和标准化困难等问题,因此,需要客观、科学、准确、高效的鉴别技术。

为了突破传统感官评估的局限性,科研人员利用先进的仪器与统计学手段对不同香型、产地和质量等级的白酒样品进行判别分析研究。其中,Wang等[5]利用气相质谱技术测定白酒中非挥发性有机酸含量以区分不同香型。卓俊纳[6]基于气相色谱-四极杆飞行时间质谱联用技术对3种香型白酒(浓香型、酱香型、小曲清香型)进行判别研究。吴李玲等[7]采用全二维气相色谱-氮化学发光检测联用技术,测定酱香型白酒中25种含氮化合物含量,并利用OPLS-DA模型对贵州、湖南、广西、黑龙江、中北部(北京、天津、山东)酒样进行产地判别。夏于林等[8]通过测定宜宾和泸州两地白酒中的15种元素及乙醇碳同位素,结合极限梯度提升、决策树和随机森林模型分析,实现了对产地分类的100%准确预测。Li等[9]通过系统分析酱香型白酒的风味物质组成及入窖酒醅理化指标,并结合11种机器学习模型构建基酒质量等级预测体系,发现梯度提升和线性回归模型预测性能最优。特征重要性分析进一步揭示异丁醛、乳酸乙酯、乙缩醛、异丁醇及还原糖为影响基酒品质的五大关键特征因子。上述研究为白酒香型、产地以及等级的判别分析提供了多元化的解决方案。

近红外光谱技术由于其快速、高效、低成本以及无损等特点成为新型分析及鉴定技术,被众多知名酒企广泛应用于相关指标的定性和定量分析[10-11]。同时,机器学习如遗传算法优化的反向传播神经网络(genetic algorithm-optimized backpropagation neural network,GA-BP)、逻辑回归、支持向量机(support vector machine,SVM)、决策树、随机森林(random forest,RF)、多层感知器和梯度增强等在白酒等级判定、典型体识别、关键香气化合物以及核心微生物预测方面展示出高效的准确率[12-13]。因此,本研究利用近红外光谱结合3种机器学习算法(SVM、RF和GA-BP)对白酒香型、产地以及质量等级进行精准识别与预测,以期为白酒的快速溯源提供理论参考。

1 材料与方法

1.1 材料与试剂

本研究采用的酒样为北京红星股份有限公司提供的中国酒业协会2025年国家级品酒师质量等级差异培训酒样。其中,香型研究包含红星、汾酒、江津、牛栏山、洋河、五粮液、泸州老窖、茅台、郎酒、习酒、口子窖、白云边、景芝、扳倒井、九江、董酒、天龙泉、西凤酒、四特酒、酒鬼酒、衡水老白干为代表的12种香型,并忽略等级等因素的影响共105个样品;产地研究包含茅台酒、郎酒和习酒为代表的仁怀、古蔺、习水3个酱香型白酒核心产地,共15个样品;质量等级研究包含以汾酒和牛栏山为代表的清香型1~5档质量等级酒,共10个样品。

甲醇、仲丁醇、正丙醇、异丁醇、正丁醇、2-甲基-1-丁醇、异戊醇、戊醇、己醇、左旋-2,3-丁二醇、内消旋-2,3-丁二醇、1,2-丙二醇、糠醇、β-苯乙醇、乙醛、异丁醛、乙缩醛、异戊醛、糠醛、乙酸、丙酸、异丁酸、丁酸、异戊酸、戊酸、己酸、辛酸、甲酸乙酯、乙酸乙酯、丁酸乙酯、乙酸异戊酯、己酸乙酯、乳酸乙酯、辛酸乙酯、癸酸乙酯、琥珀酸二乙酯、月桂酸乙酯、棕榈酸乙酯、油酸乙酯、亚油酸乙酯、丙酮、2-戊酮、3-羟基-2-丁酮、叔戊醇、乙酸正戊酯、2-乙基丁酸,色谱纯,上海麦克林生化科技有限公司。

1.2 仪器与设备

2010ProAF气相色谱仪,日本岛津公司;MPAⅠ型近红外光谱仪,美国Bruker公司。

1.3 实验方法

1.3.1 挥发性风味物质检测

取白酒样品10 mL加入100 μL混合内标,混匀后取1.5 mL注入进样小瓶。混合内标为叔戊醇、乙酸正戊酯、2-乙基丁酸。

色谱柱:DB-WAXUI毛细管柱(30 m×0.25 mm,0.5 μm);升温程序:35 ℃保持4 min,以5 ℃/min的速率升至100 ℃,再以10 ℃/min速率升至230 ℃,并保持13 min;载气(He)流速1.0 mL/min,进样量0.5 μL;分流比30∶1[14]

1.3.2 不同类别白酒样品近红外光谱采集

样品经玻璃棒匀速搅拌后均质分装,不经前处理直接扫描以保留原始基质信息。光谱采集以空气为背景校正,参数设置为分辨率16 cm-1、扫描间隔8 cm-1,每个样品重复测量32次,共获得2 074个扫描值。近红外光谱采集时环境温度控制为(20±2) ℃,空气相对湿度<80%[15]

1.3.3 样本检查与分组

利用主成分分析(principal components analysis,PCA)检查光谱数据,剔除95%置信区间之外的样本点,并将剩余样品点按7∶3划分训练集和测试集[16]

1.3.4 分类模型的建立

基于GA-BP、SVM和RF算法构建白酒香型、产地和质量等级的判别模型,并对三者的预测性能进行对比分析。在特征选择阶段,引入自适应L1正则化技术以自动筛选最具判别性的特征子集。为增强模型泛化能力,系统整合L2权重衰减与Dropout双重正则化机制,有效抑制过拟合现象。模型优化方面,采用贝叶斯优化算法进行超参数自动搜索,该方法通过构建高斯过程代理模型,高效探索学习率、L2正则化系数、Dropout概率及训练周期等关键参数的最优组合空间。性能评估阶段,构建多维度评价体系,包括准确率、精确率、召回率、F1和AUC等指标,全面量化模型分类效能。为提升模型可解释性,本研究应用夏普利加性解释(Shapley additive explanations,SHAP)值分析方法,通过计算特征对预测结果的边际贡献,定量揭示各特征变量的全局重要性排序[17]

1.3.5 PLS回归模型的建立与优化

在4 000~12 000 cm-1波段范围内,以近红外光谱各波数上的吸光度值为自变量,等级数据作为响应值,采用10折交叉验证方式建立PLS回归模型,考察模型交叉验证决定系数(determination coefficient of 交叉验证均方根误差(root mean square error of cross-validation,RMSECV)。由于白酒样品原始光谱数据存在高维度、强相关性和包含的冗余信息多等问题,会增加模型复杂度和降低模型预测性能。因此,为提升模型预测精度与稳健性,本研究采用间隔偏最小二乘(interval PLS,iPLS)、无信息变量消除(uninformative variable elimination,UVE)、蒙特卡罗-无信息变量消除(Monte Carlo-uninformative variable elimination,MC-UVE)以及竞争自适应重加权采样(competitive adaptive reweighted sampling,CARS)方法进行特征波段筛选[18-19]。同时,为消除物理与化学干扰因素,采用多重预处理如一阶导数(first derivative,FD)、多元散射校正(multiplicative scatter correction,MSC),矢量归一化(vector normalization,VN)、标准正态变量变化(standard normal variate transformation,SNV)、去趋势(detrend)及其组合策略等[20-21]。选取最佳模型(最高的和最低的RMSECV)开展预测测试集样本等级,并与实际值相比对,考察预测模型相关系数R2、预测标准偏差(standard error of prediction,SEP)以及测试集样品实际测量值标准差与SEP的比值(ratio of standard deviation of the validation set to standard error of prediction,RPD)[22]

1.4 数据处理

使用Excel 2016进行数据处理;使用SIMCA 16.0进行PCA;使用OPUS 8.5进行近红外光谱图扫描;利用Matlab 2024a建立GA-BP、SVM和RF分类模型。

2 结果与分析

2.1 不同香型、产地和质量等级白酒风味物质差异分析

利用气相色谱技术对不同香型、产地和质量等级白酒进行风味成分分析,结果见图1。在12种香型样品中共检测出49种化合物,包括15种醇类、5种醛类、9种酸类、17种酯类和3种酮类;在仁怀、古蔺和习水三个酱香型白酒核心产区样品中共检测出46种化合物,包括15种醇类、5种醛类、8种酸类、16种酯类和2种酮类;1~5等级汾酒中共检测出42种化合物,包括14种醇类、5种醛类、8种酸类、13种酯类和2种酮类;1~5等级牛栏山白酒中共检测出41种化合物,包括14种醇类、5种醛类、6种酸类、13种酯类和3种酮类。为进一步比较各风味物质含量在不同香型、产地和质量等级白酒之间的差异,对测定的醇类、醛类、酸类、酯类、酮类物质含量进行PLS-DA。由图1-a~图1-d可知,PLS-DA模型可将不同香型、产地、汾酒质量等级和牛栏山质量等级白酒有效区分,分别为分别为0.846、0.972、0.983、0.998;Q2分别为0.703、0.873、0.918、0.996。由图1-e~图1-h可知,模型经过200次置换验证,Q2回归线截距为负值且斜率为正值,说明模型无过拟合现象,可用于不同类别白酒风味物质差异剖析[23]。变量重要因子(variable importance for the projection,VIP)表征了分类过程中各个变量的重要性,通常VIP值>1的变量在不同样本之间的区分中起重要作用[24]。由图1-i~图1-l可知,通过VIP值筛选出不同香型白酒样品中21个差异标记物包括β-苯乙醇、正丁醇和乙缩醛等;不同产地酱香型白酒样品中27个差异标记物,包括棕榈酸乙酯、β-苯乙醇和油酸乙酯等;不同等级汾酒样品中21个差异标记物包括异丁醇、β-苯乙醇和丁二酸二乙酯等;不同等级牛栏山白酒样品中14个差异标记物包括正戊醇、甲醇和异丁醛等。

a-不同香型白酒样品PLS-DA得分图;b-不同产地酱香型白酒样品PLS-DA得分图;c-汾酒不同等级样品PLS-DA得分图;d-牛栏山不同等级样品PLS-DA得分图;e-香型分类200次置换检验;f-产地分类200次置换检验;g-汾酒等级分类200次置换检验;h-牛栏山等级分类200 次置换检验;i-香型分类VIP值分布;j-产地分类VIP值分布;k-汾酒等级分类VIP值分布;l-牛栏山等级分类VIP值分布

图1 不同类别白酒风味差异物质筛选

Fig.1 Screening of flavor difference substances in different types of Baijiu

2.2 不同类别白酒样品近红外光谱扫描

12种香型白酒共105个样品,每个样品制备5组样本;酱香型白酒3个核心产地共15个样品,每个样品制备20组样本;不同等级汾酒共5个样品,每个样品制备40组样本;不同等级牛栏山白酒共5个样品,每个样品制备40组样本。不同香型、不同产地、不同等级汾酒和不同等级牛栏山白酒总样本数分别为525、300、200和200。使用固体探头采集到1 225张不同类别白酒在12 000~4 000 cm-1波数范围内的近红外原始光谱,结果如图2所示。样品在8 443、6 862、5 901、5 700、5 670、5 180、4 408、4 339、4 250 cm-1等附近呈现明显的吸收带,包含了大量的基团吸收信息。其中,8 443 cm-1附近主要对应O—H键的二级倍频吸收,反映醇类或水分子的伸缩振动;6 862、5 901 cm-1附近归属于C—H键的一级倍频(如甲基、亚甲基的伸缩振动),常见于乙醇及有机酸酯类化合物;5 700、5 670 cm-1可能与CO键的合频振动相关,提示羧酸或酯类物质的存在;5 180 cm-1 通常为O—H键的伸缩与弯曲振动的合频,进一步印证羟基化合物的贡献;4 408和4 339 cm-1 分别对应C—H键的变形振动及C—C骨架振动,与有机分子的骨架结构相关;4 250 cm-1涉及N—H键的伸缩振动(如氨基酸或含氮化合物)。这些特征峰共同反映了白酒中醇类、有机酸、酯类及含氮化合物的复杂相互作用,为近红外光谱技术用于白酒品质分析提供了理论基础[25-27]。虽然各样品光谱图的趋势基本一致,但吸光值的大小有明显区别,表明所含的化学成分种类相似,但含量有差异。在白酒样品的近红外光谱分析中,由于不同类别白酒的化学成分存在部分重叠,其光谱图往往表现出较高的相似性,难以直接区分其细微差异。为解决这一问题,近红外光谱技术需与化学计量学方法相结合,并通过多元统计分析手段对光谱数据进行降维、特征提取和模式识别。

图2 不同类别白酒样品近红外原始谱图

Fig.2 Raw near infrared spectra of different types of Baijiu samples

2.3 不同香型白酒分类模型的建立

SVM、RF和GA-BP算法模型对白酒香型预测分析结果如图3所示。由图3-a可知,利用PCA剔除95%置信区间之外的15个样本点,即361、362、363、364、365、366、367、368、369、370、371、372、373、374、375。因老白干香型样本存在显著光谱异常,可能影响模型泛化能力,故在后续判别分析中予以排除。剔除异常光谱后将所有样本按7∶3分组,训练集350个,预测集150个。将1 2000~4 000 cm-1区段对应的特征光谱作为模型的输入向量,对应的输出为11种香型,数据集为500×2 074维矩阵。其中,定义每组光谱数据的实际值和预测值输出结果均为“1~11”,当模型的预测输出和实际输出重合时,可以认为分类结果正确。由图3-b可知,相较于RF和SVM预测模型,GA-BP模型的预测性能有一定的提升。GA-BP模型通过L1正则化从2 074个光谱点中筛选出35个重要光谱特征点,有效剔除冗余特征,提升模型泛化能力。通过贝叶斯优化算法确定了神经网络的最优超参数组合:隐藏层节点数31、学习率0.021 5、训练周期125次迭代、L2正则化系数为0.008 0、Dropout率为0.27。通过实验验证采用的模型隐藏层为31层,特征光谱点为35个,被分类的白酒香型为11种,最终网络结构确定为35-31-11。由图3-c可知,GA-BP模型通过迭代训练使神经网络达到收敛状态后,对测试集样品的预测分类准确率为91.33%。同时,为了进一步增加模型的透明度并明确特征的重要性,本研究采用了基于SHAP的特征解释方法,计算每个样本在各特征光谱点的Shapley值,并以此来评估特征对模型预测结果的整体贡献。由图3-d可知,在35个特征光谱中,波数为11 996、7 383、5 952、5 207、4 451、4 447、4 444、4 440、4 436、4 432、4 428、4 282、4 266、4 258、4 255、4 251、4 031、4 019 cm-1等在样品的SHAP贡献值排名前5,被确定是鉴别香型模型中关键光谱点。

a-PCA;b-性能评估对比;c-GA-BP测试集混淆矩阵;d-SHAP值

图3 机器学习对白酒香型的鉴别

Fig.3 Identification of aroma types of Baijiu by machine learning

a-PCA;b-性能评估对比;c-GA-BP测试集混淆矩阵;d-SHAP值

图4 机器学习对酱香型不同产地白酒的鉴别分析

Fig.4 Machine learning analysis of Jiangxiangxing Baijiu from different origins

2.4 酱香型白酒不同产地分类模型的建立

酱香型白酒整体的工艺特点可概括为“12987”,即生产周期1年、2次投料、9次蒸煮、8次发酵和7次取酒,鉴于酱香型白酒工艺的复杂性以及消费者尤为关注酱香型白酒的产地,选择酱香型白酒样品作为产地研究的实验对象[28]。SVM、RF和GA-BP算法模型对酱香型白酒不同产地的预测分析结果如图4所示。由图4-a可知,利用PCA剔除95%置信区间之外的3个样本点,即208、209和210。剔除异常光谱后将所有样本按7∶3分组,训练集208个,预测集89个。由图4-b可知,所构建的GA-BP模型在预测性能上强于RF和SVM。GA-BP模型通过L1正则化从2 074个光谱点中筛选出54个重要光谱特征点,隐藏层数为27,被分类的酱香型白酒产地为3个,最终网络结构被确定为54-27-3。由图4-c可知,GA-BP模型对测试集样品进行预测分类,准确率达94.38%。由图4-d可知,在54个特征光谱中,波数为7 182、5 848、5 311、5 308、4 474、4 420、4 417、4 374、4 370、4 363 cm-1 等在样品的SHAP贡献值排名前5,被确定是鉴别酱香型不同产地白酒模型的关键光谱点。

2.5 不同质量等级预测模型的建立

2.5.1 汾酒质量等级预测模型的建立

SVM、RF和GA-BP算法模型对汾酒等级预测分析结果如图5所示。由图5-a可知,通过PCA剔除95%置信区间之外的4个样本点,即77、78、79、80。由图5-b可知,GA-BP分类模型相较于SVM和RF模型,性能表现更为优异,对测试集样品的预测准确率达98.28%,召回率、F1值以及AUC分别为98.67%、98.26%和0.99。GA-BP模型通过L1正则化筛选出34个重要光谱特征点,隐藏层数为19,最终网络结构确定为34-19-5。由图5-c混淆矩阵可知,测试集中仅有1个五等酒样品被错误分类成四等酒。由图5-d可知,在33个特征光谱中,波数为6 935、6 932、5 319、5 119、4 444、4 440、4 382、4 374、4 370、4 282、4 235 cm-1在不同等级汾酒的SHAP贡献值排名前5,被确定是预测模型中关键光谱点。其中,4 370 cm-1处的吸收峰对一等酒、四等酒和五等酒的区分贡献值均为最高,SHAP值分别为0.169 8、0.135 0、0.151 4。同时,6 935、6 932 cm-1,5 119 cm-1,4 235 cm-1处的吸收峰分别对一等酒,二等酒和三等酒的区分具有特异性贡献。

a-PCA;b-模型性能评估对比;c-GA-BP测试集混淆矩阵;d-SHAP值

图5 机器学习对汾酒等级的预测

Fig.5 Prediction of Fen Baijiu grade by machine learning

在12 000~4 000 cm-1全谱区中建立PLS回归模型对汾酒等级进行预测,结果如图6所示。由图6可知,PLS回归模型对等级的预测能力良好,和EMSRCV分别为81.53%和0.627 7。同时,采用4种波段选择和9种预处理的方法提高模型预测精度与稳健性。训练集预测模型优化结果见表1。由表1可知,PLS模型通过多数波段选择和预处理后,预测准确性和模型复杂度均有所优化。其中,经“iPLS、UVE、MC-UVE和CARS”波段选择后,模型分别提升12.58%、4.40%、1.99%和2.49%;RMSECV分别下降33.32%、10.21%、4.46%和5.64%;经“MSC、VN、SVN和Detrend”预处理后,模型分别提升1.51%、0.18%、1.51%和0.01%;RMSECV分别下降3.38%、0.38%、3.38%和0.02%。因此,将“iPLS和SVN”作为最优的波段选择与预处理方法,应用于汾酒等级预测模型优化中。

表1 PLS模型优化结果

Table 1 PLS model optimization results

模型优化RMSECV变化R2变化波长选择iPLS0.418 5-33.32%91.79%12.58%UVE0.563 5-10.21%85.12%4.40%MC-UVE0.599 6-4.46%83.15%1.99%CARS0.592 2-5.64%83.56%2.49%预处理FD0.677 2 7.90%78.50%-3.72% MSC0.606 4-3.38%82.76%1.51%VN0.625 2-0.38%81.68%0.18%SVN0.606 4-3.38%82.76%1.51%Detrend0.627 5-0.02%81.54%0.01%SVN+Detrend0.628 00.06%81.52%-0.01%FD+MSC0.677 98.01%78.46%-3.77%FD+SVN0.677 98.01%78.46%-3.77%FD+VN0.677 88.00%78.47%-3.75%

图6 训练集中汾酒等级的PLS预测模型

Fig.6 PLS prediction model of Fen Baijiu grade in training set

以优化后PLS回归模型对测试集样品中白酒等级进行验证,评估模型泛化能力。以R2反映近红外光谱预测值与实测值数据之间的相关程度,以SEP表征近红外预测结果与实测结果差异的标准差,以RPD体现近红外定量模型的准确性;R2越接近1,SEP越接近0,RPD越高,准确度越高。由图7可知,PLS模型预测结果中相关系数R2较高,为0.909 1;SEP较小,为0.393 8,表明所建立的模型具有良好的可靠性和可行性。RPD为3.330 9表示模型预测能力优秀,可近似定量预测,用于样品等级判断。

图7 优化后PLS模型对测试集中白酒等级预测结果

Fig.7 Prediction results of the optimal PLS model on Baijiu grade in the test set

2.5.2 牛栏山白酒质量等级预测模型的建立

由图8-a可知,通过PCA剔除95%置信区间之外的2个样本点,即151和181。由图8-b可知,GA-BP分类模型相较于SVM和RF模型,性能表现更为优异,对测试集样品的预测准确率达94.92%,召回率、F1值以及AUC分别为94.83%、94.79%和0.99。GA-BP模型通过L1正则化筛选出34个重要光谱特征点,隐藏层数为20,网络结构确定为34-20-5。由图8-c混淆矩阵可知,GA-BP模型在牛栏山白酒等级分类中存在以下误判情况:1个二等酒样本被误分类为三等酒,1个三等酒样本被误判为二等酒,以及1个五等酒样本被错误归类为二等酒。由图8-d可知,在34个特征光谱中,波数为11 996、5 902、5 824、5 821、5 770、5 304、5 088、5 057、4 432、4 386、4 378、4 370 cm-1在牛栏山不同等级白酒的SHAP贡献值排名前5,被确定是等级预测模型中关键光谱点。其中,5 824 cm-1特征峰在一等酒判别中贡献度最高(SHAP=0.743 8),表明其具有关键区分作用;5 304 cm-1峰对四等酒(SHAP=0.253 0)和五等酒(SHAP=0.394 1)的区分贡献呈现梯度差异;4 386 cm-1峰对二等酒(SHAP=0.428 9)与三等酒(SHAP=0.497 7)的判别贡献相近,但后者略高。5 824、5 821、5 770 cm-1,5 092 cm-1,4 378 cm-1,5 902 cm-1,11 996 cm-1处的吸收峰分别对一等酒,二等酒,三等酒,四等酒和五等酒的区分具有特异性贡献。

a-PCA;b-模型性能评估对比;c-GA-BP测试集混淆矩阵;d-SHAP值

图8 机器学习对牛栏山白酒等级的预测

Fig.8 Prediction of Niulanshan Baijiu grade by machine learning

由图9可知,PLS对牛栏山白酒等级预测模型中和EMSRCV分别为89.31%和0.476 3。由表2可知,PLS模型通过“iPLS、UVE、MC-UVE和CARS”波段选择后,模型分别提升6.34%、8.61%、8.87%和9.82%;RMSECV分别下降31.40%、46.98%、49.13%和57.62%;经“VN”预处理后,模型提升1.37%;RMSECV下降5.89%。因此,将“CARS和VN”作为最优的波段选择与预处理方法,应用于牛栏山白酒等级预测模型优化中。

表2 PLS模型优化结果

Table 2 PLS model optimization results

模型优化RMSECV变化R2变化波长选择iPLS0.326 8-31.40%94.97% 6.34%UVE0.252 5-46.98%96.99%8.61%MC-UVE0.242 3-49.13%97.23%8.87%CARS0.201 9-57.62%98.08%9.82%预处理FD0.937 7 96.86%58.57%-34.42%MSC0.606 827.40%82.65%-7.46%VN0.448 2-5.89%90.53%1.37%SVN0.606 827.40%82.65%-7.46%Detrend0.645 635.53%80.36%-10.02%SVN+Detrend0.647 135.86%80.27%-10.12%FD+MSC0.986 8107.16%54.12%-39.40%FD+SVN0.988 9107.61%53.92%-39.62%FD+VN0.993 7108.62%53.47%-40.12%

图9 训练集中白酒等级的PLS预测模型

Fig.9 PLS prediction model of Baijiu grade in training set

图10 优化后PLS模型对测试集中白酒等级预测结果

Fig.10 Prediction results of the optimal PLS model on Baijiu grade in the test set

采用优化后的PLS回归模型对测试集白酒样品进行等级验证,通过三项核心指标系统评估模型的泛化能力。结果表明:模型的决定系数(R2)达到0.944 7,表明近红外光谱预测值与实测值之间具有高度线性相关性;SEP为0.296 2,反映预测结果与实测值之间的离散程度较小;RPD达4.432 8,表明模型具备优秀的定量预测能力。

3 结论与讨论

本研究采用气相色谱、近红外光谱技术结合机器学习解析不同香型、产地和质量等级白酒风味差异物质以及构建其判别模型。结果表明,PLS-DA可将不同类别白酒进行有效区分,通过VIP值分别筛选出21、27、21和14种风味差异物质。相较于RF和SVM,GA-BP模型对于不同类别白酒的判别性能表现优异,网络结构被分别确定为35-31-11、54-27-3、34-19-5和34-20-5。GA-BP神经网络模型对白酒香型的预测准确率最高为91.33%,低于王允中等[29]和朱开宪等[30]基于GC、GC-MS结合线性判别分析能力(100%)。预测能力的下降主要源于样本的广泛性与融合香型的双重影响。GA-BP神经网络模型能够对仁怀产区样本实现准确识别,而同属赤水河上游的古蔺与习水产区样本存在相互误判现象,这表明两者相似度显著高于仁怀产区,该结果与向玲等[31]的研究结论相一致。同时,GA-BP模型对白酒质量等级判别能力(98.28%和94.83%),略高于Zhou等[32]提出的极端梯度提升模型(94.24%),其优势主要体现在非线性关系的捕捉能力上。然而,与Su等[33]采用酚类物质与傅里叶变换红外光谱融合数据的葡萄酒产地鉴别模型相比,本研究使用单一快速检测技术所获得的数据在白酒类别信息表征方面存在局限性,后续需要整合GC-MS、GC-IMS、电子鼻和电子舌等风味组学数据以构建融合模型,从而提升判别准确率。近红外光谱结合GA-BP神经网络模型具有绿色、快速和无损的优点,对白酒香型、产地和质量等级的识别和预测准确率均超过90%,能够有效解决白酒类别判断过程中存在的经验依赖以及标准化等难题,为白酒的快速溯源和质量等级评价提供了新思路与技术支撑。

参考文献

[1] Zheng X W, Han B Z.Baijiu, Chinese liquor:History, classification and manufacture[J].Journal of Ethnic Foods, 2016, 3(1):19-25.

[2] 魏泉增, 范江涛, 刘嘉玲, 等.偏最小二乘方法在不同白酒香型判别分析中的应用[J].中国酿造, 2020, 39(10):183-187.Wei Q Z, Fan J T, Liu J L, et al.Application of partial least squares in different flavor types of Baijiu discriminant analysis[J].Chinese Brewing, 2020, 39(10):183-187.

[3] Wang W, Chen J Q, Chen J S, et al.Spatial distribution of Chinese baijiu driven by groundwater recharge processes:Insights from hydrochemical analysis[J].Groundwater for Sustainable Development, 2025, 31:101513.

[4] 王怡博, 庹先国, 张贵宇, 等.近红外光谱结合改进的排列组合总体分析方法鉴别浓香型白酒基酒等级[J].食品工业科技, 2026,47(2):347-355.Wang Y B, Tuo X G, Zhang G Y, et al.Near-infrared spectroscopy combined with improved permutation combination population analysis for identifying base liquor grades of Nongxiangxing Baijiu[J].Science and Technology of Food Industry, 2026,47(2):347-355.

[5] Wang G N, Song X B, Zhu L, et al.A flavoromics strategy for the differentiation of different types of Baijiu according to the non-volatile organic acids[J].Food Chemistry, 2022, 374:131641.

[6] 卓俊纳. 三种香型白酒的ICP-OES和GC-QTOF MS分析及判别研究[D].宜宾:四川轻化工大学, 2022.Zhuo J N.Analysis and discrimination research by ICPOES and GC-QTOF MS of three kinds of flavor Baijiu[D].Yibin:Sichuan University of Science and Engineering, 2022.

[7] 吴李玲, 裴荣红, 李行, 等.不同产地酱香型白酒中挥发性含氮化合物的差异分析[J].食品科学技术学报, 2024, 42(3):35-48.Wu L L, Pei R H, Li X, et al.Difference analysis of volatile nitroge-containing compounds in soy sauce flavor-type baijiu from different regions in China[J].Journal of Food Science and Technology, 2024, 42(3):35-48.

[8] 夏于林, 尹希杰, 薛康, 等.电感耦合等离子体质谱联合气相色谱-同位素比值质谱法鉴别白酒产地[J].化学分析计量, 2025, 34(5):55-60.Xia Y L, Yin X J, Xue K, et al.Origin identification of Baijiu based on ICP-MS and GC-IRMS[J].Chemical Analysis and Metrology, 2025, 34(5):55-60.

[9] Li S, Li T, Han Y R, et al.Machine learning discrimination and prediction of different quality grades of sauce-flavor baijiu based on biomarker and key flavor compounds screening[J].Food Chemistry:X, 2024, 24:101877.

[10] 王凡, 张文娟, 李国辉, 等.近红外光谱技术同时快速定量酱香型白酒基酒醇类物质[J].食品与发酵工业, 2025, 51(16):324-331.Wang F, Zhang W J, Li G H, et al.Simultaneous and rapid quantification of alcohols in Jiangxiangxing Baijiu base liquor by near-infrared spectroscopy[J].Food and Fermentation Industries, 2025, 51(16):324-331.

[11] 黄清霞, 付国勇, 陈黎萍.成品白酒中酸酯总量的近红外检测[J].食品工业科技, 2022, 43(5):310-314.Huang Q X, Fu G Y, Chen L P.Detection of acid ester content in Baijiu (Chinese liquor) based on near infrared spectroscopy[J].Science and Technology of Food Industry, 2022, 43(5):310-314.

[12] Yang L, Xian C, Li S, et al.Machine learning combined with GC-FID for discrimination of different categories of Maotai-flavor baijiu[J].Food Chemistry:X, 2025, 28:102555.

[13] Xie J, Hong J X, Zhang C S, et al.Machine learning-assisted identification of core flavor compounds and prediction of core microorganisms in fermentation grains and pit mud during the fermentation process of strong-flavor Baijiu[J].Food Chemistry, 2025, 495(2):146426.

[14] 杜艳红, 谭昊, 聂建光, 等.运用多工艺融合技术提升清香型白酒产品品质的研究[J].酿酒科技, 2022(10):65-70.Du Y H, Tan H, Nie J G, et al.Improvement of Qingxiang Baijiu quality by process fusion[J].Liquor-Making Science &Technology, 2022(10):65-70.

[15] Kasemsumran S, Boondaeng A, Ngowsuwan K, et al.Simultaneous monitoring of the evolution of chemical parameters in the fermentation process of pineapple fruit wine using the liquid probe for near-Infrared coupled with chemometrics[J].Foods, 2022, 11(3):377.

[16] Zhou Q, Huang W Q, Tian X.Feature wavelength selection based on the combination of image and spectrum for aflatoxin B1 concentration classification in single maize kernels[J].Agriculture, 2022, 12(3):385.

[17] 曹梦德, 王怡博, 张贵宇, 等.基于机器学习混合特征选择方法的近红外光谱检测浓香型白酒基酒等级[J].食品与发酵工业, 2025, 51(24):359-367.Cao M D, Wang Y B, Zhang G Y, et al.Detection of base liquor grade of Nongxiangxing Baijiu by near-infrared spectroscopy based on machine learning hybrid feature selection method[J].Food and Fermentation Industries, 2025, 51(24):359-367.

[18] Yu F H, Feng S, Du W, et al.A Study of nitrogen deficiency inversion in rice leaves based on the hyperspectral reflectance differential[J].Frontiers in Plant Science, 2020, 11:573272.

[19] Zhang L, Schultz M A, Cash R, et al.Determination of quality parameters of tomato paste using guided microwave spectroscopy[J].Food Control, 2014, 40:214-223.

[20] Ma L Y, Chen L, Chou K C, et al.Campylobacter jejuni antimicrobial resistance profiles and mechanisms determined using a raman spectroscopy-based metabolomic approach[J].Applied and Environmental Microbiology, 2021, 87(12):e00388-21.

[21] Wei L F, Zhang Y X, Yuan Z R, et al.Development of visible/near-infrared hyperspectral imaging for the prediction of total arsenic concentration in soil[J].Applied Sciences, 2020, 10(8):2941.

[22] 王凡, 陈鹏, 庞文虎, 等.衰减全反射傅里叶变换红外光谱快速定量酱香型白酒骨架成分[J].中国酿造, 2025, 44(10):281-288.Wang F, Chen P, Pang W H, et al.Rapid quantification of skeleton compounds of sauce-flavor Baijiu by attenuated total reflection Fourier transform infrared spectroscopy[J].China Brewing, 2025, 44(10):281-288.

[23] 何菲, 蒋洪久, 玉光惠, 等.不同香型白酒香味物质特征差异比较分析[J].酿酒科技, 2022(8):48-53;58.He F, Jiang H J, Yu G H, et al.Comparative analysis of aroma substance characteristics of baijiu of different flavor types[J].Liquor-Making Science &Technology, 2022(8):48-53;58.

[24] 先春, 陈仁远, 赵文武, 等.感官排序结合多元统计分析对酱香型白酒轮次基酒质量等级的研究[J].中国酿造, 2025, 44(8):170-175.Xian C, Chen R Y, Zhao W W, et al.Quality grade of round base liquor of sauce-flavor Baijiu by sensory ranking and multivariate statistical analysis[J].China Brewing, 2025, 44(8):170-175.

[25] 张磊, 庹先国, 张贵宇.基酒等级的近红外快速检测和基于SHAP的模型解释[J].中国酿造, 2025, 44(7):283-288.Zhang L, Tuo X G, Zhang G Y.Near infrared rapid detection of base liquor grades and model interpretation based on SHAP[J].China Brewing, 2025, 44(7):283-288.

[26] 夏珍珍, 张博源, 郑丹, 等.基于PLS与CNN的甘薯淀粉掺假鉴别及量化比较[J].食品科学, 2025, 46(20):327-336.Xia Z Z, Zhang B Y, Zheng D, et al.Identification and quantification of adulterated sweet potato starch based on PLS and CNN:A comparative study[J].Food Science, 2025, 46(20):327-336.

[27] 余松柏, 黄张君, 赵兴蓉, 等.红外光谱技术及其在白酒酿造过程中快速检测与分析的研究进展[J].分析测试学报, 2025, 44(3):544-561.Yu S B, Huang Z J, Zhao X R, et al.Research progress on infrared spectroscopy and its rapid detection and analysis in baijiu brewing[J].Journal of Instrumental Analysis, 2025, 44(3):544-561.

[28] 谢丹, 吴成, 赵雯宇, 等.酱香型白酒酒醅中产香白地霉的分离鉴定、特性解析及全基因组分析[J/OL].食品工业科技, 2025.DOI:10.13386/j.issn1002-0306.2025070261.Xie D, Wu C, Zhao W Y, et al.Isolation, identification and characteristic analysis of aroma-producing Geotrichum candidum from fermented grains of Jiangxiang Baijiu[J/OL].Science and Technology of Food Industry, 2025.DOI:10.13386/j.issn1002-0306.2025070261.

[29] 王允中, 罗安来, 王淑军.多元统计分析方法在白酒香型识别中的应用[J].食品安全导刊, 2021(9):118-122.Wang Y Z, Luo A L, Wang S J.Application of multivariate statistical analysis methods in baijiu aroma identification[J].China Food Safety Magazine, 2021(9):118-122.

[30] 朱开宪, 胡雪, 邓静, 等.基于GC-MS技术对不同香型白酒的判别分析[J].中国酿造, 2023, 42(1):213-218.Zhu K X, Hu X, Deng J, et al.Discriminant analysis of different flavor-type Baijiu based on GC-MS[J].China Brewing, 2023, 42(1):213-218.

[31] 向玲, 贾俊杰, 毛雪婷, 等.基于表面增强拉曼光谱技术对不同产地酱香型白酒的鉴别研究[J].分析测试学报, 2026,45(1):77-87.Xiang L, Jia J J, Mao X T, et al.Study on the identification of sauce-flavor Baijiu from different origins based on surface-enhanced Raman spectroscopy technology[J].Journal of Instrumental Analysis, 2026,45(1):77-87.

[32] Zhou C L, Yu Y S, Zhu Y W, et al.Machine learning discrimination of quality grades of base liquor integrating GC-TOF/MS and GC-IMS data analysis:Case study of strong-flavor Chinese baijiu[J].Food Chemistry, 2025, 492(1):145281.

[33] Su Y Y, Yang Y, Kilmartin P A, et al.Inter-regional characterization of New Zealand pinot noir wines:Assessing geographical origin through mid-FTIR and phenolic profile analysis[J].Food Research International, 2025, 212:116485.

Traceability analysis of Baijiu by near infrared spectroscopy combined with machine learning

DU Yanhong1,2, HU Chunhong2, TAN Hao2, LI Simai2, CHEN Sijia2, LI Xiao2, GUO Lei2, WANG Shengjie2, XU Yan1*, TANG Ke1*

1(College of Bioengineering, Jiangnan University, Wuxi 214122, China)2(Beijing Red Star Co.Ltd., Beijing 101400, China)

ABSTRACT Taking the 2025 national Baijiu taster training samples as the experimental object, the gas chromatography, near-infrared spectroscopy technology combined with machine learning were used to analyze the different flavor substances of different flavor types, origins and quality grades of Baijiu, and to construct the discrimination model.The results showed that PLS-DA could effectively distinguish the characteristics of different types of Baijiu flavor substances.Taking VIP value >1, P<0.05 as the standard, 21 kinds of Baijiu with different flavor types were identified as β-phenylethyl alcohol, n-butanol, acetal, etc;27 kinds of Jiangxiangxing Baijiu from different regions were identified as ethyl palmitate, β-phenylethanol, ethyl oleate, etc;21 kinds of volatile flavor compounds such as isobutanol, β-phenylethanol, diethyl succinate, etc;and 14 kinds of volatile flavor compounds such as n-pentanol, methanol and isobutyraldehyde were identified as important contribution to different quality grades of Qingxiangxing Baijiu.Compared with RF and SVM, GA-BP model has excellent discrimination performance for different flavor types, origins and quality grades of Baijiu, and the classification accuracy of test samples is 91.33%, 94.38%, 98.28% and 94.83%, respectively.The SHAP interpretation results showed that the wave numbers of 11 996、7 383、5 952,7 128、5 848、5 311,6 935、6 932、5 319,11 996、5 902、5 824 cm-1 had a higher contribution to the model output, and were determined to be the key spectral points for predicting different types of Baijiu.The near-infrared spectroscopy combined with GA-BP model proposed in this study has a high accuracy in the discrimination of different types of Baijiu, which provides a theoretical reference for the rapid traceability and the scientific evaluation of different types of Baijiu.

Key words near infrared spectroscopy;gas chromatography;machine learning;flavor type;origin;quality grade

第一作者:博士,正高级工程师(徐岩教授和唐柯教授为共同通信作者,E-mail:yxu@jiangnan.edu.cn;tandy81@jiangnan.edu.cn)

收稿日期:2025-11-27,改回日期:2026-01-21

DOI:10.13995/j.cnki.11-1802/ts.045311

引用格式:杜艳红,胡春红,谭昊,等.近红外光谱结合机器学习对白酒的溯源分析[J].食品与发酵工业,2026,52(17):336-345.DU Yanhong, HU Chunhong, TAN Hao, et al.Traceability analysis of Baijiu by near infrared spectroscopy combined with machine learning[J].Food and Fermentation Industries,2026,52(17):336-345.