基于风味成分的机器学习算法判别酱香型白酒的真伪

刘钰浩1,2,3,尚煜豪1,2,3,蒋力力1,2,3,田瑞1,2,3,王利萍1,2,3,尤小龙1,2,3,孙优兰1,2,3,胡建锋1,2,3*

1(贵州习酒股份有限公司,贵州 习水,564622)

2(国家市场监管总局重点实验室(酱香型白酒品质与安全),贵州 贵阳,550000)

3(贵州省酱香型白酒技术创新中心,贵州 习水,564622)

摘 要 酱香型白酒工艺独特,深受市场欢迎,由于其利润高,市场需求大,导致各种造假工艺层出不穷,而传统鉴别方法难以应对日益精细的仿冒手段。为此,该研究联合气相色谱等技术系统分析酱香型白酒的风味特征成分,并基于机器学习构建了白酒真伪判别模型。研究首先通过皮尔森相关性分析与随机森林算法评估风味物质重要性,从96种化合物中筛选出糠醛、2-十三烷酮、丙醇等21种关键风味物质作为判别指标。随后对比多层感知机、K近邻和逻辑回归模型分类性能发现,逻辑回归模型表现最优。最后借助SHAP值对逻辑回归模型进行解释,该模型中白酒真伪的判别主要受糠醛、异丁醛、乳酸乙酯等特征成分的影响。该研究不仅丰富酱香型白酒风味成分数据库,也为酒类质量监管提供新的技术参考,具有重要的理论意义和实践价值。

关键词 酱香型白酒;风味物质;机器学习;逻辑回归

酱香型白酒作为中国白酒产业的核心品类,其特有的“12987”古法酿造工艺和地域特征,造就了难以复制的独特品质。据《2024—2025年度酱酒产业发展报告》,2024年该品类以65万千升产能实现约2 400亿元营收,利润率高达40%。但高利润空间也催生了日益严重的造假问题:从简单的外包装仿冒,逐步升级为使用食用酒精、香精等勾兑仿冒,再到形成系统性的以次充好、低档酒冒充高端酒等专业造假行为[1-2]。这种从表层仿冒到深度造假的趋势,给酱香型白酒真伪鉴别技术提出了严峻挑战。

当前酒类产品真伪鉴别技术主要分为三类:外观防伪标识依赖物理手段,易仿冒且难验证酒的品质;感官评价受主观经验影响,重复性差难标准化;而理化成分检测通过气相色谱、质谱等检测技术量化风味物质及其他特征成分,提供客观可重复数据,成为最受关注的方法[3-4]。高云[5]通过测定酯类、醛类和高级醇类等挥发性成分的含量差异,可有效区分干邑白兰地的真伪。孙细珍等[6]则通过定量白酒中挥发性微量物质的含量,结合主成分分析实现白酒真伪鉴定。杜玲玲[7]构建金门高粱酒挥发性成分指纹图谱,并运用主成分分析和聚类分析等化学计量学方法实现金门高粱酒真伪的有效鉴别。然而这些方法在应对现代造假技术时暴露出明显局限,包括有效成分特征丢失、难以捕捉复杂成分间的关系等问题。

随着计算机技术以及计算能力的快速发展,机器学习方法为解决上述瓶颈提供了全新思路。该技术的核心优势在于深度特征学习、建模能力和持续优化的自学习能力,已广泛应用于食品掺假识别、产区来源判断和质量差异分析等领域[8-9]。CALLE等[10]将线性判别分析和随机森林算法与近红外光谱技术相结合,成功实现了果汁掺假(葡萄汁掺入橙汁、菠萝汁和苹果汁)的精准鉴别。HATEGAN等[11]则通过支持向量机和逻辑回归算法,结合核磁共振和拉曼光谱数据,开发了葡萄酒的年份、产区等多维度鉴别模型。此外,STJ等[12]采用顶空超快速气相色谱技术获取葡萄酒挥发性成分指纹图谱,并基于随机森林和支持向量机算法实现葡萄酒品种鉴定及发酵工艺的识别。这些研究表明,机器学习技术在酒类真伪鉴别领域具有广阔的应用前景。

本研究将机器学习技术与风味化学分析方法有机结合建立鉴别酱香型白酒真伪的方法,通过相关性分析与随机森林算法的联合应用筛选并确定与酒样真伪属性高度关联的特征物质,在此基础上分别构建多层感知机、K近邻算法及逻辑回归3种预测模型并对各模型的性能进行对比分析,最终运用SHAP可视化解释工具对机器学习模型的决策机制展开深入解析从而揭示区分酱香型白酒真伪的关键物质。该研究为酱香型白酒产品真伪鉴别和风味物质研究提供了科学依据,具有重要的实践应用价值与理论参考意义。

1 材料与方法

1.1 材料与试剂

实验涉及的样品共计177瓶,其中92瓶真酒由贵州某企业提供(含2023、2024年不同批次),85瓶假酒由市场监管部门提供。所有样品均经过质量验证。样本划分采用分层抽样策略,按7∶>3比例分为训练集(123瓶)和测试集(54瓶),且2组样本中真伪比例与原始样本一致(约1∶>1)。训练集用于模型参数学习,测试集作为独立样本用于评估模型的最终泛化性能,避免数据泄露对结果的影响。

实验所用试剂信息如下:正己烷和乙醚(色谱纯)、氯化钠(分析纯),国药集团化学试剂有限公司;内标物质(乙酸正戊酯、叔戊醇、2-乙基丁酸、2-辛醇、2-甲氧基-3-甲基吡嗪,色谱纯),上海阿拉丁生化科技股份有限公司;定量分析用色谱纯标准品,Sigma-Aldrich有限公司。

1.2 仪器与设备

Agilent 8890 GC-FID气相色谱-氢火焰离子化检测器、7890A-5975C GC-MS气相色谱-质谱联用仪,美国安捷伦科技有限公司;AR2130/C电子天平,常州奥豪斯仪器有限公司;Aquaplore3S超纯水系统,美国艾科浦公司。

1.3 实验方法

1.3.1 直接进样结合气相色谱-火焰离子化检测器法(gas chromatography-flame ionization detection, GC-FID)定性定量分析

参照文献方法[13]并优化,准确量取10 mL酒样至容量瓶,添加100 μL混合内标溶液(含叔戊醇297.46 mg/L、乙酸正戊酯297.59 mg/L、2-乙基丁酸302.37 mg/L),涡旋混匀后移取1 mL至GC进样瓶。GC分析使用DB-Wax UI毛细管柱(30 m×0.25 mm×0.25 μm),载气(高纯度氦气)流速0.7 mL/min,分流模式30∶>1,进样体积1 μL。进样口和检测器温度均设定为250 ℃。柱温升温程序:初始温度35 ℃维持3 min,以3 ℃/min升至100 ℃后立即以7 ℃/min升至200 ℃,保持16 min。标准品溶液通过精确称量43种化合物,用53%(体积分数)乙醇水溶液配制不同浓度梯度工作液,以内标法即目标物与内标物峰面积比对应浓度比建立标准曲线,实现43种骨架化合物的精确定量,相关检测结果见电子版增强出版附表1(https://doi.org/10.13995/j.cnki.11-1802/ts.044389,下同)。

表1 三种机器学习方法的评价指标

Table 1 Evaluation indicators of three machine learning methods

评估指标MLPKNNLR训练集测试集训练集测试集训练集测试集准确率0.910 60.925 90.935 00.944 41.000 00.981 5精确率0.913 00.928 10.942 20.949 81.000 00.982 2召回率0.910 60.925 90.935 00.944 41.000 00.981 5F1-score0.910 30.925 70.934 50.944 21.000 00.981 5AUC0.976 20.978 00.992 80.989 71.000 01.000 0

1.3.2 液液微萃取结合气相色谱-质谱法联用(gas chromatography-mass spectrometry, GC-MS)定性定量分析

参考文献方法[14-15]并优化,取2 mL白酒样品,加饱和NaCl溶液调至10%酒精度,加入内标2-辛醇和2-甲氧基-3-甲基吡嗪(终质量浓度分别为19.82 mg/L和20.23 mg/L),再加入2 mL乙醚-正己烷(体积比1∶>1)混合萃取,涡旋混匀后取上清液待测。GC-MS分析采用DB-FFAP毛细管柱(60 m×0.25 mm×0.25 μm),载气为高纯氦气(1.0 mL/min)。不分流进样2 μL,设置2种升温程序:程序A初始40 ℃保持1 min,以8 ℃/min升至80 ℃,2.5 ℃/min至115 ℃,8 ℃/min至155 ℃,5 ℃/min至230 ℃;程序B初始50 ℃,2.5 ℃/min至100 ℃保持1 min,3 ℃/min至160 ℃,5 ℃/min至230 ℃保持10 min,溶剂延迟分别为7 min和8 min。质谱条件:EI离子源70 eV,离子源230 ℃,四极杆150 ℃。标准品溶液配制见1.3.1节,实现53种微量化合物的定量。

1.4 数据处理

1.4.1 特征变量选择

本研究初始训练集含96个特征,高维度数据会增加计算成本,且冗余或无关变量易导致模型参数不稳、过拟合,降低预测精度与解释性,因此特征筛选成为提升模型性能的关键预处理步骤[16]。研究采用两阶段筛选策略(图1):第一阶段通过皮尔森相关系数分析,先保留与目标变量相关系数绝对值|r|>0.5的变量,排除弱关联变量;再针对保留特征变量中相关系数绝对值大于0.95的高度共线特征对,结合随机森林(random forest, RF)的Gini重要性指标进行冗余剔除,以此规避共线问题对模型稳定性的干扰[17]。第二阶段基于500棵决策树构建的RF算法,依托其捕捉特征关系的优势量化重要性,将特征按重要性降序排列,通过累积重要性曲线分析筛选出累积贡献度达99%的关键特征子集,以此精准保留下核心特征。该策略兼顾特征与目标变量的统计关联性及在预测模型中的实际贡献,减少无关和冗余变量的同时保留核心信息,为后续建模奠定可靠基础。

图1 数据获取及处理过程

Fig.1 Data acquisition and processing process

1.4.2 模型建模

针对分类任务构建了多层感知机(multi-layer perceptron, MLP)、K近邻算法(K-nearest neighbor, KNN)和逻辑回归(logistic regression, LR)3种模型。其中,MLP作为前馈神经网络,通过反向传播算法优化多层神经元间的连接权重,凭借隐藏层结构实现对高维特征复杂交互关系的捕捉,具备强大的非线性建模能力;KNN算法基于实例学习原理,通过设定合理的邻居数与距离度量方式,根据测试样本在特征空间中的最近邻样本进行类别判定,对局部数据分布敏感且无需预设模型参数;LR模型通过logistic函数将线性组合的特征映射为概率输出,结构简单且参数具有明确的可解释性[18-19]

1.4.3 模型评估

为系统比较3种模型在酱香型白酒真伪鉴别任务中的表现,研究严格区分训练集与测试集的功能边界,并引入5折分层交叉验证机制强化结果增强模型可靠性:训练集专门用于模型参数学习,测试集单独评估泛化能力,通过准确率、精确率、召回率、F1-score及AUC指标全面评估模型分类效果与泛化性能[18,20]。其中,准确率反映模型整体分类的正确性,即预测正确的样本(包括真酒判真、假酒判假)占总样本的比例;精确率则通过两类样本量加权得出,既体现“预测为真酒的样本中实际为真酒”的比例,也包含“预测为假酒的样本中实际为假酒”的比例,综合衡量两类预测结果的可信度;召回率基于样本量加权,既反映实际真酒被成功识别的比例,也体现实际假酒被成功识别的比例,综合评估模型对两类样本的捕捉能力;F1-score作为精确率与召回率的调和平均数,平衡两者矛盾以反映综合稳定性;AUC则通过整合不同分类阈值下的表现,评估模型在动态决策边界下的稳健性。5个评估指标值均在0~1区间内,其数值越接近1,表明对真假酒差异的识别能力越强。这些指标相互补充,成为全面且可靠的模型评估方式。

1.4.4 SHAP值解释机器学习模型

解析特征在模型预测中的作用机制时,可引入SHAP(shapley additive explanations)值进行量化解释,该方法以博弈论中的Shapley值为理论基础,通过计算每个特征对预测结果的边际贡献,实现对模型决策过程的可解释性。其核心功能在于精准量化单个特征对预测结果的影响方向与强度:其数值的正负属性直接标识特征的作用方向,正值说明该特征会促使预测结果向目标类别偏移,负值则代表其对目标类别预测存在反向抑制效应;而数值的绝对值大小则衡量着影响的强弱程度,绝对值越大表明该特征在模型决策体系中扮演的角色越核心,对最终预测结果的实际贡献也越突出[21]。本文所有分析均采用Python 3.8完成:相关性分析通过皮尔森函数实现,所有机器学习模型均由scikit-learn库完成,SHAP值的计算与可视化则通过SHAP库实现。

2 结果与分析

2.1 特征变量选择

2.1.1 相关性分析

为避免数据泄露影响模型客观性,数据以7∶>3比例划分为训练集和测试集,特征筛选过程严格基于训练集独立完成。通过皮尔森相关性分析,96种化合物与酱香型白酒真伪性的相关性得到系统评估,以相关系数绝对值|r|>0.5为筛选标准,初步筛选出53种与酒样真伪性较高相关的风味物质。这些物质之间存在10对高度相关特征组合(|r|>0.95),包括2,3,5-三甲基吡嗪与2,6-二甲基吡嗪(r=0.97)、2-甲基吡嗪与2-乙基吡嗪(r=0.97)、2-甲基丁酸乙酯与异戊酸乙酯(r=0.96)等,且大部分组合在分子结构上较为相似。为降低变量间的多重共线性影响,借助RF算法评估每对高度相关特征组合的重要性,优先留下各组合中重要性得分更高的特征变量,共保留了46个特征变量(图2)。

图2 白酒真伪与部分物质含量的相关性系数热图

Fig.2 Heatmap of correlation coefficients between Baijiu authenticity and content of selected substances

2.1.2 随机森林重要性分析

围绕上述46种特征变量,采用由500棵决策树构成的RF算法开展特征重要性评估,通过分析各特征在决策树节点分裂时对模型不纯度的改善程度筛选关键指标,并将量化后的特征重要性按降序排列(图3)。糠醛、2-十三烷酮、丙醇、乙酸异戊酯和异戊醛的含量在特征重要性排序中位列前五。为进一步提取关键特征子集,研究结合特征的累积重要性曲线分析,以累计贡献度达99%作为筛选标准,确定以下21种特征变量为关键成分:糠醛、2-十三烷酮、丙醇、乙酸异戊酯、异戊醛、乳酸乙酯、2-乙基-6-甲基吡嗪、乙缩醛、二甲基三硫、2,6-二甲基吡嗪、异丁醇、3-辛醇、乙酸异丁酯、2-甲基吡嗪、异戊酸乙酯、异戊酸、异戊醇、丁二酸二乙酯、异丁酸、甲酸乙酯和辛醇。这些关键成分涵盖醛类、酮类、醇类、酯类、吡嗪类及含硫化合物等多个关键挥发性物质类别,呈现出独特的风味特征。醛类物质如糠醛、异戊醛等常呈现坚果和焦糖香气,酯类物质如乙酸异戊酯、乳酸乙酯等赋予酒体水果甜香,吡嗪类如2,6-二甲基吡嗪、2-乙基-6-甲基吡嗪表现出焙烤与坚果香[13,15]

图3 基于RF的特征化合物的重要性排序及累积贡献度图

Fig.3 Importance ranking and cumulative contribution graph of compounds based on RF

2.2 模型构建及评价

2.2.1 模型构建

以筛选出的21种关键风味成分特征构成特征合集,通过Python分别调用MLP、KNN及LR 3种机器学习算法构建分类模型,模型以训练集中的特征成分作为输入,以真假属性作为输出。同时在模型构建过程中采用五折交叉验证对模型构建过程进行监督与验证,以提升评估可靠性。相关评估结果见表1,从表中可知,在训练集上LR模型的分类准确率最高,其次为KNN;横向对比可以发现,3种机器学习分类模型的准确率、精确率、召回率等5项指标均达到0.90以上,表明其在训练集上具备较优的分类性能。同时结合ROC曲线分析,LR模型在训练集上的分类能力最优。这些结果共同说明,基于21种关键风味成分构建的分类模型在训练集上具备较优分类性能,且能稳健捕捉真假酒样本间的特征差异。

2.2.2 模型评价

为检验模型在实际应用中的判别效能,独立测试集数据导入训练完成的3种模型,系统评估其泛化表现。3种模型均展现出优异的泛化能力:MLP模型凭借多层感知器的非线性拟合特性,在准确率、精确率和召回率等关键指标上均超过0.92;KNN模型依托样本间距离度量的决策逻辑,表现更为突出,5项核心评价指标均维持在0.94以上;而LR模型凭借其对数几率回归的统计可解释性,展现出最优异的判别性能,所有评价指标均突破0.98,显示出极高的分类准确性和稳定性。

通过混淆矩阵深入解析分类细节:MLP分类模型的判别结果中(图4-A),28个真酒样品里有27个被准确识别为真酒,仅1个被误判为假酒;26个假酒样品中23个实现正确分类,3个被错误识别为真酒。KNN模型的真酒识别表现更为稳健(图4-B),28个酱香型真酒样品均被正确判定为真酒,假酒样品的分类情况与MLP模型一致。LR模型的分类效果最为优异(图4-C):28个真酒样品中仅1例误判,而26个假酒样品全部实现正确分类,未出现误判情况。

A-MLP混淆矩阵;B-KNN混淆矩阵;C-LR混淆矩阵;D-ROC曲线

图4 三种机器学习方法的混淆矩阵及ROC曲线

Fig.4 Confusion matrix and ROC curve of three machine learning methods

ROC曲线分析结果(图4-D)佐证了模型的综合判别能力:MLP、KNN及LR模型在测试集上的AUC值分别为0.97、0.99和1.00,其中LR模型的AUC值达到理论最优值,表明其在不同阈值设定下均能保持完美的分类效能。这一结果与前述准确率指标及混淆矩阵分析高度一致,验证了三类模型在独立测试集中的稳定表现,尤其LR模型以完美的AUC值展现出显著的综合优势,为酱香型白酒真伪鉴别奠定了可靠的技术基础。

2.3 模型特征可解释分析

为了破解机器学习模型因运算逻辑隐蔽性而形成的“黑箱”困境,本研究选取经性能验证最优的LR模型作为分析基础,引入SHAP解释法对真伪判别任务输出结果展开深度剖析。真酒的SHAP值汇总图结果显示(图5-A),在21个关键特征中,前7个最具判别力的特征按贡献度排序依次为糠醛、异丁醛、丙醇、乳酸乙酯、异戊酸、异丁醇和丁醇。同时发现,假酒在判别过程中所依赖的核心特征贡献度与真酒高度重合,且同一特征对真假酒判别结果的影响呈现显著的方向性差异(图5-C)。这种模式源于LR模型的决策机制:模型通过统一的权重系数对特征进行线性组合,使同一特征在两类样本的贡献值符号相反[22]

A-真酒SHAP总结图;B-真酒依赖图;C-假酒SHAP总结图;D-假酒依赖图

图5 LR模型针对真酒与假酒的SHAP值的总结图及依赖图

Fig.5 Summary and dependence plots of the SHAP value of LR model for real and fake Baijiu

特别值得注意的是,糠醛在所有特征中表现出最强的判别能力,其平均SHAP值高达0.49,显著高于其他物质。结合依赖图(图5-B和图5-D)可见,其含量对真假酒判别结果存在强关联性:当含量低于158.45 mg/L时,其对假酒判定的负向贡献度随含量降低而增强;当含量高于该阈值时,其对真酒判定的正向贡献度则随含量升高而显著提升。这种含量依赖性判别特性,使糠醛成为区分真伪的关键指标。该特征与酱香型白酒的工艺特性直接相关:正品酒中糠醛平均含量稳定维持在250 mg/L左右,主要源于其特有的高温制曲、高温发酵等工艺,该工艺为美拉德反应合成糠醛提供了理想环境[23-24]。而假冒产品中该物质含量普遍不足100 mg/L,可能受到工艺控制不足、勾兑稀释等因素的综合影响。已有文献明确证实糠醛可作为酱香型白酒真伪鉴别指标[25],支撑了本研究中将其确定为核心判别特征的结论。

除糠醛外,多个特征成分通过协同作用共同构成了完整的判别体系。异丁醛、乳酸乙酯等成分在正品酒中呈现高含量,与真酒判定呈正相关。其中,乳酸乙酯作为白酒中重要的风味物质[26],正品酒中乳酸乙酯平均含量达到2 085.32 mg/L,高于假冒酒的1 094.36 mg/L。正品酒中该成分的高积累主要得益于微生物代谢的调控作用:酿造过程中,乳酸菌与酵母菌等微生物通过代谢提供持续前体物质并创造反应条件,推动酯类物质积累[27-28]。而丁醇等少数物质则表现出独特的负向判别特征。高含量伴随负SHAP值,意味着其含量升高会增加模型判定为假酒的概率。丁醇作为发酵产物,部分假冒样本含量高达104.15 mg/L,远超真酒均值57.88 mg/L,这种异常积累可能与假冒生产过程中的工艺缺陷相关,如杂菌污染、发酵温度失控等问题[29-30]。综上,这些特征通过与真伪判定的正负关联形成协同判别效应:不仅构成了白酒真伪鉴别的物质基础,更直接印证了LR模型对成分差异的精准捕捉能力,增强了模型决策的可解释性。

3 结论

本研究通过系统分析酱香型白酒的风味特征成分,成功构建了一套基于机器学习的真伪判别体系。研究采用皮尔森相关性分析结合随机森林算法评估96种风味物质重要性,筛选出糠醛、2-十三烷酮、丙醇等21种关键风味物质。通过对比MLP、KNN和LR 3种机器学习模型性能,发现三者在白酒真伪判别中均展现出优异且稳定的分类效果,其中LR模型表现最佳。借助SHAP分析解释该LR模型,揭示糠醛、异丁醛、乳酸乙酯等成分是驱动真伪判定的关键因素,且糠醛含量差异对判别结果的影响最明显。本研究既为酱香型白酒品质研究提供了理论参考,也为酒类质量监管和打假工作提供了实用技术支撑。后续可通过扩大样本量、拓展特征维度,进一步提升模型的适用性与稳定性,以更好适配市场需求。

参考文献

[1] 汪廷彩, 刘嘉飞, 杨中花, 等.酒类产品真假鉴别技术研究现状[J].食品安全质量检测学报, 2019, 10(13):4029-4035.WANG T C, LIU J F, YANG Z H, et al.Research status of true or false identification technology of liquor products[J].Journal of Food Safety &Quality, 2019, 10(13):4029-4035.

[2] 杨宇. 浅析白酒包装材料防伪和造假技术现状及发展趋势[J].现代食品, 2024, 30(4):72-74.YANG Y.Analysis on the present situation and development trend of anti-counterfeiting and counterfeiting technology of Baijiu packaging materials[J].Modern Food, 2024, 30(4):72-74.

[3] 杨博, 郭启鹏, 苏正, 等.现代检测技术在白酒真实性鉴别中的应用研究进展[J].食品工业, 2024, 45(2):192-196.YANG B, GUO Q P, SU Z, et al.Research progress on the application of modern detection technology in Baijiu authenticity identification[J].The Food Industry, 2024, 45(2):192-196.

[4] RO SEGADE S, RRAB D, PEZZUTO E, et al.Isomer composition of aroma compounds as a promising approach for wine characterization and differentiation:A review[J].Critical Reviews in Food Science and Nutrition, 2024, 64(2):334-353.

[5] 高云. 基于气、液相色谱技术的干邑白兰地真伪鉴定方法研究[D].广州:华南理工大学, 2018.GAO Y.Investigation on the potential adulteration determination method of Cognac based on the technique of gas and liquid chromatography[D].Guangzhou:South China University of Technology, 2018.

[6] 孙细珍, 张帆, 杜佳炜, 等.基于毛细管气相色谱法和主成分分析的白酒真假酒判别分析[J].酿酒, 2021, 48(1):42-50.SUN X Z, ZHANG F, DU J W, et al.Discriminant analysis for Chinese spirits authenticity based on capillary gas chromatography and principal component analysis[J].Liquor Making, 2021, 48(1):42-50.

[7] 杜玲玲. 金门高粱酒真伪鉴别技术研究[D].厦门:集美大学, 2015.DU L L.Study of the authenticity identification of Kinmen Kaoliang liquor[D].Xiamen:Jimei University, 2015.

[8] DENG Z W, WANG T, ZHENG Y, et al.Deep learning in food authenticity:Recent advances and future trends[J].Trends in Food Science &Technology, 2024, 144:104344.

[9] TRUONG NGOC M, NGUYEN Q T, PHAM V T, et al.Assessing vodka authenticity and origin in Vietnam’s market:An analytical approach using FTIR and ICP-MS with multivariate statistics[J].Journal of Analytical Methods in Chemistry, 2024(1), 2024:5652559.[10] CALLE J L P, BAREA-SEPLVEDA M, RUIZ-RODRGUEZ A, et al.Rapid detection and quantification of adulterants in fruit juices using machine learning tools and spectroscopy data[J].Sensors, 2022, 22(10):3852.

[11] HATEGAN A R, DAVID M, PIRNAU A, et al.Fusing 1H NMR and Raman experimental data for the improvement of wine recognition models[J].Food Chemistry, 2024, 458:140245.

[12] STJ A, WOJNOWSKI W, POTKA-WASYLKA J, et al.The use of ultra-fast gas chromatography for fingerprinting-based classification of zweigelt and rondo wines with regard to grape variety and type of malolactic fermentation combined with greenness and practicality assessment[J].Molecules, 2024, 29(19):4667.

[13] 王金龙, 程平言, 陆伦维, 等.基于DB-WAX UI色谱柱气相色谱法检测5种香型白酒中45种挥发性风味物质[J].中国酿造, 2023, 42(4):238-243.WANG J L, CHENG P Y, LU L W, et al.Detection of 45 volatile flavor compounds in 5 flavor types Baijiu by GC based on DB-WAX UI column[J].China Brewing, 2023, 42(4):238-243.

[14] 陆伦维, 孙优兰, 王金龙, 等.液液微萃取结合GC-MS-SIM法检测酱香型白酒中15种微量成分含量[J].酿酒科技, 2022(12):115-120;133.LU L W, SUN Y L, WANG J L, et al.Determination of fifteen trace components in Jiangxiang Baijiu by liquid-liquid microextraction combined with GC-MS-SIM[J].Liquor-Making Science &Technology, 2022(12):115-120;133.

[15] 孙优兰, 骆红波, 王金龙, 等.酱香型白酒不同轮次基酒风味特征分析[J].食品与发酵工业, 2024, 50(17):343-352;I0003-I0005.SUN Y L, LUO H B WANG J L, et al.Analysis of flavor characteristics of different rounds base liquor for Jiangxiangxing Baijiu[J].Food and Fermentation Industries, 2024, 50(17):343-352;I0003-I0005.

[16] GOYAL R, SINGHA P, SINGH S K.Spectroscopic food adulteration detection using machine learning:Current challenges and future prospects[J].Trends in Food Science &Technology, 2024, 146:104377.

[17] CHENG K Q, DONG R N, PAN F, et al.Characterization and feature selection of volatile metabolites in Yangxian pigmented rice varieties through GC-MS and machine learning algorithms[J].Frontiers in Nutrition, 2025, 12:1598875.

[18] 苏礼君, 李健, 孔建磊, 等.机器学习技术在食品风味分析中的研究进展[J].食品工业科技, 2024, 45(18):19-30.SU L J, LI J, KONG J L, et al.Progress in research on machine learning for studies on food flavor analysis[J].Science and Technology of Food Industry, 2024, 45(18):19-30.

[19] 黄晓琛, 张凯利, 刘元杰, 等.机器学习与计算机视觉技术在食品质量评价中的研究进展[J].食品科学, 2024, 45(12):1-10.HUANG X C, ZHANG K L, LIU Y J, et al.Research progress on machine learning and computer vision technology in food quality evaluation[J].Food Science, 2024, 45(12):1-10.

[20] 贺海洋, 李朋刚, 李亚林, 等.基于机器学习的花岗岩型铀矿含矿潜力分析—以湘中地区为例[J/OL].地学前缘, 2026.DOI:10.13745/j.esf.sf.2025.2.9.HE H Y, LI P G, LI Y L, et al.Analysis of the mineral-bearing potential of granite-type uranium deposits based on machine learning:A case study of central Hunan area[J/OL].Earth Science Frontiers, 2026.DOI:10.13745/j.esf.sf.2025.2.9.

[21] 韩凤歌, 冷成彪, 陈加杰, 等.基于磷灰石微量元素组成的机器学习方法判别花岗岩成因类型[J].岩石学报, 2025, 41(2):737-750.HAN F G, LENG C B, CHEN J J, et al.Machine learning method for discriminating granite genetic types based on trace element composition of apatite[J].Acta Petrologica Sinica, 2025, 41(2):737-750.

[22] 胡记磊, 吴文良, 王璟, 等.基于自适应LASSO的逻辑回归砂土液化判别模型[J].三峡大学学报(自然科学版), 2023, 45(2):67-72.HU J L, WU W L, WANG J, et al.A discriminant model for sand liquefaction based on adaptive LASSO-LR[J].Journal of China Three Gorges University (Natural Sciences), 2023, 45(2):67-72.

[23] 杨婷婷, 黄永光, 左乾程, 等.酱香白酒酿造过程糠醛及糠醇的时空分布规律及溯源分析[J].食品科学, 2025, 46(5):38-47.YANG T T, HUANG Y G, ZUO Q C, et al.Temporal and spatial distribution patterns and traceability analysis of furfural and furfuryl alcohol in the brewing process of sauce-flavor Baijiu[J].Food Science, 2025, 46(5):38-47.

[24] LUO X, FAN W L, XU Y, et al.Characterization of volatile bitter off-taste compounds in Maotai-flavor Baijiu (Chinese liquor)[J].LWT, 2025, 217:117363.

[25] 刘斐. 基于机器学习算法的酱香型白酒真实性多源数据表征研究[D].湘潭:湘潭大学, 2024.LIU F.Multi-source data characterization of authenticity of Jiangxiang flavor Baijiu based on machine learning algorithms[D].Xiangtan:Xiangtan University, 2024.

[26] 黄治国, 刘履常, 李彦中, 等.不同香型白酒中的乳酸及乳酸乙酯旋光异构体的分析比较[J].现代食品科技, 2026, 42(3):1-8.HUANG Z G, LIU L C, LI Y Z, et al.Comparison of the optical isomers of lactic acid and ethyl lactate in Baijiu of different aroma types[J].Modern Food Science and Technology, 2026, 42(3):1-8.

[27] 胡春红, 卢君, 尹学忠, 等.不同轮次酱香型基酒风味特征分析[J].中国酿造, 2025, 44(7):45-50.HU C H, LU J, YIN X Z, et al.Analysis of flavor characteristics of sauce-flavor base liquor in different rounds[J].China Brewing, 2025, 44(7):45-50.

[28] FAN J Y, CHEN J, DU G C, et al.Mechanism of lactic acid synthesis during strong-flavor Baijiu fermentation revealed by transcriptomic analysis[J].Food Bioscience, 2024, 58:103780.

[29] 宋瑞滨, 邵泽良, 宋军.浓香型白酒发酵过程中多因素对正丁醇生成影响的研究[J].酿酒, 2018, 45(5):62-66.SONG R B, SHAO Z L, SONG J.Study on the influence of multiple factors on the formation of N-butanol during the fermentation of Luzhou flavor liquor[J].Liquor Making, 2018, 45(5):62-66.

[30] 孔小勇, 曹永楠.浓香型白酒正丁醇生成规律及代谢途径的研究[J].酿酒科技, 2022(7):60-64.KONG X Y, CAO Y N.Generation laws and metabolic pathways of N-butanol in Nongxiang Baijiu[J].Liquor-Making Science &Technology, 2022(7):60-64.

Authenticity assessment of Jiangxiangxing Baijiu by machine learning based on flavour components

LIU Yuhao1,2,3, SHANG Yuhao1,2,3, JIANG Lili1,2,3, TIAN Rui1,2,3, WANG Liping1,2,3,YOU Xiaolong1,2,3, SUN Youlan1,2,3, HU Jianfeng1,2,3*

1(Guizhou Xijiu Co.Ltd., Xishui 564622, China)

2(Key Laboratory of Quality and Safety of Jiangxiangxing Baijiu, State Administration for Market Regulation, Guiyang 550000, China)

3(Guizhou Province Technology Innovation Center for Jiangxiangxing Baijiu, Xishui 564622,China)

ABSTRACT Jiangxiangxing Baijiu, with unique production process, is highly popular in the market.Due to its high profit margins and significant market demand, a wide range of counterfeiting methods have emerged.But the traditional authentication methods are difficult to cope with the increasingly sophisticated counterfeiting methods.Therefore, in this study, the flavour components of jiangxiangxing Baijiu were analyzed by gas chromatography and other technologies, and the authenticity discrimination model was constructed by machine learning.Firstly, the importance of flavour substances was assessed by pearson’s correlation and random forest, and 21 key flavour substances, including furfural, 2-tridecanone and propanol, were selected as discriminators from 96 compounds.Subsequently, comparing the discriminative performance of multilayer perceptron, K-nearest neighbour and logistic regression models, it was found that the logistic regression model performed the best.Finally, with the help of SHAP interpretability analysis, the model of authenticity discrimination was mainly affected by furfural, isobutyraldehyde, ethyl lactate, and other characteristic components.This study not only enriches the database of flavor components of jiangxiangxing Baijiu, but also provides a new technical reference for liquor quality supervision, which has important theoretical significance and practical value.

Key words Jiangxiangxing Baijiu; flavor substances; machine learning; logistic regression

DOI:10.13995/j.cnki.11-1802/ts.044389

引用格式:刘钰浩,尚煜豪,蒋力力,等.基于风味成分的机器学习算法判别酱香型白酒的真伪[J].食品与发酵工业,2026,52(12):316-323.LIU Yuhao,SHANG Yuhao,JIANG Lili, et al.Authenticity assessment of Jiangxiangxing Baijiu by machine learning based on flavour components[J].Food and Fermentation Industries,2026,52(12):316-323.

第一作者:硕士,助理工程师(胡建锋高级工程师为通信作者,E-mail:287718676@qq.com)

基金项目:贵州省科技支撑计划项目(黔科合支撑[2025]一般037)

收稿日期:2025-09-05,改回日期:2025-10-30