大豆是一种用途广泛的农产品,在能源、饲料和食品等领域均有重要应用。大豆既可用于生产生物燃料,也可加工为动物饲料。作为一种营养丰富的超级食物,大豆约含36%的蛋白质、19%的脂肪和35%的碳水化合物,常被制成酱油、豆腐、豆浆和食用油等产品。大豆产地是影响其品质的关键因素,品质优劣直接决定了其市场价值的高低。随着全球对大豆需求的持续增长,不同品质大豆之间的价值差异较大,这导致了市场上食品欺诈与掺假现象的发生。因此,研究一种准确且实用的大豆产地鉴别方法十分必要。
机器学习能自动从数据中挖掘规律、学习知识,进而实现精准预测,这使其在大豆产地鉴别中得到了广泛应用。Soni等通过整合稳定同位素与挥发性有机化合物数据,并借助随机森林模型,对巴西6 个州大豆产地进行了鉴别。Wang Li等将激光诱导击穿光谱技术与卷积神经网络(CNN)相结合,成功对中国5 个省份的大豆进行了有效区分。Xiao Yuhui等采用溴化钾压片法处理大豆样品并采集光谱数据,结果表明集成学习算法能有效鉴别大豆产地。统计学方法也常用于大豆产地鉴别。鹿保鑫等采用Fisher判别分析法,对产自黑龙江省内两个地区的大豆进行了产地识别,结果显示交叉验证判别正确率为92.9%。为了能准确区分来自4 个不同国家的大豆,Zeng Guangfeng等将大豆压榨成油后获取其质谱数据,并建立正交偏最小二乘判别分析模型。尽管现有的大豆产地鉴别方法具有良好的准确性,但通常需要在设备齐全的实验室中由技术娴熟的操作人员完成检测。此外,这些方法在数据采集过程中会对样品造成破坏,导致样品无法重复使用,同时也难以实现大批量检测。因此,可能无法有效保障整个大豆批次的产地溯源可靠性。鉴于这些限制,研究一种无损且操作便捷的产地鉴别方法显得尤为迫切。然而,即便采用无损检测方法,大豆产地的鉴别仍面临不确定性挑战。这是由于大豆的关键特征易受当年气候、储存条件及品种差异的影响,导致同一产地特征稳定性不足,而不同产地间的特征又可能高度相似。因此,要构建能在复杂现实中可靠应用的鉴别方法,必须有效解决产地特征的不确定性。
计算机视觉技术具有非破坏性的特点,并凭借其强大的特征提取能力,在农产品产地鉴别中展现出巨大的应用潜力。Shen Ke等采用计算机视觉技术提取颜色与纹理特征,并通过融合多维数据实现了对不同产地鹿茸的鉴别。Asadi等通过机器学习算法,基于图像特征对伊朗3 个地区的猕猴桃进行产地鉴别,准确率达到93.33%。Dürrani等利用深度学习技术对鱼类耳石图像进行分析,实现了鱼类产地的自动识别,准确率达到96%。李东明等针对不同省份的防风药材图像数据集,提出了一种改进的稠密连接网络模型,有效地完成了产地鉴别。研究表明,不同产区大豆的外观特征存在显著性统计学差异。因此,利用计算机视觉系统获取大豆特征进行分析是一种可行的产地鉴别方法。
计算机视觉系统能获取大豆的形状、颜色和纹理特征,而获取的特征存在不确定性。首先,相邻省份所产的大豆在颜色与纹理上往往不易区分;其次,同一省份内因种植条件差异,大豆外观也会发生变异。因此,仅使用单一类型特征识别大豆产地具有局限性,鉴别准确率不高。
粒计算是一个新兴的人工智能研究方向,福建农林大学计算机与信息学院的傅兴宇、翁佩琳、林健*等 针对大豆特征中不确定信息的处理与规范化问题,提出一种基于信息粒化的数据表示方法,并构建相应的粒度神经网络模型,以提升对不确定信息的处理能力。通过分析形状、颜色、纹理等单一特征及其组合对鉴别效果的影响,进一步增强模型的可解释性。本研究旨在为大豆产地溯源提供一种更精准的鉴别方案。
1
不同特征组合对比结果
相较于CNN所提取的难以解释的抽象深层特征,针对大豆外部形状、纹理、颜色等传统特征提取方法具有可解释性和明确的物理意义。例如,形状特征可直接反映豆粒的饱满度与均匀性;纹理特征能够量化表面光滑或皱缩的程度;颜色特征则可有效区分因品种、成熟度或霉变引起的色泽差异。这种直观性在大豆产地鉴别中具有重要意义。
1.1 单一类别特征分析
使用5 种机器学习模型和提出的改进神经网络,在3 个类别特征数据集上分别进行测试,结果如表1所示。
从表1可得,5 种常用机器学习算法对形状特征上的整体鉴别效果最优,该特征在三大类别特征中鉴别效果最佳。6 种算法对大豆产地鉴别的平均准确率显示,形状特征的平均准确率为88.01%,高于纹理特征(82.91%)。大豆的颜色主要由品种遗传特性决定。然而,同一品种常在多个省份种植,且在不同气候条件下颜色也会发生自然变异。此外,成熟度同样影响籽粒颜色,未完全成熟时多呈绿色或浅黄色,过度成熟则会导致颜色暗沉。这些因素都会引入噪声,仅依靠单一颜色特征难以有效鉴别大豆产地,其平均准确率为78.50%,比形状特征低9.51%,比纹理特征低4.41%。粒度神经网络在纹理特征上取得了最高准确率,达到89.06%,略高于其在形状特征上的准确率88.32%。同时,粒度神经网络相比标准神经网络在颜色特征上准确率提高了5.37%,在纹理特征上提升幅度最大,达到6.27%。这表明粒度神经网络能够有效处理纹理特征中存在的不确定性,在大豆产地鉴别中表现良好。然而,仅依赖单一类别特征进行鉴别时,准确率均未超过90%,效果仍不理想,因此有必要进一步探讨不同特征组合的鉴别方法。
1.2 不同类别特征组合
研究表明,将形状、纹理、颜色等多种特征组合,能够从不同维度提供互补信息,从而更全面、鲁棒地描述样本,提升分类模型的准确率和泛化能力。本节将整合大豆的形状、纹理和颜色3 类特征,通过两种组合方式进行实验:一是进行两两组合,二是进行3 种特征的全部组合,合计4 种特征组合方式。随后,采用XGBoost算法进行特征选择,保留重要性排名前15的特征(Top-15),以探究不同特征组合对产地鉴别准确率的影响,结果如表2所示。
从表2可得,在两两特征组合的鉴别准确率上,粒度神经网络比标准神经网络在形状-颜色组合上提高1.67%,在形状-纹理组合上提高2.1%,在颜色-纹理组合上提高3.97%。这表明粒度神经网络在解决大豆产地鉴别中颜色-纹理组合所存在的不确定性方面效果良好。
此外,粒度神经网络在形状-纹理特征组合上的准确率(93.42%)高于形状-颜色和颜色-纹理的特征组合,并且在单一类别特征中,形状和纹理特征的平均准确率也更高。在所有的两两组合中,形状-颜色组合的鉴别准确率相较于颜色-纹理组合高出5.17%。颜色-纹理组合对于大豆产地的鉴别效果不佳,5 种常用算法准确率均低于90%,仅粒度神经网络达到91.40%。
形状-颜色-纹理3 种特征组合的平均准确率(92.45%)高于任何两两特征组合,比颜色-纹理组合提高5.57%,比形状-纹理组合提高0.68%,比形状-颜色组合提高0.4%。在6 种算法中,仅有XGBoost在形状-颜色组合上的准确率略高于形状-颜色-纹理3 种特征组合,高出0.11%。在形状-颜色-纹理组合上,粒度神经网络的准确率(94.86%)是6 种算法中鉴别效果最佳的,比SVM、RF、GBDT、XGBoost及标准神经网络分别提高了2.96%、3.62%、2.53%、2.33%和3%。相较于仅使用单一特征,如形状、颜色及纹理,准确率分别提高了6.54%、10.16%和5.8%。在进行大豆产地鉴别时,使用55 个特征的平均鉴别准确率优于经过特征选择后保留15 个特征的结果,两者相差0.49%。这表明,保留55 个形状-颜色-纹理特征能够提供更充分的信息,有利于提高鉴别准确率。
综上,特征组合方法在大豆产地鉴别中有效,其中形状-颜色-纹理特征组合的鉴别准确率最高。此外,粒度神经网络在处理不同特征组合的不确定性方面表现出色,能有效提升大豆产地鉴别的准确性。
2
混淆矩阵对比分析
为进一步验证所提出的粒度神经网络在大豆产地鉴别中的有效性,本研究将其与5 种机器学习算法进行对比,并采用混淆矩阵对基于形状、颜色和纹理的特征组合分类结果进行可视化,如图4所示。
从图4可以看出,粒度神经网络在大豆产地鉴别中的错误判别次数均小于30 次,优于其余5 种算法。在6 种算法中,广西大豆被误判为吉林大豆的次数为0 次,且被误判为其他省份大豆的次数均不超过10 次。江苏大豆被误判为黑龙江大豆的次数较多,在RF算法中达58 次,在GBDT和XGBoost中均为46 次,而粒度神经网络有效降低了两地大豆判别中的不确定性,将误判次数减少至25 次。在标准神经网络中,吉林大豆被误判为黑龙江大豆25 次,辽宁大豆被误判为黑龙江大豆21 次。与标准神经网络相比,粒度神经网络进一步减少了将吉林和辽宁大豆误判为黑龙江大豆的次数,其中吉林大豆的误判次数减少11 次,辽宁大豆减少5 次。
黑龙江、吉林与辽宁同属东北大豆主产区,均处于温带季风气候区,土壤以黑土为主,且主栽品种相近,这些因素可能导致大豆籽粒在形状、颜色与纹理特征上差异较小,从而加大鉴别模型的区分难度。江苏气候温暖湿润,受品种选育与存储方式的影响,江苏大豆籽粒表型与黑龙江大豆存在一定重叠。而广西属于南方热带与亚热带大豆产区,高温多雨的气候条件使广西大豆外观较为独特,从而更易于区分。综上所述,吉林、江苏和辽宁产的大豆较易被误判为黑龙江大豆,而广西大豆与上述四省大豆在外观上差异较大。粒度神经网络方法相比其他机器学习算法,能更有效地减少误判次数。
基于混淆矩阵计算了6 种算法在不同省份大豆产地鉴别任务中的准确率,具体结果如表3所示。
由表3可知,在广西大豆的鉴别中,RF、XGBoost和神经网络的准确率均为99.15%,而粒度神经网络的准确率更高,达到99.79%。在吉林大豆的鉴别中,XGBoost和粒度神经网络的准确率均超过95%,其中粒度神经网络的效果最好;XGBoost算法相比标准神经网络准确率提高了2.18%,而粒度神经网络比标准神经网络提高了2.84%。在江苏大豆的鉴别中,标准神经网络和粒度神经网络的准确率均超过90%,且粒度神经网络比标准神经网络高2.05%。在黑龙江大豆的鉴别中,6 种算法中仅粒度神经网络的准确率超过90%,达到91.69%,相比标准神经网络提高了4.99%。在辽宁大豆的鉴别中,机器学习算法中准确率最高的是GBDT,值为94.76%,而改进神经网络比GBDT高1.19%。
在大豆产地鉴别任务中,5 种常用的机器学习算法在广西、吉林和辽宁的平均准确率均高于93%,而在江苏 和黑龙江的平均准确率低于90%。粒度神经网络在江苏和黑龙江产地的鉴别中,其准确率相比5 种常用算法在该产地的平均准确率分别高出4.64%和4.25%,并且在这两个省份的鉴别准确率均超过了91%。综上所述,粒度神经网络相较于其他5 种算法,能够更有效地区分不同产地的大豆。相比其他算法在处理产地鉴别不确定性方面的局限,粒度神经网络表现出更优的性能。
3
不同算法对比结果
为更全面地验证粒度神经网络模型在大豆产地鉴别中的可行性,计算宏平均下的多项性能指标。同时,鉴于CNN在多维数据上展现了强大的特征提取能力,本研究将引入CNN与粒度神经网络进行对比。各模型超参数设置如下:SVM使用高斯核函数,正则化参数为1。RF包含100 棵决策树,每棵树分裂时随机考察的特征数量为7。GBDT树的数量为100,学习率为0.1。XGBoost树的数量为100,学习率为0.3。标准神经网络包含2 个隐藏层,激活函数使用ReLU,优化器选用Adam,学习率为0.001,批次大小为200,最大训练轮数为5 000。CNN包含3 个卷积层,卷积核大小为3,池化大小为2,学习率为0.001,激活函数为ReLU。各算法的评价指标结果如表4所示。
由表4可知,在大豆产地鉴别中,CNN的准确率为92.18%,比标准神经网络高0.32%,但低于粒度神经网络2.68%。在宏平均精确率方面,除RF算法外,其余算法的精确率均超过92%。其中,粒度神经网络的精确率最高,为95.11%,分别比SVM、GBDT、XGBoost、标准神经网络和CNN高出2.8%、2.35%、2.2%、2.92%和2.51%。在宏平均召回率方面,对比算法中XGBoost的召回率最高,为93.05%,而粒度神经网络的表现更优,比XGBoost还高出2.24%。在宏平均F1值方面,CNN的表现优于SVM、RF和标准神经网络,而粒度神经网络则比CNN高出2.56%。综上所述,在基于形状-颜色-纹理特征组合的大豆产地鉴别任务中,粒度神经网络展现了较好的性能,验证了在该任务中的可行性和优越性。
4
结 论
本研究针对大豆产地的鉴别问题,提出一种基于粒度神经网络的方法。通过计算机视觉平台提取大豆的形状、颜色和纹理3 类特征,并按类别进行特征组合。此外,基于改进的信息粒化方法,定义了适用于神经网络的粒度计算规则,从而有效提升了大豆产地鉴别的准确性。主要结论如下:在基于单一类别特征的鉴别模型中,形状特征的分类效果最佳,平均准确率为88.01%。提出了一种基于粒度神经网络的大豆产地鉴别方法,整体性能优于多种对比机器学习方法。在不同特征组合的测试中,形状、颜色与纹理三大类共55 个特征组合取得了最优效果,粒度神经网络的准确率为94.86%,该结果优于使用单一特征或任意两类特征组合的方案。通过计算机视觉平台获取大豆数据并进行产地鉴别,该方法无需损伤大豆,能够实现大规模整批次的无损鉴别,为农产品溯源与品质控制提供了可行的技术工具。
未来的工作将引入气味信息以获取大豆产地的相关数据。电子鼻作为一种常用的无损检测工具,能够通过提取气味信息进行鉴别分析。未来将进一步结合计算机视觉技术与电子鼻所获取的数据,实现多源数据融合,从而提升大豆产地鉴别的准确率,实现更高效的无损检测。
第一作者:
傅兴宇,福建农林大学计算机与信息学院博士研究生,现就读于福建农林大学计算机与信息学院,研究方向为农业人工智能,以第一作者发表学术论文4 篇,《Food Control》期刊审稿人,获得2023年研究生国家奖学金。
通信作者:
林健,福建农林大学数字福建农林大数据研究所所长,福建农林大学计算机与信息学院教授,博士生导师,主要从事智能决策、大数据分析、农林资源管理等方向的科学研究工作。在国内外学术期刊上发表论文八十多篇,其中SCI、SSCI检索论文五十多篇。主持国家自然科学基金、国家社会科学基金、福建省自然科学基金、教育部人文社科基金、国家博士后科学基金(一等资助)、北京市智能物流系统协同创新中心重点项目等二十项。
引文格式:
傅兴宇, 林健, 翁佩琳, 等. 基于特征组合和粒度神经网络的大豆产地鉴别方法[J]. 食品科学, 2026, 47(11): 331-339. DOI:10.7506/spkx1002-6630-20251208-087.
FU Xingyu, LIN Jian, WENG Peilin, et al. Geographical origin identification of soybean based on feature combination and granular neural network[J]. Food Science, 2026, 47(11): 331-339. (in Chinese with English abstract) DOI:10.7506/spkx1002-6630-20251208-087.
实习编辑:陈师昀;责任编辑:张睿梅。点击下方阅读原文即可查看全文。图片来源于文章原文及摄图网
北京食品科学研究院、中国食品杂志社和全国糖酒会组委会将于2026年10月15-17日在江苏省南京市南京国际博览中心举办第115届全国糖酒会食品科技成果交流会。食品科技成果交流会期间举办食品科技成果展,本届科技成果展以我国当前食品产业科技需求为导向,重点邀请“十四五”以来获得国家和省部级重要科研项目支持产出的食品科技新成果、新技术、新产品参展,并针对企业技术需要开展精准对接服务。扫描下方二维码即可申请展位。
为进一步促进动物源食品科学理论的完善与创新,加速科研成果向实际生产力的转化,助力产业实现高质量、可持续发展,由北京食品科学研究院、中国肉类食品综合研究中心、中国食品杂志社与海南大学、海南热带海洋学院、江西农业大学共同举办的“2026年动物源食品科学与人类健康国际研讨会”,将于2026年11月14-15日(11月13日报到)在中国 海南 海口召开。
长按或微信扫码进行注册
会议招商招展
联系人:杨红;电话:010-83152138;手机:13522179918(微信同号)
热门跟贴