本文系Journal of Future Foods原创编译,欢迎分享,转载请授权

打开网易新闻 查看精彩图片

Introduction

如今,社会各个领域,包括食品风味领域都在不断生成大量数据。在线数据库、社交媒体平台和风味组学实验是包含食物风味有价值信息的主要数据源。然而,由于其复杂性和大量数据,有效整合并利用这些数据往往很困难。大量数据的复杂性给食品风味分析带来了重大挑战。最近的报告强调了数据挖掘技术在该领域的广泛应用。

食品风味的研究主要集中在具有复杂风味成分和商业价值的加工食品上。它涵盖了广泛的研究任务,每项任务都需要特定的技术和方法。这些任务可分为4 个领域:风味识别、食品分类、风味预测和配方开发。有研究对利用机器学习预测食品风味的各种数据挖掘技术进行了全面的综述;还有研究全面回顾了机器学习在通过风味分析识别食品真实性方面的优势;通过应用文本挖掘技术,在数据驱动的风味识别和配方开发方面取得了重大进展。此外,在风味化学中利用风味数据库也已成为数据挖掘的一种重要形式。

已有对风味研究中的数据收集和分析技术进行研究,而整合不同的数据源和扩展数据集以有效训练人工智能模型仍然是一个重大挑战。本综述全面组织了来自各种来源的数据,并根据其应用背景和数字化格式的特点对其进行了分类。为了最佳地利用这些数据,它使用先进的信息技术有条不紊地编译各种数据类型,并详细讨论了数据挖掘过程。它旨在为风味研究建立一个标准程序,包括数据收集、数据预处理、数据分析和数据可视化。因此,研究人员可以在食品风味领域的指导框架下提高数据的可解释性。

方法论

图1显示了基于检索到的文献的关键词的共现网络可视化。

打开网易新闻 查看精彩图片

图1基于关键词的文献计量图

风味研究中的数据挖掘概述

由图2可知,在大多数任务中使用的主要技术是偏最小二乘(PLS)、主成分分析(PCA)、方差分析(ANOVA)、随机森林(RF)和支持向量机(SVM)。

打开网易新闻 查看精彩图片

图2对近年来数据挖掘技术在食品风味方面的研究进行综述

数据收集

讨论了3 种数据来源和收集方法,阐明了它们在食品风味研究领域的作用。这3 个数据源是风味组学、在线数据库和社交媒体平台,其中包含各种类型的文本和图像数据。目前,风味组学仍然是最直接、最有效的数据收集方法。然而,由于数据量有限,它作为数据集在数据挖掘算法中的应用受到了阻碍。另一方面,必须充分利用来自在线数据库和社交媒体的大量数据。

对于风味组学的数据,本文列出了每种实验数据的收集方法,包含了气相质谱仪,电子鼻,高光谱成像等产生的数据。对于在线数据库,根据不同的数据的特点,将数据库归类为化学数据库,风味数据库和食谱数据库,并且针对这些数据的应用也进行了描述。对于社交媒体,重点综述如何使用python爬虫技术来实现对社交媒体数据的获取工作。经过大量文献调研,发现这些不同来源的数据之间也存在着依存关系。例如说,风味和化学数据库的开发依赖于通过风味组学技术鉴定化合物;用于风味组学研究的化合物鉴定通常利用来自这些风味和化学数据库的数据;食谱数据库的构建广泛利用了来自社交媒体平台的各种食品相关信息。

图3说明了各个数据源之间的关系以及相应的数据采集方法。

打开网易新闻 查看精彩图片

图3风味研究领域的数据来源和收集方法

数据预处理

数据预处理是数据挖掘的关键阶段,约占总工作量的60%。它对于确保收集数据的质量和效用至关重要,有4 个关键任务:数据清理、数据归一化、降重和数据转换。本文针对数据收集过程中产生的数据归纳总结各种预处理方法。

在风味组学中,数据预处理的对象主要包括质谱、各种形式的光谱、化学指纹、电信号和描述性风味术语。经调研发现,大部分风味组学仪器中自带了相关预处理的软件,只需要在通过仪器的操作就可以对产生的数据进行基线校准,峰值检测和去噪。除此之外,利用数据增强技术来提升数据量是目前风味组学领域较为新颖的预处理方法。

在风味和化学数据库中,数据预处理的对象主要是SMILES字符串和风味分子结构图。SMILES是由字母和各种符号组成的字符串,字母表示原子,符号表示化学键或分支。我们列出了3 种突出的预处理方法:(1)字符级标记化;(2)转化为分子指纹;(3)转化为分子结构图。分子结构图编码了详细的信息,如原子、化学键、同位素和邻接关系。为了使计算机能够从这些图中理解和预测分子的性质,将这些数据转换为数值或矢量形式至关重要。研究人员通常是利用深度学习模型来提取出图像中的特征。在食谱数据库中,数据预处理的对象主要是食材成分和烹饪过程这类的文本数据。预处理主要涉及3 个步骤:数据清理;数据编码以将文本转换为机器可读格式;数据归一化,标准化。为了增强特征提取,一些研究人员采用了基于自我注意机制的变换器模型来学习食谱文本特征。

在社交媒体中,预处理技术包括数据清理、降噪、关键字过滤和特征提取。此外,将情感分析和定量评分系统应用于用户评论可以减轻个人主观性,提高数据可信度。情感分析采用机器学习的分类模型来评估评论中表达的情感倾向,以提取更中立和客观的观点。定量评分系统侧重于文本中的特定关键字。例如,预先建立味道、质地和外观等预定义标准,以收集基于食物风味的用户评价。

图4给展示了不同数据的预处理工作流程,并列举了具有代表性的预处理方法。

打开网易新闻 查看精彩图片

图4 基于数据类型进行预处理的工作流程

数据分析

数据分析是将这些数据实现其价值十分重要的环节。上文提到基于风味组学的数据分析任务有以下4 种:风味预测、风味鉴定、食品分类和配方开发。

风味预测是指利用化合物的组成与样品感官属性之间的关系来预测各种条件下食品风味的变化。通常,研究人员利用PCA、PLS等手段来构建化合物成分和感官描述之间的非线性关系。风味鉴定的主要目的是探索样品中的主要化合物如何影响其风味属性。主要方法包括对获得的风味组学数据进行分类和组织,以识别对食品风味有重大贡献的关键化合物。然后使用化学数据库识别这些化合物。食品分类通常用于检测掺假食品和质量控制等任务。通常,研究人员使用SVM、RF等机器学习方法来区分食物之间的细微差别。食谱开发是基于食物配对的原则。在添加新食材的过程中也要确保风味上不冲突。目前,许多研究学者正在构建基于食谱的更具结构化的数据格式,例如FlavorGraph这样的知识图谱。并且,GPT(大型预训练变形器)等大语言模型的日益普及为菜谱创新提供了新的处理方法。研究人员已经开始探索使用LLM进行细粒度菜谱生成的工作,旨在克服在个性化建议和理解更复杂的语义细微差别方面的挑战。

图5说明了数据驱动的食品风味应用任务的分类以及每个任务所采用的相应的数据分析方法。

打开网易新闻 查看精彩图片

图5数据挖掘技术在食品风味中的应用

第一作者

打开网易新闻 查看精彩图片

吴棋涵,现为江南大学人工智能与计算机学院研究生,主要研究方向为基于食物风味组学的数据挖掘研究;基于食谱的自然语言处理技术;少样本的命名实体识别。

通信作者

打开网易新闻 查看精彩图片

辛星,江南大学未来食品中心副教授,中国食品科学技术学会会员,新西兰皇家学会青年会员,中国可再生能源学会会员,担任食品与化工领域SCI期刊审稿专家。研究聚焦风味产品的开发,生物质资源的高附加值利用以及食品过程的数字化。2024年入选江苏省“双创”教育类人才和福建省“百人计划”(B类高层次人才)。累计发表SCI论文20余篇,中国专利多项。主持3 项纵向科研项目,多项企业横向课题,累计金额300余万。

Advances in data mining for food flavor analysis: a comprehensive review of techniques, applications and future directions

Qihan Wuab, Jiawen Yuanab, Jie Zhouab, Shuai Yuc, Xing Xinad*, Jin Liue, Xiaohui Cuia*

aScience Center for Future Foods, Jiangnan University, Wuxi 214122, China

bSchool of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi 214122, China

cDepartment of Chemical and Materials Engineering, University of Auckland, Auckland 1010, New Zealand

dSchool of Food and Advanced Technology, Massey University, Palmerston North 4442, New Zealand

eSchool of Computer Science, Wuhan University, Wuhan 430072, China

*Corresponding authors.

Abstract

In the field of flood flavor, there exists a substantial amount of structured and unstructured data originating from flavoromics, databases, and social media. To effectively extract valuable information from these diverse data sources and promote rational application, extensive data mining efforts have been undertaken. This review provides a systematic overview of data mining in the context of food flavor and summarizes various multivariate data processing strategies. This review examines a wide array of current research in flavoromics and discusses pre-processing methods designed to address challenges such as small dataset sizes and complex manual data preparation. Furthermore, this review summarizes innovative approaches based on artificial intelligence and large language models, elucidating their prospective applications in flavor molecule prediction and recipe development. Lastly, we discuss the challenges and opportunities of applying data mining to flavor research.

Reference:

WU Q H, YUAN J W, ZHOU J, et al. Advances in data mining for food flavor analysis: a comprehensive review of techniques, applications and future directions[J]. Journal of Future Foods, 2026, 6(4): 519-532. DOI:10.1016/j.jfutfo.2024.12.002.

打开网易新闻 查看精彩图片

文章翻译由作者团队提供

编辑:龚艺;责任编辑:梁安琪

封面图片来源:摄图网

Future Foods | 用GC×GC-TOF MS构建麦芽威士忌新酒的感官词典J. Future Foods | 1-甲基环丙烯对北虫草贮藏品质的影响

J. Future Foods | 基于代谢组学结合网络药理学探究酸枣仁治疗失眠的活性成分及机制

J. Future Foods | 基于代谢组学的银耳低分子质量多糖对秀丽隐杆线虫的抗氧化活性研究

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

北京食品科学研究院、中国食品杂志社和全国糖酒会组委会将于2026年10月15-17日在江苏省南京市南京国际博览中心举办第115届全国糖酒会食品科技成果交流会。食品科技成果交流会期间举办食品科技成果展,本届科技成果展以我国当前食品产业科技需求为导向,重点邀请“十四五”以来获得国家和省部级重要科研项目支持产出的食品科技新成果、新技术、新产品参展,并针对企业技术需要开展精准对接服务。扫描下方二维码即可申请展位。

为进一步促进动物源食品科学理论的完善与创新,加速科研成果向实际生产力的转化,助力产业实现高质量、可持续发展,由北京食品科学研究院、中国肉类食品综合研究中心、中国食品杂志社与海南大学、海南热带海洋学院、江西农业大学共同举办的“2026年动物源食品科学与人类健康国际研讨会”,将于2026年11月14-15日(11月13日报到)在中国 海南 海口召开。

长按或微信扫码进行注册

会议招商招展

联系人:杨红;电话:010-83152138;手机:13522179918(微信同号)