数据采集和生成的速度越来越快,但标准化数据的能力却跟不上。这个差距如果不靠自动化来填补,就会成为瓶颈——分析被推迟、解读变复杂、共享数据集的价值也打了折扣。

元数据协调(即统一标签、标识符和格式,让不同来源的数据集能够协同工作)目前仍以人工为主。AI驱动的元数据纠错与协调正在改变这一局面,把元数据管理从耗时的工作变成能随数据量扩展的流程,为开放科学铺路而非设障。

打开网易新闻 查看精彩图片

这套系统怎么运作?

本文展示AI元数据纠错的实际应用,探讨两种实施路径——从人在回路的验证到完全自主的智能体驱动工作流——并给出在企业内部署这类方案时的治理考量。

基于AWS的集中式元数据纠错工作流

为解决上述挑战,开发团队构建了一套基于AWS的集中式元数据纠错与协调工作流,目标是让不同来源的元数据保持一致性、互操作性和准确性。系统组件包括:

  • Amazon Bedrock:提供大语言模型(LLM)驱动的模式对齐和纠错建议
  • Amazon S3:存储模式和结果
  • Amazon DynamoDB:跟踪任务状态
  • Amazon Cognito:负责身份认证
  • Amazon ECS:提供计算资源

工作流中包含一个协调包,负责对齐元数据模式、验证数据完整性并生成纠错建议。

循环式工作流:验证→建议→人工确认

元数据纠错与协调系统以循环方式运行:引导数据通过验证、生成建议,然后把控制权交还给用户做最终审批。

用户上传元数据文件后,系统并行执行两条验证流:模式对齐检查列结构是否符合预期格式,元数据字段验证检查各字段值是否合规。发现问题时,系统生成针对性的纠错建议并呈现给用户,由用户对更改保留最终决定权。

这种人在回路的做法,让自动化加速流程的同时,保留了研究人员的控制权和领域专业知识。

模式对齐:第一步是比对源与目标模式

元数据纠错的第一步,是比较源数据模式与目标数据模式:确认正确的列存在且对齐无误。常见问题包括命名约定不一致(同义词、拼写错误、缩写)、列缺失或多出,以及需要拆分或合并列的情况。系统采用模糊字符串匹配技术来处理这些差异。