提到MLOps,多数人脑子里浮现的画面是:训练模型、验证、打包、部署上线。就算基础设施分了开发、测试、生产三套环境,它们也通常属于同一个IT体系,网络稳定,管理原则一致。但在工业企业里,这个假设往往不成立。
一个ML系统可能横跨多个地理位置,穿过企业网和技术网,连接工业设备,运行在部分隔离的网段里,还得在中央环境断网时保持可用。这就是工业MLOps和普通MLOps的本质区别——它不是“更复杂的CI/CD”,而是管理一套跨越不同信任边界、运维约束和可用性要求的分布式ML系统。
一个ML生命周期,多个运行环境
为了把这件事讲清楚,文章引入了一家虚构公司:Northstar Mining Group。这家假想的矿业公司有一个总部和三个选矿厂——Aurora Plant、Red Valley Concentrator、Silver Ridge Processing Site。所有名称均为虚构,不代表任何真实公司架构。
Northstar的一个ML用例是浮选优化模型。它分析矿石特性、矿浆参数、药剂消耗、充气指标等工艺变量,给出能提升回收率或减少药剂浪费的操作建议。这个例子能直观说明:无论底层是云、裸金属还是混合架构,工业MLOps都会比传统集中式ML环境复杂得多。
大型工业企业的MLOps很少只存在于单一平台。有的系统负责模型开发和训练,有的支撑集中治理或企业级ML服务,有的直接连到本地生产运营。一个典型的技术版图可能包含:企业IT环境、企业数据网络、DMZ或传输区、厂区技术网络、本地生产网段。
为什么工业架构要把环境分开?
先定义三个关键术语,理解这些环境为什么必须隔离。
企业网络:承载常规企业IT系统的地方——员工服务、业务应用、分析方案、开发环境、数据存储和集中式基础设施服务。它的职责是支撑公司业务和IT运营。
问题在于:当模型要部署到厂区技术网络甚至生产网段时,它面对的是完全不同的信任边界。企业网络里的数据可以自由流动,但到了生产网段,每一次数据传输都要经过审批和隔离检查。这不是流程繁琐,而是工业安全的底线。
更麻烦的是可用性要求。企业网络断网半小时,最多是员工没法用OA。但生产网段的模型如果因为断网而失效,可能导致整条产线停摆。工业MLOps的核心挑战,就是在这种多环境、多信任边界、多可用性要求的前提下,让ML系统仍然可靠运行。
Northstar的浮选优化模型就是一个典型例子:它在总部训练,在厂区的技术网络里做推理,还要在中央连接中断时继续工作。这意味着模型不仅要“部署”到生产环境,还要能在离线状态下自主决策——这已经超出了传统MLOps的范畴。
热门跟贴