当NBC环球筹备一场大型颁奖礼直播时,数据团队不再需要提前几个月预留大量计算槽,也不用担心流量洪峰冲垮报表系统。过去,为了支撑多部门并发的查询需求,他们必须提前锁定成百上千个“槽位”,哪怕平时大部分闲置,也要为峰值买单。如今,这套运行了多年的预留模式已经被一整套按需扩展的体系替代。

作为拥有百年历史的媒体巨头,NBC环球旗下囊括广播电视、有线频道和流媒体网络,每天都有海量用户行为数据涌入,支撑着从内容排播、营销决策到广告投放的实时判断。然而,随着原创内容爆发和直播活动密集,原有的数据基础设施逐渐显露出疲态:底层采用基于槽位预留的计算模型,多个团队并行分析时不得不争夺固定资源,导致计算成本居高不下,同时限制了机器学习等高级负载的灵活性。

打开网易新闻 查看精彩图片

“公司一直在推进数据可及性,让更多团队能快速获取洞察,这要求我们找到一种更敏捷的方式。”NBC环球数据技术与产品高级副总裁Kevin Hill这样描述当时的处境。换句话说,分析师们渴望更快地出报表,工程师们希望把时间花在分析上,而不是反复搭建管道——原有的架构已经无法匹配组织进化的速度。

变化源于一次与Databricks以及服务商EXL的合作迁移。NBC环球果断把分析环境和机器学习平台统一到Databricks上,采用“按作业指定计算”的弹性架构取代此前的预留槽机制,并把300多名分析师平稳迁移到Databricks SQL的交互式分析环境。迁移完成后,最直观的结果是数据基础设施成本下降了30%,而大规模并发查询的场景不再需要人工预留闲置槽——系统会随高流量事件自动伸缩。

弹性扩缩的好处很快在内容运营中显现。每逢重大剧集首播、体育决赛或王牌节目上线,数据查询量会短时间内飙升数倍,过去只能靠冗余槽位硬扛,现在几乎无所感知。NBC环球数据工程副总裁Louie Kuznia强调:“今天的内容生态演变非常快,我们的业务伙伴需要比以往更敏捷的决策支持。这次迁移让我们在不牺牲速度和灵活性的前提下,完成了基础设施的现代化。”

统一平台的价值还不止于报表层的性能优化。迁移过程中,NBC环球借助MLflow实现了机器学习工作流的统一管理,又通过Lakeflow Jobs打通了批流一体的数据处理。分析师可以在同一个环境里直接调用训练好的模型,无需切换工具栈。这种将BI与AI无缝衔接的方式,彻底解开了过去数据工程与数据科学割裂的死结。

如果非要“挑刺”这场迁移,唯一的代价或许是团队在切换初期需要适应新的SQL语义和工作流。但从最终成果来看,300余名分析师顺利过渡,迁移期间并未出现关键报表中断,反而因为弹性伸缩免去大量以前的手动扩容操作。在媒体行业普遍需要实时数据驱动内容分发和营销决策的当下,NBC环球给出了一个务实的参照:用按需计算替代固定预留,让基础设施真正为业务高峰服务,而不是为峰值持续付钱。