在数据管道开发中,变更数据捕获(CDC)是最常见也最繁琐的任务之一。过去,工程师需要手写数百行脆弱的 MERGE 逻辑,才能实现缓慢变化维(SCD)和快照同步。现在,Apache Spark 声明式管道(SDP)中的 AUTO CDC 用几条声明即可完成这些工作,但标准模式仍难以应对双时态乱序、部分字段更新和审计留存等挑战。

为此,AUTO CDC 正式引入双时态(Bitemporal)历史跟踪,让业务时间和系统时间两条时间线独立演进,既能查询事实何时变化,也能还原系统在任意时刻的“认知”;同时新增部分更新(Partial Updates)能力,为缺失字段提供安全合并,避免覆盖已有数据。更重要的是,这些能力已随 Apache Spark 4.2 进入开源生态,使更广泛的用户能够获得标准化、乱序友好的 CDC 支持。

打开网易新闻 查看精彩图片

从满足 SEC 17a-4 合规要求,到让机器学习训练数据在 VACUUM 清理后依然可复现,AUTO CDC 正在把最棘手的真实场景变成声明式配置,工程师得以彻底摆脱手写 CDC 的负担。