摘要

DTCC 17 年的 1,606 条内容揭示了:国际产品、开源生态、国产数据库、云原生和 AI 先后进入主场,见证中国数据库行业,从「可控」、「替代」到「创新」的蜕变。

正文

DTCC 是数据库圈一年一度的盛世。每一年的热点都很新,但有时后又觉得每一年的争论又都似曾相识。以前,我们讨论:Oracle 的时代过去了吗?Hadoop 会不会重写数据架构?云会不会让 DBA 消失?最近这两年,我们又讨论,向量数据库是不是大模型时代的新底座?

2026 年的 DTCC 已经闭幕,这是第 17 届大会。这些问题出现过多少次?谁一直留在议程里?中国数据库产业又是怎样从使用国际产品,走到国产产品进入主场,再走到今天争夺 AI 数据底座?

我把 DTCC 2010—2026 年官方归档重新整理了一遍。

先说明一下,原始数据有 1,625 条议程条目。排除问答、致辞、无主题占位内容和纯仪式环节后,留下1,606 条演讲与圆桌内容。2026 年的数据是 2026 年 8 月 22 日的官方议程快照,后续议程如果调整,数字也需要刷新。

我将用三个角度:产业供给、技术演进、行业应用,基于 DTCC 历年的演讲主题带大家看中国数据库的发展和变化。另外,我也分类统计了这些主题中,数据库内核、工具平台,案例和架构,看看这些年来大家最喜欢用什么角度来分享自己的技术。

先说明边界:这是议程标题分析,不是 1,606 篇演讲全文的语义分析。技术和内容层次都允许多标签,因此比例不能相加为 100%。中外产品比例只计算标题中明确出现数据库或数据存储产品名的内容,并按产品最初研发组织所在地区分类;它不代表市场份额、客户数、装机量或技术排名。

一、17 年 5 次主场更替

下面这张年度温度表只放四组信号:当年内容数、最强技术方向、明确产品名标题中的国产产品占比,以及 AI、向量与 Agent 议题占比。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

图1 DTCC年度主题变化

图1|DTCC 17 年年度内容数量、最强技术信号、国产产品标题占比与 AI 议题占比。

注:“仅国产产品标题占比”的分母是当年明确出现纳入统计数据库产品名的内容。中外产品同时出现、来源仍待确认的标题分别列入混合类和待定类,没有硬塞进任何一边。

这 17 行不是一条平滑曲线,更像五次换挡。

  • 2010—2012 年,用好数据库。这个时期没有革命,也没有创新,数据库首先要稳定和高效。因此,性能、高可用、备份、恢复、监控最密集,国际产品是主要讨论对象。
  • 2013—2016 年,大数据“革命”。Hadoop、HBase、数仓和实时计算把过去哪些笼统叫作“数据库”的工作拆成更多系统。2014 年,大数据、数仓与数据湖的主题占到 36.4%。
  • 2017—2019 年,交付方式“革命”。云、分布式和开源共同改变产品。大家不在单纯讨论数据库如何部署管理,以及单纯做产品比较。这个阶段,更多主题转向怎样迁移、服务化、自动化和持续运营。
  • 2020—2023 年,国产数据库密集进入议程。竞争也很快从“有没有”转向分布式、云原生、迁移工具、兼容性和一体化能力。
  • 2024—2026 年,AI、向量与 Agent 成为最大变量。2025 年相关内容达到 38.6%,2026 年达到 55.1%。数据库大会开始直接讨论模型怎样连接数据、Agent 怎样保存记忆,以及数据怎样变成可行动的上下文。

二、国产数据库不是突然走到主场的

把 17 年压缩成五个阶段,产品来源变化更直观。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

图2 国产国际产品结构

图2|五个阶段中,明确出现数据库产品名的标题来源结构。

我还做了一次口径敏感性检查。把 Hadoop、Spark、Flink 等数据与计算平台放进更宽的“数据产品”口径,2017—2019 年仅国产比例会从 30.1% 降到 25.7%;但五个阶段从低到高的方向没有改变。

真正的转折也不发生在某一个口号出现的当天。

  • 第一阶段,人大金仓于 1999 年成立,达梦于 2000 年成立,南大通用于 2004 年成立,神舟通用于 2008 年成立,中国数据库厂商开始持续走向产业化。但在 DTCC 大会举办初期,大多数主题围绕的依然是国际品牌的数据库产品,以及来自互联网和电子商务企业的实践。(来源:人大金仓、达梦、南大通用、神舟通用)
  • 第二阶段,是互联网规模逼出自研能力。阿里、腾讯分分加入自研的行列。阿里开源发布的 Cobar,后来发展成 MyCat、TDDL、DRDS;而进入云时代阿里云又发布 PolarDB 作为主要自研产品。OceanBase 陆续承接 “双 11” 交易库部分流量,和支付宝全部核心库流量。腾讯 TDSQL 伴随其全民社交和支付场景的发展,也成为了多个核心业务的关键数据库系统。阿里云、腾讯云、火山云、华为云、百度云等也陆续推出自己的云数据库产品。
  • 第三阶段,是国产数据库进入金融、电信、政务和大型企业核心系统。中国信通院 2021 年报告统计,国内数据库产品已经达到 135 款,其中关系型 81 款、非关系型 54 款。此后产品数量在 2022—2024 年快速增长,2024 年达到 269 款的峰值;2026 年明显回落到 182 款。(来源:《数据库发展研究报告(2026年)》发布解读)

产品数量上来以后,问题马上变成:能不能迁、能不能管、能不能兼容、能不能长期运行、能不能建立生态。

所以,国产化不是一场简单替换。替换只是入场,工程体系才决定能否留下。

三、内核、工具和案例,谁才是大会的主体?

这一部分实际上是挺难做分类的,所以我也不再强迫每个标题只能选一个类别。同一标题可以同时属于案例、架构和工具,所以这些数字不能相加。

在 1,606 条内容中:

  • 63 条明确讲解数据库内核与引擎,占 3.9%;
  • 338 条涉及工具、平台与运维,占 21.0%;
  • 742 条带有案例、实践、应用、建设或落地信号,占 46.2%;
  • 460 条涉及架构与技术方案,占 28.6%;
  • 376 条没有命中上述内容层次,占 23.4%。

打开网易新闻 查看精彩图片

图3 大会内容层次分布

图3|1,606 条内容的多标签层次分布;同一主题可以同时命中多个层次。

对于这组数字,我的解读是:内核议题一直存在,但数据库大会的大部分讨论会把技术放进工程系统和业务现场。

我们把这组数据解读为“大会的嘉宾只爱案例,不讲内核”。因为,数据库行业的竞争从来不只在内核。数据库的监控、诊断、容灾和工具链,决定一个产品能不能从测试环境走进核心系统。而是否易于迁移、兼容能力和服务体系,决定了客户是否可以成功完成升级替换,以及放心地长期运行。内核决定能力上限,工程体系决定市场认可。

数据库是马拉松式的长跑,任何吹嘘的行为都注定是昙花一现,只有用户长期稳定使用才是胜利。

四、哪些行业给数据库提供了最多问题?

742 条案例与实践类内容中,如果看标题结合演讲嘉宾就只机构统计,互联网与电子商务的主题有 162 条,金融 108 条,占案例类内容的 21.8% 和 14.6%。它们是最密集的两个行业,但合计约 36.4%,并没有超过一半。互联网把并发、规模和成本推到极限;金融把一致性、连续性和责任边界推到极限。这两类压力确实长期塑造 DTCC,但它们不是全部。

同一口径下,通信 22 条,制造与工业 13 条,交通物流 12 条,教育 8 条,零售与生活服务 6 条,政务 4 条,医疗与健康 2 条。

剩余 418 条案例与实践类内容,无法根据标题和演讲者的机构稳定归入某个具体行业。它们不是另一个统一的“其他行业”,而来自跨行业工程问题和厂商产品实践,例如有:

  • 工具、平台与自动化 86 条
  • 大数据、数仓与湖仓 74 条
  • 性能与成本 51 条
  • 分布式与一致性 49 条
  • AI、向量与 Agent 48 条
  • 开源与生态 40 条
  • 高可用与运维 36 条
  • 云原生与专用、多模数据各 35 条
  • 数据安全与治理 24 条。

打开网易新闻 查看精彩图片

图4 跨行业工程主题分布

图4|418 条无法稳定归入具体终端行业的案例,主要讨论的工程与产品问题。

同一主题可以同时命中多个技术方向,因此这些数字不能相加;其中包括数据库诊断与调优、迁移与同步、开源数据库实践、数据平台建设、图与时序数据处理等跨行业主题。

而未来,数据库与 AI 真正走进这些行业时,挑战可能不再只是吞吐量,而是数据含义、责任、版本、来源和长期可解释性。

五、厂商角度我不看奖项,而是看他们的议程轨迹

493 条内容明确出现数据库产品名;部分标题同时提到多个产品,因此累计形成 519 次产品标记。

如果只看总数,MySQL 产品家族 78 次,占 15.0%;Oracle Database 与 Exadata 62 次,占 11.9%;GaussDB/openGauss 40 次,占 7.7%;PostgreSQL 产品家族 28 次,占 5.4%;OceanBase 与 TDSQL/CynosDB 各 25 次,分别占 4.8%。

但比总数更有价值的是轨迹。

  • MySQL:2010—2026,78 次。最密集的阶段是 2017—2019 年,常见议题是开源生态、性能和内核。从《MySQL Cluster 数据库集群高可用设计及应用》到《AliSQL 深度融合 DuckDB》,一直反复贯穿互联网工程与开源生态的发展。
  • Oracle Database/Exadata:2010—2025,62 次。最密集的阶段是 2013—2016 年,常见议题是性能、工具和迁移。它既是早期工程实践的重要对象,也长期作为国产化和上云迁移需要跨越的参照系。他不对地“被超越”,但在技术圈中也一直都是一众厂商长期的“假想敌”。
  • GaussDB/openGauss:2020—2025,40 次。其中 27 次集中在 2020—2023 年,议题从高可用、云原生和开源生态,延伸到向量检索与 RAG。它的议程一直伴随着国产化进程,开源推动、商业化互相交织。
  • PostgreSQL:2011—2026,28 次。它没有在某一年突然爆发,却连续跨越开源应用、分布式、高可用、云和事务内核。它在议程中的特点不是一次热点,而是一条不断向外延伸的长线发展。
  • OceanBase:2011—2026,25 次。议题从“千亿级海量数据库”,走到金融核心、HTAP、一体化,再到 2026 年的 AI 湖库。一直聚焦于分布式数据库怎样从互联网规模进入核心业务,并继续面对新的数据形态。
  • TDSQL/CynosDB:2015—2026,25 次。第一条代表性议题是微众银行核心交易系统实践,近年的题目已经走到面向 Agent 的多模数据底座。议程轨迹连接了金融核心、自主可控与 AI 数据基础设施。
  • 达梦/DM 产品家族:2011—2025,17 次;GBase:2016—2025,12 次;GoldenDB:2019—2026,8 次;人大金仓:2012—2024,5 次。它们分别在分布式、自主创新、多模、金融核心、融合架构和行业交付上留下不同轨迹。把它们压缩成同一个“国产替代”标签,反而看不见各自真正持续投入的问题。

打开网易新闻 查看精彩图片

图5 数据库产品议程轨迹

图5|519 次产品标记的头部与长尾结构,以及产品提及次数前十。

清理“前某公司”等历史任职误计后,阿里生态相关团队出现在 129 条内容中,腾讯相关团队 94 条,华为相关团队 68 条,京东 54 条,百度 47 条。可以看到这些机构长期把自己的规模、客户和工程创新的问题以及解决方案时间带进了大会。

对厂商来说,最有传播价值的“光环”不该是天天喊着“领先、超越”的口号,而是:在产业转向中,自己给数据库产业带了什么创新。

六、AI 会让「创新」成为主场吗?

“信创” 不等于 “替代”,「创新」才是真正进入主旋律。最后的这一节的开篇可能有点沉重。

2011 年我和多位朋友成立 Postgres 中文社区。那个年头大家都在讲「自主可控」争论集中在开源产品是否可以算是「可控」,怎么通过最小代价来实现「兼容替代」。当时我就在想,如果厂商都把精力都放在兼容性上,我们就只是依葫芦画瓢抄作业,不会得到进步。

2019年 「信息技术应用创新」首次被提及,这个提法我是很兴奋的。但在实际市场化的执行中,结果却很骨感,“信创”和“替代”被直接关联,甚至直接出现“信创替代”这个新词。而「创新」这个最重要的关键点,却往往被人们抛诸于脑后。

2025 年,AI、向量与 Agent 第一次成为 DTCC 大会年度最强主题信号;2026 年已经占到 55.1%。沿着前各次主场更替,新技术通常不会简单杀死旧技术。Hadoop 没有杀死数据库,云没有消灭 DBA,国产数据库也没有让迁移和生态问题自动消失。

AI 带来的「创新」绝对不只是增加一个了向量类型,或带动图数据类型的使用。当 Agent 开始读取文档、调用工具、保存记忆并修改业务状态,数据基础设施要回答的不只是“哪条记录最相似”,还包括信息来自哪里、什么时候有效、与谁冲突、能否成为下一步行动依据。

数据库产业的下一轮竞争,必将聚焦于 AI 的「创新」:新能力先从边缘长出来,证明价值,再迫使整个数据体系重新划分责任。

AI 时代,期待 DTCC 沿着数据库这一主线,不断记录下一轮 AI 复杂性需求,究竟应该由谁承担。

下一篇,我会换一个视角。不是继续看 1,606 条内容,而是回到我自己六次站上 DTCC 讲台的经历:行业分别转向分布式、云、湖仓和 AI 时,讨论作为技术人怎样和业界一同发展,持续把握市场新的机会。

参考资料

DTCC 官方历届议程:2010、2011、2012、2013、2014、2015、2016、2017、2018、2019、2020、2021、2022、2023、2024、2025、2026

数据说明

完整统计保留了原始议程条目、19 条排除项、逐条多标签分类、版本化产品词表、严格与宽口径敏感性结果。产品家族会合并明确关联的名称,例如 MySQL 家族包含标题中的 MySQL、InnoDB、MyRocks 和 AliSQL;TDSQL/CynosDB 作为腾讯数据库产品轨迹合并展示。两条产品来源仍待确认的内容单独列入待定,不影响国产或国际任何一边。

作者介绍:

萧少聪 Scott(微信:xiaoshaocong | 公众号:Dataer数人)。Cortrix.AI 语义存储开源项目联合创始人;PostgreSQL 中文社区及PG分会联合创始人。前阿里云 RDS 产品负责人;前华为存储产业专家;前红帽 RHCA 认证讲师。