智东西作者 王涵编辑 漠影
打开网易新闻 查看精彩图片
智东西作者 王涵编辑 漠影

AI落地的真正拐点,已经不在模型本身。

当通用大模型足够强、足够便宜之后,企业突然发现:真正卡脖子的,是自己的数据。散落在各处的交易记录、文档、图片、日志,以及那些还没被整理的向量,能不能被Agent真正用起来?

正是这一问,把数据层推到了台前。当数据库的使用主体从人变成了海量Agent,数据类型从结构化扩展到多模态,要求也从“存得下”变成了统一管理、实时检索、语义理解与安全合规。

这些变化正在重写整个数据市场的边界。

9月10日,2026 Inclusion·外滩大会《数智进化:让多模态数据成为AI核心燃料》见解论坛上,IDC中国企业软件市场研究经理王楠发布最新研究

研究重新划定了“AI数据基础设施”的版图,并给出清晰判断:中国市场将从2025年的约149亿美元,增长到2030年的738亿美元,到2035年有望达到约1万亿人民币规模。

万亿级新市场正在打开,而最先卡位的,将是那些真正能把数据变成AI燃料的底座。

一、大模型不适配真实生产环境,企业选择“小模型微调+多模态底座”

通用大模型直接搬进企业生产环境,会遇到几堵绕不过去的墙。

第一堵墙是成本。

通用大模型参数量大、推理开销高,企业业务中每一次调用都在消耗算力。对于高频、规模化的生产场景,全量调用通用大模型的token成本和GPU算力开销,企业实在吃不消。

第二堵墙是延迟。

企业在线业务对响应时间的要求是毫秒级,而通用大模型动辄数秒的生成速度,无法嵌入交易、风控这类实时链路。

第三堵墙是幻觉与口径。

通用大模型缺乏对企业自有数据口径、业务规则和行业知识的理解,直接使用会导致回答失真。IDC在报告中提到,口径不一会导致AI回答失真,企业因此正在优先考虑数据质量、数据血缘和元数据,以确保AI输出的一致性和可信度。

第四堵墙是数据隐私与领域适配。

在金融、政务等强监管行业,数据不能出域,通用大模型无法直接接触企业核心数据;而行业知识散落在企业内部的文档、报表、流程系统中,通用模型既不掌握,也难以获取。

瓶颈既然在数据,解法也落在数据。

IDC此次研究给出的企业选型建议中,明确列出了一条关键路径:拥抱“小模型+多模态底座”模式——聚焦构建强大的多模态数据底座,结合行业知识与场景数据,通过小模型微调实现高效、可控的生产级AI落地。

企业不需要在每一个业务环节都调用参数量最大的通用模型,而是用自有场景数据微调出小模型,让模型在特定任务上足够专、足够快、足够便宜。

而微调的前提,是企业能够把散落在各处的数据——结构化的交易记录、半结构化的日志、非结构化的文档图片,以及AI原生需要的向量数据——统一管理起来,形成可供模型消化的“燃料”

这解释了为什么多模态数据底座成为必选项。

IDC数据显示,企业新生成的数据资产中约90%为非结构化形态,文档、图片、音视频正在成为数据资产的主体。传统数据架构主要围绕结构化数据设计,处理这部分数据的能力缺口直接制约了AI落地。

二、新路径给数据基础设施带来冲击,万亿新市场诞生

“小模型+多模态底座”的生产级路径,对传统数据基础设施的冲击是全方位的。

蚂蚁集团基于OceanBase的实践显示,当Agent成为基础设施的使用方,其数量级远超人类工程师。据介绍,蚂蚁内部的AI应用平台“灵光”已累计生成数千万个“闪应用”,平均每个仅百余行数据,99%处于沉睡状态,极少数被唤醒时却要求秒级响应。

这意味着数据底座要解决的不再是把一个库做大,而是让百万级、千万级的库高密度共存、按需唤醒。

数据体量本身也在快速膨胀。IDC预计,中国数据生成量将从2025年的76.05ZB增长至2030年的146.65ZB,五年接近翻倍

面对这个被重构的市场,IDC此次没有沿用传统的数据库、数据仓库分口径统计,而是重新划定了“AI数据基础设施”的市场边界,将其划分为三大子市场

  • AI数据管理平台:承担多模态数据的统一管理和处理,是AI应用的数据底座。这是规模占比最高的子市场。
  • AI数据智能:利用AI提升数据治理、分析和使用效率,包括AI辅助数据治理(用生成式AI提高数据目录、分类分级、质量检测、知识抽取和文档理解效率),以及Data Agent与数据产品。这是增速最快的子市场。
  • AI数据服务:从传统数据标注向更复杂的数据工程和数据运营体系升级,RAG知识库持续运营、Agent轨迹数据集构建、行业数据集更新等持续性服务占比持续提升,多模态非结构化数据爆发带动多模态、合成数据服务扩张。

打开网易新闻 查看精彩图片

据IDC数据,2025年中国AI数据基础设施市场规模约为149亿美元。IDC预测,2030年达到738亿美元,2025年至2030年复合增长率37.7%;到2035年达到1548亿美元(约合人民币1万亿元),较2025年增长超过10倍

打开网易新闻 查看精彩图片

数据基础设施市场的天花板,已经从百亿级的数据库市场,切换到万亿级的AI数据基础设施市场。

三、OceanBase的新卡位:AI数据基础设施的底座与入口

IDC报告还提出,未来的竞争在于谁能够率先形成覆盖“数据管理—数据智能—数据服务—Agent消费”的完整闭环,而OceanBase的产品体系正在这一方向上布局。

2026年6月29日,OceanBase发布面向AI时代的湖库一体AI数据库,核心思路是将数据湖的开放与海量存储能力、数据库的事务处理与分析能力,以及多模态数据处理能力,统一到一套数据架构中,为AI应用和Agent提供统一的数据基础。

  • OceanBase Lakebase:湖库一体的 AI 湖库,原生支持结构化、半结构化、非结构化等多模态数据统一管理与处理,并融合实时分析、混合搜索及开放计算等能力。

打开网易新闻 查看精彩图片

  • Lakebase同时提供DataStudio等数据生产、治理和服务能力,以及面向Agent场景的数据沙箱,支持大规模生产级 Agent基于真实数据快速创建隔离环境,用于Agent评测、实验和验证。

打开网易新闻 查看精彩图片

  • OceanBase DataPilot:面向经营分析和业务决策的数据智能Agent,作为企业业务数据的智能入口,让业务人员通过自然语言完成数据分析、报告生成和可信答案获取,将底层数据能力进一步转化为业务智能。

打开网易新闻 查看精彩图片

  • AI数据生态: OceanBase同时通过seekdb、ConyrxtSeek等开源项目持续拓展AI数据与Agent生态,进一步打通从数据到AI、从AI到Agent的技术链路,让数据基础设施能够更直接地支撑AI应用的构建与运行。

这套产品组合正好对应IDC给出的市场分类的核心板块:Lakebase和seekdb对应AI数据平台,DataPilot和AgentSeek对应AI数据智能,DataStudio和持续数据服务对应AI数据服务。

OceanBase,承担起了AI应用和Agent的统一数据底座与数据入口的新角色。

四、目标是Databricks,OceanBase的增长空间才刚刚打开

市场格局变化了,OceanBase的价值自然需要重新定位。

传统数据库公司的估值逻辑,看的是市场份额、收入、利润和云化进度。在这个框架下,OceanBase面对的是分布式事务型数据库市场,天花板清晰可见。

然而,AI数据平台的估值逻辑看的是另一组指标:TAM(总可触达市场)、平台化能力、Agent数据入口、生态闭环、全球对标

按照这个标准,OceanBase的价值定位标杆就是Databricks

这家2013年由Apache Spark创始团队创立的公司,2026年8月13日完成50亿美元战略融资,估值1900亿美元。

仔细看这两家的产品,你会发现一个小细节:Databricks把面向Agent的数据库产品命名为Lakebase,OceanBase把湖库一体引擎也命名为Lakebase。

两家从相反方向出发的公司——Databricks从数据湖和数据分析起家,向数据库和企业应用延伸;OceanBase从分布式数据库和核心交易系统出发,向企业全量数据管理、Agent数据供给和数据服务拓展——把产品命名收敛到了同一个词上。

用OceanBase CTO杨传辉自己的话说就是:“不同的路,同一个终点。”

立足当前行业格局,OceanBase正处于高速成长的黄金起步阶段。

据彭博2026年7月29日消息,OceanBase正在推进首轮A轮融资,目标融资规模20亿至30亿元人民币,这也是其自诞生以来首次引入外部市场化资本。商业化层面,OceanBase 2026年年化收入突破14亿元,同比增速高达70%

若以Databricks估值1900亿美元为目标,OceanBase的增长空间,将没有天花板。

结语:AI下半场的胜负手,在于数据基础设施

IDC在报告中写道:未来企业AI落地的竞争焦点将彻底从“模型军备竞赛”转向“数据基建比拼”。

头部模型的通用能力趋同且足以够用。当好模型不再稀缺,稀缺的就变成了数据层的能力差异。

数据层的和模型层的逻辑不太一样。数据基础设施的构建周期长、涉及环节多、迁移成本高,一旦形成技术壁垒和客户黏性,后来者很难在短时间内追上。这意味着,先行者的优势会随着时间推移不断放大。

放在中国市场来看,这个判断更加成立。中国不缺数据,也不缺场景。缺的是能把数据变成AI燃料的基础设施。这个空白正在被填补,而填补它的公司,或将定义下一代企业数据平台的形态。