这项由京东集团氧气AI商品中台团队主导的研究,以技术报告形式于2026年6月发布,论文编号为arXiv:2606.28070,完整论文可通过该编号查询获取。

打开网易新闻 查看精彩图片

**电商世界里的"失联"困境**

每天打开购物App的你,可能有过这样的体验:你搜索"莫兰迪色调外套",结果平台完全不理解你说的颜色,给你推了一堆不相干的东西;或者商家辛辛苦苦把商品上架,但因为信息填写不完整,商品就像被埋在沙漠里一样,顾客根本找不到它。这背后,隐藏着一个巨大的系统性难题——如何让平台真正"理解"每一件商品。

京东是全球最大的电商平台之一,服务超过7亿活跃用户,管理着数百亿件商品(SKU)。在这个庞大的生态中,商品知识的缺失会带来三个方向的连锁伤害。从消费者角度看,商品信息不完整、平台理解不了用户多变的描述方式,导致搜索体验极差;从商家角度看,手动维护海量商品信息成本极高,还容易出错,影响流量获取;从平台运营角度看,市场趋势变化飞快,比如"软壳冲锋衣"这个新品类忽然爆火,传统系统根本无法及时追踪和响应。

正是为了系统性解决这三大困境,京东团队构建了"氧气AI商品中台"(Oxygen AIIC)。这个平台以大语言模型(LLM)和视觉语言模型(VLM)为核心引擎,建立了从商品本体论工程、AI商品知识库生产、自进化模型系统到统一数据服务通道的全链路架构。整个系统目前已覆盖数万个京东品类,每天处理数亿次商品更新,积累了千亿量级的商品知识资产,将商品信息丰富度提升至原来的3.35倍。

**一、知识世界的地图:本体论工程**

在深入了解这套系统之前,有必要先搞清楚一个关键概念——"本体论"(Ontology)。这个听起来很哲学的词,在这里的意思其分简单:它就是一张关于商品世界的"知识地图"。这张地图规定了所有商品的分类方式、每类商品有哪些特征维度(属性键)、每个维度可以取哪些具体的值(属性值),以及更高层次的场景概念(场景标签)。

以男士衬衫为例,它在地图上的位置是"服饰内衣 → 男装 → 男士衬衫"。这件衬衫有"袖长"这个属性键,对应的属性值可以是"长袖"、"短袖"、"七分袖"。此外,系统还能为它打上"商务通勤百搭"这样的场景标签,把原子级的属性知识组合成更高层次的消费场景概念,方便下游应用快速响应场景化需求。

这张知识地图如果不够完整、不够及时,整个系统的上限就会被死死压住。然而维护一张覆盖数百亿商品、还要持续跟进市场新趋势的知识地图,靠纯人工是根本不可能完成的任务——每天都有大量新概念冒出来,比如"美拉德风格"、"软糯感面料",这些新词汇需要被及时纳入地图,否则系统就会"失聪"。

京东团队设计了一套"人机协作"的框架来解决这个问题。核心思路是:让领域专家负责"定标准、把关质量",让AI负责"大规模挖掘、快速扩展"。两者分工明确,相互配合,让知识地图既有专家背书的可靠性,又有AI驱动的时效性和规模化能力。

这套框架的运作方式如同一条流水线,分为三个环节。第一个环节是"知识发现",系统会部署一个专门训练的知识挖掘模型,从商品标题、详情页、用户搜索词、互联网公开内容等多源异构数据中,自动挖掘出潜在的新属性键和属性值。这个模型支持两种工作模式:一种叫开放信息抽取,给它一段文字,它自己找出里面有哪些属性键值对,比如从"夏款冰丝防晒开衫"里提取出"材质:冰丝"、"适用季节:夏季"、"功能:防晒";另一种叫定向属性填充,专门针对某个已知属性键去抠值,比如告诉它"请找出袖长属性的值",它就会从文本中精准提取出"七分袖"。这个挖掘模型训练后在候选知识抽取任务上达到了91%的精确率和79%的召回率,一次性挖掘出约450万个潜在属性值。

第二个环节是"知识融合"。450万个候选值里,有大量重复和近义词,比如"七分袖"、"中袖"、"五分袖"可能指的是同一类袖长,这些重复条目如果直接塞进知识地图,会造成混乱和膨胀。为此,系统训练了一个专门的语义编码器,把每个候选值转化成向量(可以理解为一串能反映语义的数字),然后用层次聚类算法把语义相近的词归入同一组,最后从每组里选出最具代表性的标准词作为"正式词条",其余的归入它的同义词集合。经过这一步处理,450万个候选词被压缩到210万个标准本体候选词,同时约240万个冗余表达被整合进相应的同义词库。这个语义编码器让本体相似性测试的斯皮尔曼相关系数从通用编码器的0.62提升到0.86。

第三个环节是"知识验证"。通过AI挖掘和融合得到的候选词条,还需要经过质量把关才能正式入库。系统采用多大模型协同投票机制,同时调用多个通用大语言模型,让它们各自独立判断一个候选词条是否符合常识、是否违反类目约束、是否与已有词条重复。只有当多数模型都投票"通过",该词条才能晋级到下一关。通过质量检验后,系统还会从"规模"和"趋势"两个维度评估每个候选词的商业重要性——规模衡量它当前覆盖多少商品、被搜索多少次,趋势则衡量它的短期增速和搜索热度变化。借鉴波士顿矩阵的思路,词条被划分为"明星概念"(高规模高趋势)、"新兴趋势概念"(低规模高趋势)、"稳定通用概念"(高规模低趋势)和"低价值概念"(低规模低趋势),并据此决定入库优先级。最终,对于争议较大或边界不清的词条,还会转交领域专家做最后确认。

在这套人机协作框架的驱动下,整个本体论规模扩大了64.5%,每件商品的平均刻画维度增加到原来的1.44倍,覆盖了80.4%的京东用户搜索流量。

**二、商品知识工厂:AI商品知识库**

有了知识地图,下一步就是要把数百亿件实际商品与这张地图对应起来——弄清楚"某件具体商品"与"地图上哪些知识条目"相匹配。这件事的规模之大令人咋舌:几万个品类、数百亿件SKU、每天数亿次商品信息更新,还需要支撑搜索、推荐等对时效性要求极高的核心业务场景。

传统方法面临两个根本性的困境。其一是"本体论与模型耦合"的问题:许多传统方法把本体论知识直接"烧"进模型参数里,一旦本体论新增了词条,模型就得重新训练,代价极高。其二是"算力吃不消"的问题:对着数百亿商品穷举所有属性键逐一判断,计算量大得惊人,同类商品(比如同款手机的不同颜色版本)又会造成大量重复计算。

京东团队提出了一种名为"语义搜索后判别"的架构(S?D,Semantic Search then Discrimination)。这个架构的核心思路用一个类比来理解:传统方法像是要你把图书馆里的每一本书都读一遍,才能回答"这本书属于哪个类别";而S?D的做法是先让图书管理员(语义搜索模块)根据书的简介,快速从书架上拿出最可能匹配的10本候选书,再让专家审核员(判别模块)在这10本候选书里做精细辨别。这样一来,专家审核员的工作量从"全馆"压缩到"10本",效率大幅提升,而且本体论知识被"外置"在检索索引里,不再锁定在模型参数中,新增词条直接更新索引即可,不用重新训练模型。

具体来说,S?D的第一阶段是"语义搜索":系统用一个经过专门训练的语义编码器,把商品信息和所有属性值都映射到同一个语义向量空间,然后通过相似度检索,从动态维护的本体论索引库里找出与该商品最相关的Top-10候选属性值。第二阶段是"判别":把商品信息和这10个候选值一起送给一个专门训练的判别模型,让它判断哪些值真正与该商品匹配,输出最终的匹配子集。判别模型在训练时有一个巧妙设计:先用一个大规模高质量参考模型生成伪标签,再用这些伪标签训练一个高效的8B参数判别模型,把大模型的判别能力"蒸馏"到小模型里,大幅降低生产阶段的推理成本。训练时还加入了候选集乱序增强和样本分布校准等技巧,避免模型对候选序列产生依赖,防止对负样本主导的分布过拟合。

S?D架构实现后,系统在知识识别任务上达到了92%的精确率和78.3%的召回率。相比商家自填数据,每件SKU的平均属性数量提升到原来的1.5倍,知识资产总量(SKU×属性键×属性值)扩张了3.35倍,达到千亿量级。其中商家自填数据占30%,AI生成数据占70%。

然而,仅有高质量还不够——在数百亿SKU的工业级生产场景里,系统还必须具备极高的吞吐效率。京东团队深入分析了电商数据的内在特征,发现了三个关键规律:大量SKU是同一物理商品的同质化变体(比如同款手机的黑色和白色版本,信息高度重叠);属性分布极度不均衡,常见属性被频繁调用,而"袖口褶皱类型"这样的长尾属性极为稀疏;同一SPU(标准产品单元)下的多个SKU共享绝大部分核心知识,分开处理会产生大量冗余计算。

基于这些洞察,团队设计了三层吞吐效率优化方案,就像工厂里的流水线改造。

第一层是"计算负载削减",分SKU级和属性级两个维度进行。SKU级优化的逻辑是:当系统遇到一件新商品,先用语义检索看看仓库里有没有和它极其相似的商品(相似度超过阈值),如果有,直接复用那件商品的属性识别结果,免去重复计算。属性级优化的逻辑是:不再对一个品类的所有属性键都跑一遍S?D流程,而是先用一个"属性关联探测模型"快速筛选出与当前商品高度相关的属性键子集,只对这些属性键启动S?D,不相关的属性直接赋空值。这个探测模型还支持"SKU对模式":当一件新商品和同一SPU下的参考商品相比差异很小时,模型只需识别"差异涉及哪些属性",其余属性直接继承参考商品的识别结果。仅靠SKU级语义去重和属性级稀疏化这两项优化,生产流水线的吞吐效率就提升了三倍。

第二层是"极限缓存复用"。系统发现,同一SPU下不同SKU的推理提示词中,约有85%的内容是完全相同的(比如商品详情描述)。传统做法是每个SKU都独立处理整个提示词,造成大量重复计算。优化后,系统把SPU级共享内容放在提示词开头形成"共享前缀",利用vLLM(大模型推理引擎)的KV缓存机制缓存这部分的计算结果。同时,通过调整vLLM的内存块参数(将block_size从默认的128调整为16),在保持高缓存命中率的同时显著降低内存管理开销。仅这一项优化就带来了超过6倍的吞吐提升。

第三层是"异步流水线并行"。氧气AI商品中台的生产工作流包含向量生成、语义搜索和判别三个阶段,分别运行在NPU(华为昇腾神经网络处理器)和CPU(Faiss向量检索集群)上。不同硬件之间的依赖和通信会产生等待气泡,造成计算资源浪费。团队设计了两层并行化架构:底层做细粒度数据并行,把大SPU拆成细粒度SKU块,动态负载均衡,避免单个大块长期占用CPU;顶层做跨块异步流水,让三个阶段解耦并发运行——NPU在处理当前批次的判别时,CPU已经在检索下一批次的候选,充分利用各类硬件资源。这一层优化独立带来了超过2倍的系统吞吐提升。

三层优化叠加后,整体吞吐效率提升超过10倍,且随着本体论属性维度的持续扩大,三项优化的效果还会进一步放大。

**三、会自我进化的大脑:商品理解大模型**

知识地图有了,生产流水线有了,但这套系统要持续稳定地运转,还需要一个能不断学习进化的"大脑"——商品理解大模型体系。这套体系面临四个棘手的挑战:通用模型对电商专业知识积累不足,直接用效果不理想;本体论和新品类持续扩张,模型需要不断学习新知识,但频繁全量重训成本极高还容易"忘掉"旧知识;商品信息里隐藏着大量干扰噪音,模型很难从繁杂的文字里精准捕捉核心属性信号;模型整体表现趋于稳定后,仍然存在一些隐蔽的长尾缺陷,这些缺陷难以被常规指标发现,也很难通过简单增加训练数据来修复。

为了应对这些挑战,团队构建了一个三层递进的模型框架。

第一层是"多任务统一基础模型"。过去,知识发现、语义表征、知识识别等任务分别由不同模型承担,数据割裂,知识无法共享。现在,团队把所有生成式(非表征式)的知识生产任务统一组织为两大家族:知识抽取类任务(自主从商品信息中识别并提取知识,包括属性键抽取、属性值抽取、键值联合抽取)和知识识别类任务(基于给定候选集做真伪判别或子集筛选,包括键判别、值判别、键值联合判别)。所有这些任务的训练数据被统一整理成多任务监督微调格式,合并训练出一个高泛化性的商品理解基础大模型,为整个系统提供统一的能力基础。

第二层是"增量适配机制",用来解决基础模型无法快速跟上新品类和新本体论词条的问题。这套机制的核心是用轻量级"专家模块"(LoRA适配器)来承接增量需求,不动基础模型的参数,只训练新的小模块。团队引入了一种名为LoRAM的改进初始化方案:利用离散正弦变换构造确定性正交基,并结合预训练权重的增益系数来设定低秩矩阵的初始状态,使适配器从一开始就具备更强的更新动量,加速收敛,提高在有限业务数据下的拟合效率,同时对原始基础模型的行为做权重补偿以保证初始一致性。

单个专家模块解决单个场景,但多个专家联合使用才能实现知识共享和跨品类泛化。为此,团队提出了名为GROLE的自适应专家组合策略:维护一个模块化专家池,每个LoRAM适配器代表一个独立能力单元;一个自适应选择器根据输入商品和任务指令,从专家池中估算最优融合权重,将各专家的输出线性组合为最终预测,融合权重非负且归一化为1。由于专家融合权重没有显式标签,系统采用强化学习中的GRPO算法来优化选择器:从Dirichlet分布中采样多组专家权重组合,计算各组合对应的任务奖励(以负损失为奖励),用相对优势来指导选择器向更优的权重分布进化。这套机制让新知识和新任务逻辑可以灵活组合进来,同时不破坏基础能力。此外,系统会定期对分散的增量能力做一次全量整合,把专家池中的知识内化回基础模型,支持长期能力积累。

第三层是"指令跟随知识表征",专门服务于语义搜索阶段的向量化任务。表征模型的核心挑战是:商品详情页充斥着营销话术和冗余信息,模型很容易被表面相似性误导,忽略深层的细粒度语义信号。比如要识别"防水等级"这个属性,商品文案可能写的是"防水性能再度升级,支持IP68级防尘防水,通过TUV SUD 2米24小时测试",如果模型没有推理能力,可能根本识别不出"IP68级"才是核心知识点。

为解决这个问题,团队提出了"推理再表征"框架:在生成向量之前,先让模型做一次内隐推理,从嘈杂信息中提炼出核心语义,再将推理后的语义状态压缩进向量。具体实现上,系统在输入序列末尾附加一组可学习的特殊推理令牌作为隐式推理载体,用一个冻结的教师大模型提供显式推理链作为监督信号,通过位置对齐蒸馏损失,让学生模型的隐式推理令牌在隐藏状态层面向教师的显式推理过程靠拢。推理结束后,取最末尾的EOS令牌的隐藏状态作为最终向量,整个推理过程在单次前向传播中完成,不引入自回归解码的额外延迟。在此基础上,团队还加入了基于谱结构的自适应噪声注入策略:对一批向量做奇异值分解,在高能量主方向(往往对应高频噪声模式)上注入较强扰动来压制过拟合,在低能量方向(往往承载细粒度逻辑信号)上限制扰动强度以保留精细语义,再通过对比学习损失显式强化语义对齐。

将上述各项能力整合后,最新版模型在端到端AI商品知识库生产任务上达到了94.2%的精确率和82.8%的召回率,相比基础S?D架构的92%精确率和78.3%召回率分别提升了2.2个和4.5个百分点。整个知识迭代周期中,只有0.8%的属性出现超过5%的精确率下滑,说明模型在持续提升整体质量的同时,维持了对不断增长基准测试集的稳定表现。新增本体论词条从属性挖掘到完成生产数据的端到端周期,从30天以上压缩到约两周。

**四、第四个关键:让知识顺畅流通的"管道"**

建好了知识地图、生产好了知识资产、训练好了模型,还有一个关键问题:这些知识怎么安全、及时、高效地送到搜索、推荐、商家上架等各种不同业务场景手中?不同场景对"新鲜度"的要求差异悬殊——商家上架时的属性预填需要秒级响应,搜索特征需要分钟级刷新,而一些离线分析任务则允许以天为单位更新。在数百亿商品的规模下,如何在满足不同新鲜度需求的同时控制成本、保证数据一致性,是一个非常实际的工程挑战。

京东团队为此构建了统一的"商品隧道",通过三条并行的生产分发管道,分别对应秒级、分钟级和天级的新鲜度层次。天级管道以批量计算和离线推理为主,构建低成本的商品知识基线,CPU处理和NPU推理解耦成流水线以提升NPU利用率。分钟级管道通过微批次处理刷新分钟级增量。秒级管道仅为高价值、高时效性的商品保留,触发在线推理。三条管道之间的数据一致性通过精细的版本控制机制保障:流式结果使用事件时间戳,批量结果使用快照时间戳,基于Hudi数据湖的MVCC和ACID能力,在商品-属性粒度上应用"后写覆盖"语义,高版本结果覆盖低版本结果。高新鲜度场景下的数据收敛时间控制在分钟级以内,其余数据通过每日全量一致性快照对外暴露。

在服务接口层面,商品隧道统一了离线存储、容器化、推理引擎和服务框架,向业务场景暴露两类标准服务:商品数据服务(支持本体论和商品实例在线查询、高吞吐大规模关系表消费、事件驱动的全量/增量变更流订阅)和商品算法服务(将商品理解大模型能力嵌入商品生命周期各环节,对外暴露高精度类目预测、细粒度属性识别、长短标题生成等在线AI服务)。这种标准化接口设计让场景定制化的模型调用变成了平台级能力复用。商品隧道目前每天支持数亿次AI商品知识库更新,覆盖搜索、广告、营销、购物助手、商品运营、商家上架、平台治理等广泛应用场景。

**五、知识落地,惠及各方:应用矩阵**

氧气AI商品中台积累的千亿级商品知识资产,通过商品隧道的统一服务层,被部署到京东各核心业务场景中,形成一套覆盖消费者、商家和平台三大维度的应用矩阵。

在消费者侧,商品知识的质量直接影响购物体验的流畅程度。在搜索场景中,氧气AI商品中台被整合进召回、相关性排序和查询理解等核心流量分配环节,将商品信息丰富度提升至3.35倍,使搜索中商品信息缺陷的比例下降37%,搜索流量覆盖率达到80.4%,帮助用户更快、更准地找到目标商品。在商品详情页,系统提取出用户最关心的核心结构化信息,生成智能短标题、核心卖点和核心属性,并附加AI解读,把密集的技术参数转化为平易近人的白话描述,帮助用户快速抓住商品核心价值,降低决策成本。在AI购物助手场景中,结构化标准化的商品知识为智能体提供了跨品类的知识基础,支持更准确的商品理解和用户意图理解,驱动更聪明的购物体验。具体应用包括对话式电商(支持用户用自然语言描述碎片化、场景化的购物需求,系统通过对话方式精准匹配商品)和AI商品对比(自动识别用户的比价需求,生成覆盖商品亮点、核心参数和用户评价的结构化对比报告)。

在商家侧,氧气AI商品中台围绕品类规划、商品上架和商品运营构建了端到端的智能化运营闭环。品类规划方面,系统通过对全平台数据的智能分析,将决策周期从两三周压缩到几天,帮助更精准地识别品类增长机会;结合用户行为、行业趋势和站内外市场数据,向商家和品类买手输出供需缺口、品类竞争格局和用户需求偏好洞察。商品上架方面,核心属性自动填写率超过80%:商家或品类买手只需上传主图或标题,系统就能自动完成类目识别、品牌识别和属性填充,从源头提升商品数据质量,降低运营成本。商品运营方面,系统通过多模态学习从高转化商品图片中提炼最优视觉标准,批量优化商品创意,将点击率提升约9%,且推理成本极低。

在平台侧,氧气AI商品中台支撑了商品信息治理和价格治理两个核心场景。商品信息治理方面,系统建立了全生命周期的商品信息治理闭环,在上架环节主动拦截不合规提报,上架后通过智能巡检工具批量核验全平台商品,识别类目和属性错误,降低信息相关的负向曝光。价格治理方面,依托AI商品知识库中的高维商品信息和图文信息,系统在全部实物类目实现了超过90%精确率的同款商品识别,支撑价格治理、同款比价、大促价格管控和异常价格检测等业务场景,帮助维护公平有序的定价环境。

**整个系统走到哪里,又将去往何方**

说到底,氧气AI商品中台做的事情,是用AI的方式系统性地解决了电商领域的"知识鸿沟"问题:让平台真正理解每一件商品,理解每一个用户需求,进而让对的商品遇见对的人。从数百亿SKU的千亿知识资产积累,到80.4%的搜索流量覆盖,到37%的信息质量问题减少,再到9%的点击率提升,这些数字背后是一套从本体论、生产流水线、模型进化到工程服务的完整闭环系统在支撑。

当然,这套系统目前仍有值得正视的局限性。本体论内部的关系建模还处于初级阶段,远未达到规模化应用,这限制了系统对行业积累知识的深度挖掘和复用。数百亿商品规模下的在线失效案例仍然客观存在,如何让缺陷可被及时发现和修正,仍是核心挑战。监督微调带来的灾难性遗忘问题,也是大模型领域普遍存在的难题——如何在强化领域专业能力的同时不损伤通用能力,还需要更好的解法。

团队已经明确了三个方向的后续攻关目标:强化本体论的关系建模,引入图推理能力,让行业经验更有效地跨场景复用;建立在线失效发现机制,配合数据飞轮和模型自进化,让知识消费反哺知识生产;探索更有效的领域适配灾难性遗忘缓解方案,包括MoE专家数量扩展、任务分解简化、知识注入提示增强等路径。

对有兴趣深入研究的读者,完整论文可通过arXiv编号2606.28070查询,其中包含所有技术细节、实验设置和结果分析。

Q&A

Q1:氧气AI商品中台的S?D架构是如何解决本体论更新导致的模型重训问题的?

A:S?D架构把本体论知识从模型参数中"外置"出来,维护成一个独立的向量检索索引库。新增本体论词条只需被语义编码器编码后加入索引,无需重新训练判别模型。检索阶段直接从更新后的索引中找候选,判别模型只负责在候选集内做真伪筛选,因此本体论的动态演化与模型参数完全解耦,实现了快速适配。

Q2:氧气AI商品中台的商品知识吞吐效率是怎么提升超过10倍的?

A:系统通过三层叠加优化实现了超过10倍的吞吐提升。第一层是计算负载削减,在SKU维度做语义去重(相似商品复用识别结果),在属性维度做关联探测(只对高度相关属性启动S?D),仅此两项就提升了3倍;第二层是极限缓存复用,利用同一SPU下多SKU共享约85%提示词前缀的特性,通过vLLM KV缓存机制减少重复计算,独立带来6倍以上提升;第三层是异步流水线并行,让向量生成、语义检索、判别三个阶段跨异构硬件并发运行,消除等待气泡,独立带来2倍以上提升。

Q3:商品理解大模型在持续迭代新能力时如何避免"遗忘"已有能力?

A:系统采用了专家池增量适配机制。新品类或新任务的能力被训练成独立的LoRAM轻量级专家模块,加入专家池,不改动基础模型参数,从而规避了直接微调导致的灾难性遗忘。推理时,自适应选择器根据输入动态组合多个专家的权重,实现知识跨品类共享。为了让分散的专家能力持续内化和积累,系统还会定期执行全量整合,把专家池知识合并回基础模型,支持基础模型的长期进化。