7月17日,上海。2026世界人工智能大会现场,一台专为“Token工厂”设计的超节点真机首次公开亮相,来自新一代AI基础设施服务商阡视科技。

这台被命名为wylon的系统,不是在做常规的算力堆叠。它解决的是一个更具体的工程痛点:当大模型进入递归自我改进和长程闭环规划阶段,频繁读写的KV Cache让存力成为新的瓶颈,传统侧重GPU横向互联的超节点架构开始不够用了。

打开网易新闻 查看精彩图片

阡视科技给出的方案,是在横向算力互联之外,重新搭建一套纵向的存力贯通平面。简单说,系统打通了从GPU近存、系统内存到PB级大带宽闪存的层级架构,构建起上百TB的统一DRAM缓存空间,专门应对超长上下文的运算效率问题。配合自研的HitenOS操作系统进行软硬件协同设计,wylon在国产GPU平台上实现了所谓的“帕累托改进”——同一速度下更高吞吐,同一吞吐下更快响应。官方给出的性能提升数据,是10倍以上。

性能的跃升,建立在一系列底层能力的重构之上。系统通过KV分层管理、算力亲和调度和硬件拓扑感知,让模型负载能够直达硬件底层,砍掉中间层的性能损耗。这样一来,Token的生产就不再是一次次零散的调用,而更像是在一个一体化算力空间里进行流水线运转。阡视科技的逻辑很清楚:Agent时代对大算力、大带宽、大存储的需求是确定的,关键是持续降低每个Token的成本。

展出的wylon Q72/288给出了具体的硬件配置:单机柜集成72颗国产GPU,4机柜横向域扩展至288卡规模,GPU高带宽显存18TB,互联总带宽72TB/s,支持FP8和FP4浮点运算精度。现场信息显示,基于这套架构的“wylon新云Token工厂”,已在华东集群节点上线并开始邀请测试。

值得注意的还有底层的芯片生态。wylon系统背后的国产GPU合作伙伴名单很长,包括寒武纪、壁仞、沐曦、曦望、海光、摩尔线程等。阡视科技要做的,是连接从芯片到系统、从算力到生态的全栈通路,继续扩展国产超节点系统性能的帕累托前沿。