当一家公司的存储架构里同时跑着NFS、Alluxio、MinIO、Ceph和SeaweedFS时,运维团队每天面对的不是技术创新,而是碎片化带来的无尽痛苦。途虎养车在业务规模扩张到1.629亿注册用户、全国8008家服务中心之后,彻底被逼到了存储架构的拐点。
起初为了追求开发速度,各个应用各自为战、独立搭建存储系统。这种打法在公司早期确实爽,需求来了直接怼一套独立方案,谁也不耽误谁。但随着云原生、大规模AI训练和推理的铺开,代价开始反噬——数据在不同系统间搬来搬去成本极高,每种存储都有自己的部署模型、接入协议和排障逻辑,运维复杂度和性能瓶颈同时爆发。
打开网易新闻 查看精彩图片
途虎最终选择在现有Ceph私有云基础设施上建一个统一平台,技术栈锁定JuiceFS加TiKV再加Ceph RADOS对象存储集群。这套架构用一个数据访问层把AI训练、AI推理和大数据处理全部收拢进来,不再需要为每个场景单独维护一套存储。目前平台上管理的小文件数量已经超过1亿个。
性能提升直接体现在测试数据上。在低并发基准测试中,小文件顺序写入性能最高提升了5.5倍,小文件读取性能提升了3.2倍。这套方案还专门针对Ceph RADOS数据路径做了生产优化,包括纠删码池配置、降低小文件写放大、以及提升容器化部署的稳定性。
热门跟贴