打开网易新闻 查看精彩图片

一、35万块硬盘的体检报告,刚出炉

有人把硬盘当消耗品,有人把硬盘当传家宝。有家公司把这两件事同时干了十三年。

Backblaze 是做云存储的,从 2013 年开始,每季度公开一次自家机房里所有硬盘的健康情况:哪块坏了、哪块还在跑、跑了多少天。这是全球规模最大的公开硬盘可靠性数据集,完整 CSV 免费下载,入口就在 backblaze.com/drivestats。

2026 年 9 月 29 日,最新一期发布。统计范围是 354,415 块在役硬盘,覆盖 4 月 1 日到 6 月 30 日,累计 3155 万个"盘天",期间坏掉 1498 块。折算成年化故障率,1.73%。

这是近几年最高的一次,上一季度只有 1.24%。但真正被反复讨论的不是这个总数,而是另一件事——坏得最狠的那批盘里,有一款现在还在全新出售,而且下单的人不少。

二、1.73% 怎么算出来的,你自己就能验

先说口径。AFR 的公式极简:故障数 ÷ 盘天数 × 365。之所以要乘 365,是因为各型号服役时长不一样,必须折算成"一年里有多大比例的盘会坏",才能横向比较。

Backblaze 给的是两张表,别混着看:

口径

盘数

累计盘天

故障数

年化故障率

2026 Q2 单季

354,415

31,553,350

1,498

1.73%

2013 年至今终身

353,041

558,148,607

21,609

1.41%

单季 1.73%,十三年累计 1.41%。季度数字波动大,终身数字稳。终身值几乎没动,说明这季度的问题出在个别老型号身上,不是整批盘集体变坏。

这两行数字不需要信任任何人,拿公式一算就对得上:

def afr(failures, drive_days):    """年化故障率 = 故障数 / 盘天数 * 365"""    return failures / drive_days * 365 * 100print("Q2 2026 单季 : %.2f%%" % afr(1498, 31_553_350))print("2013 起终身  : %.2f%%" % afr(21609, 558_148_607))

输出:

Q2 2026 单季 : 1.73%2013 起终身  : 1.41%

官方给异常型号划了一条 6.95% 的线,本季有三款突破:

型号

容量

在役盘数

单季年化故障率

Seagate ST10000NM0086

10TB

965

9.33%

Seagate ST14000NM0138

14TB

1,235

8.26%

HGST HUH721212ALN604

12TB

9,694

7.63%

这三款的共同点是老。其中两款服役接近七年和八年半,剩下一款也早已停产。

单季数字容易被偶然性带跑,把时间拉长看更准。有第三方按 2021 年至 2026 年 Q2、共 22 个季度的合格数据重新聚合过一遍,得出的是这样一张长期榜:

型号

容量

合格季度数

合并年化故障率

WDC WUH721414ALE6L4

14TB

22

0.545%

Seagate ST16000NM001G

16TB

22

0.673%

Seagate ST12000NM001G

12TB

22

1.010%

Toshiba MG07ACA14TA

14TB

22

1.079%

Seagate ST12000NM0008

12TB

22

2.296%

HGST HUH721212ALN604

12TB

22

3.105%

Seagate ST10000NM0086

10TB

22

4.858%

Seagate ST14000NM0138

14TB

22

5.884%

要说明的是,这一列是第三方按 22 个季度自行聚合的结果,不是 Backblaze 官方公布的终身值,两者口径不同,别混用。

这张表的价值在于它区分了"偶尔摔一跤"和"一直摔"。ST14000NM0138 长期 5.88%、ST10000NM0086 长期 4.86%,都不是本季突发,而是连续二十多个季度稳定地差。真要避坑,避的是这种。

三、零故障这三个字,含金量能差 270 倍

本季度被官方点名表扬的是四款盘,全部来自希捷:ST8000NM000A 8TB 在 239 块里坏 0 块,ST12000NM000J 12TB 在 1,079 块里坏 0 块,ST14000NM000J 14TB 在 497 块里坏 0 块,ST16000NM000J 16TB 在 171 块里坏 1 块。

看上去希捷这一季赢麻了。把样本量摆上桌,结论立刻翻转。

239 块盘一个季度没坏,到底能说明什么?用泊松分布算 95% 置信上界——59.6 个"盘年"里观测到 0 次故障,真实年化故障率的上界是 5.03%。意思是这款盘的故障率可能是 0,也可能是 5%,比全队平均值高三倍,数据根本分不出来。

1,079 块那款就扎实得多,269 个盘年,上界 1.11%;497 块那款,上界 2.42%。

什么才算有说服力?看西部数据那款 22TB:45,665 块在役,累计 72,927 个盘年,样本量是上面最大那款的 271 倍,测出来的 0.58% 才是一个能拿来下结论的数字。

import mathdef upper_bound_zero(drive_years):    """观测到 0 次故障时,真实故障率的 95% 单侧上界"""    return -math.log(0.05) / drive_years * 100for name, cnt in [("ST8000NM000A 8TB", 239),                  ("ST12000NM000J 12TB", 1079),                  ("ST14000NM000J 14TB", 497)]:    drive_years = cnt * 91 / 365      # 一个季度按 91 天折算    print("%-18s %5d 盘 = %6.1f 盘年 -> 上界 %.2f%%"          % (name, cnt, drive_years, upper_bound_zero(drive_years)))

输出:

ST8000NM000A 8TB     239 盘 =   59.6 盘年 -> 上界 5.03%ST12000NM000J 12TB  1079 盘 =  269.0 盘年 -> 上界 1.11%ST14000NM000J 14TB   497 盘 =  123.9 盘年 -> 上界 2.42%

所以"零故障"从来不是结论,它是样本量问题。500 块盘零故障,证据强度远弱于 4 万块盘 0.6%。

另一半真相是:拉高本季故障率的主力是老盘。硬盘的故障曲线是浴盆形,早期坏一批,中间长期平稳,老了再坏一批,这批盘就处在浴盆的右侧。同一季度 Backblaze 还退役了两块服役接近十年的 HGST 老盘,一块 4TB 一块 8TB。十年——这不是"硬盘不耐用"的证据,恰恰相反,它说明选型的盘在机房里能跑满十年。

四、同为 24TB,一款 0.5%,一款 3.24%

真正值得掏钱的人盯住的,是这张表。

型号

容量

在役盘数

平均服役

故障数

终身年化故障率

Toshiba MG11ACA24TE

24TB

9,620

5.8 个月

23

0.50%

WDC WUH722222ALE6L4

22TB

45,665

19 个月

423

0.58%

Toshiba MG10ACA20TE

20TB

25,270

12.1 个月

202

0.79%

WDC WUH722626ALE6L4

26TB

7,212

3.4 个月

17

0.84%

Seagate ST24000NM002H

24TB

9,631

12.1 个月

323

3.24%

同为 24TB,希捷这款是东芝那款的 6.5 倍。

容量越大越容易坏?数据说的是反话。22TB、24TB、26TB 这几款恰恰是全队最低的一批,反倒是 8TB 到 14TB 的老型号在排队出事。按容量分级采购,等于把钱和稳定性一起扔掉。

不过要为 ST24000NM002H 说句公道话:它平均只服役了 12.1 个月,累计 364 万个盘天,历史比西数那款 22TB 短得多。3.24% 可能是早期批次问题,也可能随后续固件和批次调整降下来,需要再观察几个季度才能定性。但反过来讲,一款上市一年多、正在大规模出货的盘交出这个数字,下单前多看一眼不算多余。

落到具体动作上,三条是可执行的:

按型号买,不按品牌买。 同一个希捷,16TB 的 ST16000NM001G 是 0.68%,14TB 的 ST14000NM0138 是 5.88%,差八倍多。品牌忠诚度在这份数据里没有任何解释力。

看历史,别看单季。 一款盘要连续多个季度都有数据、样本在几千块以上,那个百分比才值得信。刚上架三个月、评论区一片"零故障"的新型号,等于没有数据。

二手企业级盘,先查型号再掏钱。 9.33% 那款 ST10000NM0086、8.26% 那款 ST14000NM0138,全新货早就停了,但翻新盘和拆机盘市场仍有流通。商家标注的"通电两万多小时、SMART 全绿"和这个型号本身的历史故障率是两码事——SMART 只能证明这一块现在没坏,证明不了这个型号靠不靠谱。

还有一件正在发生的事值得提前知道。这一期报告专门写了一章 SMR,也就是叠瓦式磁记录:把磁道像屋顶瓦片一样叠着排,同样大小的盘片能多塞 10% 到 25% 的容量。代价是它只在顺序、追加式写入的负载下表现好,随机改写会严重掉速,上层存储软件得跟着改。

Backblaze 现役机队里目前一块 SMR 盘都没有。但厂商为了冲 AI 训练需要的容量,往 SMR 走是大概率事件。真到了那一天,买盘前要确认的不只是型号和故障率,还有它到底是 CMR 还是 SMR——这两个字母的差别,在 NAS 里可能是能不能组阵列重建的区别。

五、98.3% 的盘不会坏,但没人知道是哪一块

这份报告说的是"一年里约 1.7% 的盘会坏"。反过来读,98.3% 的盘不会坏——可它没法告诉你坏的是不是你手里那块。

真正的安全感不是挑到那块不会坏的盘,是默认它一定会坏,然后提前把数据放到第二个地方。RAID 不是备份,这是硬件圈里最贵的一个误解。

说了这么多,你现在的 NAS 或者台式机里装的是哪一款盘?用几年了?评论区报一下型号,看看这批读者里谁的盘最扛造。