MSA 测量系统分析
重复性与再现性 GR&R
同一根轴,三个人量出三个数
问题到底出在产品,还是出在你的尺子上?
质量人必修课 | 读懂重复性与再现性,才算真正会看数据
同一根轴,A 量是 25.012,B 量是 24.996,C 量是 25.031。三个人吵了一下午,谁也说服不了谁。
最后班组长拿来第四把卡尺一量,25.004。
问题来了:这根轴到底合不合格?
一、先接受一个事实:测量值从来不等于真值
很多质量纠纷的根源,不是产品做坏了,而是我们默认了一个根本不成立的假设: 量出来的数,就是零件真实的尺寸。
实际上,任何一次测量得到的结果,都可以拆成两部分:
观测值 = 零件真值 + 测量误差
而测量误差,又来自人、机、料、法、环的叠加
把它放到过程变差里看,会更直观:
观测到的过程变差 = 产品真实变差 + 测量系统变差
这句话的杀伤力在于: 如果你的测量系统变差足够大,你看到的"过程波动"很可能全是尺子的抖动,而不是机床的抖动。
于是就出现两种典型的误判:
误判一:把好件判成坏件。过程其实很稳定,是量具在抖,你却去调机床、停机、返工,白折腾一整班。
误判二:把坏件判成好件。量具分辨力不够,超差的零件在读数上"看着挺好",直接流到客户手上。
这两种错误,都会真金白银地烧钱。MSA(Measurement System Analysis,测量系统分析)存在的意义,就是在你相信数据之前,先审一审这把尺子。
二、重复性与再现性,差的到底是一个字还是一整个逻辑
这两个词只有一字之差,也是全公司最容易被讲混的一对概念。先给一句能记住的话:
一个人反复量,量出来的差异叫 重复性;
换几个人量,量出来的差异叫 再现性。
拆开讲清楚:
对比项 重复性 Repeatability 再现性 Reproducibility 通俗叫法 设备变差 EV 评价人变差 AV 变化的是 只有"测了很多次" 换了个操作的人 保持不变的 同一人、同一量具、同一零件、同一特性、同一位置、短时间间隔 同一量具、同一零件、同一特性(人变了) 反映的是 量具本身的能力:精度、夹紧、磨损、分辨力、示值稳定性 测量方法的统一性:培训、手法、读数习惯、作业指导书 变差大了说明 "这把尺子不行" "这几个人的量法不统一" 典型改进方向 换量具、修量具、加定位工装、控制温湿度与振动 写测量作业指导书、统一测力与取点、专项培训
一个现场速判法:让同一个人对同一件零件连测 10 次,看这 10 个数的极差;再让三个人各测 1 次,看三个平均值的极差。前者大就是设备问题,后者大就是人的问题,两个都大,恭喜你,两边都得治。
把这两项合在一起,就是业内天天挂在嘴上的 GR&R(Gauge Repeatability and Reproducibility,量具重复性与再现性),也常被写成 R&R。
三、放到全景里看:MSA 的"五性"各管一段
重复性和再现性只是 MSA 的一半。完整的计量型测量系统分析,要看五个统计特性。可以用一句话分两类: 前三个管"准不准",后两个管"稳不稳"。
特性 回答的问题 一句话理解 偏倚 Bias 量得准不准 多次测量的平均值,与标准件真值之差 线性 Linearity 全量程都准吗 在量程的小端、中端、大端,偏倚是否一致 稳定性 Stability 今天准,下个月还准吗 同一标准件在不同时间测,结果是否漂移 重复性 Repeatability 同一个人量,稳吗 短时间多次测量的变差,设备变差 EV 再现性 Reproducibility 换个人量,还一样吗 不同评价人平均值的变差,评价人变差 AV
做产品符合性判定,偏倚是底线;做过程能力分析和 SPC,重复性与再现性是底线。 GR&R 不合格,Cpk 算出来再漂亮也不能信。
四、GR&R 怎么做:从取样到判定的五步
不用被统计公式吓住,GR&R 的现场逻辑其实非常朴素。标准做法是 均值极差法,流程如下:
① 选零件:10 件,必须覆盖整个过程变差
这是最容易做错的一步。零件不能只挑合格件,也不能全是同一批次。要特意挑出偏小、中间、偏大的件,甚至带上两件临界超差的。 选样的代表性,直接决定 GR&R 结果的可信度。
② 选评价人:2 到 3 名日常实际操作者
不要用"最熟练的老师傅"来秀数据,也不要拉一个从没量过的实习生。就选平时真正在做这个测量的人,结果才有代表性。
③ 盲测:随机顺序,每人每件测 2 到 3 次
给零件编号,但 编号不要暴露尺寸大小顺序;每轮打乱顺序再测;评价人之间不许交流读数,也不许回看自己上一轮的结果。这一步叫"盲测",防的是记忆偏差和从众效应。
④ 计算:三种方法,按场景选
极差法:只算总极差,最快,适合现场快速筛查,精度低。
均值极差法(X-R):最常用,手算或 Excel 都能做,能分别算出 EV 和 AV,缺点是算不出人与零件的交互作用。
方差分析法(ANOVA):最严谨,能分离出"人 × 零件"交互作用,现在主流 MSA 软件默认用它。
⑤ 判定:看 %GR&R 和 ndc 两个数
只报一个 %GR&R 是不够的,必须同时看区别分类数 ndc(number of distinct categories)。详见下一节。
核心公式(看不懂可以跳过,不影响使用)
GR&R 变差:σGRR = √(EV² + AV²)
总变差:σTV = √(σGRR² + σPV²)
占比:%GR&R = σGRR ÷ σTV × 100%
区别分类数:ndc = 1.41 × (σPV ÷ σGRR)
有个常被追问的点:到底用标准差 σ,还是用 5.15σ(99% 置信区间)?答案是 都可以。因为 %GR&R 是比值,分子分母同时乘 5.15,结果完全一样。但一份报告里口径要统一,别一半用 σ、一半用 5.15σ。
五、判定的三档红线,以及那个常年被忽略的 ndc
%GR&R 结论 该怎么处理 ≤ 10% 可接受 测量系统能力充分,可直接用于过程控制与产品判定 10% ~ 30% 有条件接受 视零件重要性、测量成本、后续改进难度决定;用于过程分析需谨慎 > 30% 不可接受 必须改进后再评;在此之前的数据不应用于过程能力分析
第二个指标 ndc(区别分类数),含义是:这套测量系统能把过程变差可靠地分成几档。
通俗点说,如果 ndc = 2,那这把尺子基本只能告诉你"大"或"小",跟用通止规没区别;如果 ndc ≥ 5,它才勉强能撑起一张 SPC 控制图。
ndc ≥ 5 是及格线,对应 %GR&R 约 28% 以下。
ndc < 2 意味着测量系统几乎无分辨能力,数据只能做合格/不合格判定,不能用于过程分析。
这也是为什么 只看 %GR&R 会漏掉分辨力不足的问题:一个分辨力很差的量具,可能因为重复性"看起来很稳"而算出不错的 %GR&R,但 ndc 一算就露馅了。
六、算一笔真实账:一个机加工车间的 GR&R 改进
讲个很典型的现场场景,方便对号入座。
某机加工车间,加工一根 φ25 ±0.05 的台阶轴,外径用外径千分尺检测。过去三个月,检验员之间为"这件到底超没超差"吵过无数次,返工率也一直下不来。质量部决定做一次 GR&R。
研究设计
零件:10 件,从当班产品中按尺寸从小到大挑选,覆盖整个过程变差范围
评价人:3 名日常检验员(A、B、C)
测量:每人每件测 3 次,盲测,随机顺序
方法:均值极差法(X-R)
变差分量 改进前 改进后 重复性 EV 0.0042 0.00105 再现性 AV 0.0031 0.00085 GR&R 0.00522 0.00135 零件变差 PV 0.0140 0.0140 %GR&R 34.9% 9.6% ndc 4 14
结论:改进前 34.9%,直接判不合格。而且 EV(0.0042)明显大于 AV(0.0031),说明主因在设备和方法,不只是人的问题。
他们做了四件事:
① 把"手持零件、悬空测量"改成 V 型块定位 + 固定测力装置,消除人为握持变形和测力不一致。
② 把用了六年的机械千分尺换成 数显千分尺,去掉人工读刻度带来的估读误差。
③ 编写 测量作业指导书:明确取点位置(距端面 10mm 处)、旋转 90° 测两点取平均、测棘轮响三声。
④ 三名检验员做 统一手法培训与比对,培训后重测。
三个月后复评:%GR&R 降到 9.6%,ndc 从 4 提到 14。最直观的变化是,检验员之间关于"超没超差"的争执基本消失了,同类零件的误判返工下降了一大截。
七、拿到一个糟糕的 %GR&R,先查谁
这是最实用的一节。GR&R 不合格,改进方向完全取决于变差来自哪一段:
EV 明显大于 AV:问题在量具和方法
查这七项:分辨力是否满足 1/10 法则;量具是否磨损或需校准;装夹定位是否可靠;测量力是否恒定;零件在测量中是否变形(薄壁件尤其);环境温湿度与振动;量具与被测件的材质热膨胀差异。
AV 明显大于 EV:问题在人
查这五项:有没有测量作业指导书;取点位置是否统一;读数时机与估读规则是否统一;人员是否经过培训与能力确认;量具是否对某些人不友好(如视线角度、测力手感)。
ndc 偏低但 %GR&R 尚可:查分辨力
典型的"量具太粗"。记住 1:10 法则: 量具分辨力应不大于过程变差或公差带宽的十分之一,取两者中较小者。φ25±0.05 公差带 0.1mm,分辨力至少要能读到 0.01mm;如果只有 0.02mm 的刻度,就该换量具了。
如果是用 ANOVA 法做的,还会多一项: 人与零件的交互作用显著。意思是某个评价人在某几件特定零件上表现特别离谱,通常能追到具体的操作手法问题,比如测锥面时找最大值的习惯不一样。
八、六个高频误区,看看你踩过几个
误区一:只用合格件做 GR&R
零件变差 PV 被人为压小,分母直接塌陷,%GR&R 必然虚高,最后得出"量具不合格"的错误结论。 取样必须覆盖过程变差,这是第一原则。
误区二:拿同一件标准件反复测,当成 GR&R
那测出来的是重复性和稳定性,缺了零件变差和再现性,不是完整的 GR&R。
误区三:做一次,管一辈子
量具会磨损,人员会轮换,产品会换代。至少 每年定期复评一次;出现新量具、新特性、新检验员上岗、量具维修或校准异常、过程能力突变时,必须重做。
误区四:只盯 %GR&R,不看 ndc
分辨力不足会被漂亮的 %GR&R 掩盖住,直到 SPC 控制图上出现一层一层的台阶才被发现。
误区五:把锅全甩给"量具不行"
现场统计下来,相当比例的 GR&R 超标,根因是 测量方法没有标准化,而不是量具精度不够。先统一手法,再谈换设备,能省下不少预算。
误区六:做完就归档,不用于决策
MSA 不是应付审核的一张表。它的结论应该直接连到三个地方:SPC 是否可用、Cpk 数据是否可信、检验频次和量具选型怎么定。
九、落地清单:把 MSA 变成日常,而不是一次运动
照着下面这七条建制度,比做十次漂亮的 GR&R 报告更有用:
① 建测量系统台账。每台量具编号、对应特性、最近一次 GR&R 结果、有效期、责任人,一张表管到底。
② 做特性分级。关键特性(安全件、功能件、客户指定)必做 GR&R,一般特性可视风险简化或只做重复性检查。
③ 设触发条件。新量具验收、新品试产、量具维修后、检验员变更后、过程能力异常时,自动触发重评。
④ 写测量作业指导书。取点位置、测力方式、读数时机、环境条件、记录精度,一条条写死,别留"看着办"的空间。
⑤ 分辨力前置检查。选量具阶段就过一遍 1:10 法则,别等设备买回来才发现读不出来。
⑥ 计数型另开一路。通止规、目视检查这类判定型测量系统,用 Kappa 一致性分析,评估的是错判率和漏判率,不是 GR&R。
⑦ 结论要闭环。%GR&R 超标的,必须有改进措施、责任人和复评日期,而不是在报告上签个"知悉"了事。
最后留一句话:
在质量管理体系里,数据是所有决策的地基。而重复性与再现性,就是这块地基下面的那层钢筋。
钢筋锈了,上面盖得再漂亮,也随时可能塌。
所以下次再有人为了 0.01mm 争得面红耳赤,先别急着判产品,先去问问: 这把尺子,我们审过吗?
你所在的现场,GR&R 超标通常卡在哪一环?是量具本身,还是几个人的量法始终统一不起来?欢迎在评论区聊聊你的经历。
热门跟贴