Nelson八大判异规则实战:只开规则1你会漏掉80%异常

【摘要】
本文系统梳理SPC 统计过程控制领域的核心问题与落地路径。控制图判异业界通用 Nelson 八大规则,但很多工程师只开了规则1(点出界),漏掉的趋势、偏移、分层全靠规则2-8。全文围绕「八大规则到底管什么、规则1-2:最常用也最基础、规则3-4:趋势型异常、规则5-6:偏移型异常、规则7-8:分布异常」逐层展开,给出原理说明、实操步骤与验证方法。核心结论:代码逻辑就是逐条判断:规则1比 3σ,规则2数同侧连续数,规则3数单调段……写成函数后,新数据进来自动标异常类型和位置,比肉眼看图快十倍。补充说明:SPC 的核心思想是把过程波动区分为「普通原因」与「特殊原因」:前者是过程固有的随机波动,只能通过改变系统来降低;后者是外来干扰,必须立即定位并消除。混淆两者会导致越调越乱。
【核心要点】
- 八大规则到底管什么:控制图判异,业界主流有两套:Western Electric(WE)规则和 Nelson 规则。
- 规则1-2:最常用也最基础:规则1:任一点超出 3σ 控制限,立即判异。这是底线,不用多说。规则2:连续 9 点在中心线同侧。
- 规则3-4:趋势型异常:规则3:连续 6 点持续上升或下降。这抓的是"渐变",比如腔体老化、耗材损耗导致的缓慢劣化。规则4:连续 14 点上下交替(锯齿)。
- 规则5-6:偏移型异常:规则5:连续 3 点中至少有 2 点落在中心线同侧 2σ 以外。规则6:连续 5 点中至少 4 点落在 2σ 外同侧。
- 规则7-8:分布异常:规则7:连续 15 点落在中心线 ±1σ 内。听起来"很稳定"是好事?错。过度集中往往意味着数据被截尾、测量分辨率不够、或过程被过度调整(过度控制)。
- 用 Python 自己实现一套:别完全依赖软件。我用 30 行 Python 把八条规则写成函数,每天把量测数据灌进去跑一遍,输出触发了哪几条。这样你既懂原理,又能对软件报警做交叉验证。
【适用场景】
- 过程能力不足时的改善方向判断(降波动还是纠偏移)。
- 控制图频繁报警的真伪判断(过程异常还是量测系统问题)。
- 新工艺/新设备的初始过程能力评估与验收。
- 质量问题闭环的结构化推进。
控制图判异业界通用 Nelson 八大规则,但很多工程师只开了规则1(点出界),漏掉的趋势、偏移、分层全靠规则2-8。这篇逐条讲清八条规则抓什么、我的实战触发经历,以及为什么规则7"太稳定"反而是病。
这个方向的工具共 75 款,完整清单与选型建议见 SPC与质量分析工具包。全部 351 款见 工具资源包下载页。
一、八大规则到底管什么
控制图判异,业界主流有两套:Western Electric(WE)规则和 Nelson 规则。WE 是老一辈工厂用的 8 条,Nelson 在 1984 年做了修订,把 WE 里重复和矛盾的条文理顺,成了今天最通用的版本。八条规则覆盖"点出界、连续同侧、趋势、偏移、混合"五大类异常。
为什么工程师必须背熟这八条?因为控制图软件大多只默认开规则1(点出界),其余七条要靠你主动开、主动读。很多慢漂移和分层问题,规则1根本抓不到,全靠规则2-8。我见过产线因为只开规则1,漏掉连续趋势导致整批均匀性报废。
控制图判读不能只看是否越过控制限。连续多点同侧、连续多点递增递减、周期性起伏等模式都指向特殊原因,需要配合判异规则才能及时发现趋势性异常。
SPC(统计过程控制,Statistical Process Control) 与 FMEA、8D(八步法,8 Disciplines) 等方法应形成闭环:控制图发现异常,原因分析定位根因,纠正措施落实到工艺文件,再通过控制图验证效果。缺任一环节都会导致问题复发。
控制图的采样分组方式会影响灵敏度:把连续相近时间点的数据分为一组(合理子组)能有效过滤过程漂移,凸显子组内的随机波动,从而更准确地估计过程固有波动。
二、规则1-2:最常用也最基础
规则1:任一点超出 3σ 控制限,立即判异。这是底线,不用多说。规则2:连续 9 点在中心线同侧。单看一个点没事,但连续 9 点偏一边,说明过程均值已经悄悄偏移,只是还没出界。
我每天看 trend 第一眼就是规则2:如果连续 7-8 点都在均值上方,哪怕没超 3σ,我也会提前介入查机台。等它真出 3σ,往往已经漂了十几片。规则2是"未雨绸缪"的利器。
过程能力指标中,Cp 只看波动、Cpk(过程能力指数,Process Capability Index) 同时看波动与中心偏移,Ppk(过程性能指数,Process Performance Index) 用总体标准差反映长期实际表现。Cpk 与 Ppk 差距明显时,说明过程中存在系统性偏移或时间相关性,应追查换批、换班或设备漂移。
过程改善后未重算控制限,持续误报导致监控失效。
APC 的有效性依赖测量精度与采样频率。测量滞后超过过程漂移速度时,反馈会失稳甚至放大波动,因此必须评估控制回路的响应能力。
控制回路的响应速度必须快于扰动的变化速度,否则补偿会滞后甚至产生反向效果。因此评估 APC 可行性时,第一步应是比较扰动变化速率与控制回路的响应周期。
三、规则3-4:趋势型异常
规则3:连续 6 点持续上升或下降。这抓的是"渐变",比如腔体老化、耗材损耗导致的缓慢劣化。规则4:连续 14 点上下交替(锯齿)。正常随机过程不该这么规律,锯齿往往暗示数据被人为修匀,或采样周期和某周期信号撞车。
一次我们膜厚连续 6 点单调上升,规则3触发。查下来是加热器老化温度缓升,换了加热块就好了。如果只靠规则1,要等温度飘到出界才报警,那批 waf易已经废了。
控制限与规格线是两套完全不同的界限:控制限由过程自身数据计算得出,反映过程实际能力;规格线由客户或设计给定,反映需求。过程稳定但能力不足时会出现「没有越限却持续超规格」的情形。
量测数据与工艺数据的关联需保证时间与批次对应关系一致,否则分析会出现错位,得出误导性结论。
工程判断力的积累依赖结构化的复盘:把每次问题定位的过程、当时的错误假设、以及最终有效的线索记录下来,形成个人知识库。没有复盘的重复经历不会转化为能力。
自动化改造的优先级可用四个维度筛选:执行频次、规则稳定性、数据量、容错要求。频次高且规则稳定的工作收益最确定。
四、规则5-6:偏移型异常
规则5:连续 3 点中至少有 2 点落在中心线同侧 2σ 以外。规则6:连续 5 点中至少 4 点落在 2σ 外同侧。这两条抓"均值小幅偏移"——单一两点在 2σ 外可能随机,但成组出现就是真偏移。
这两类最容易被忽略,因为单个点没出 3σ 大家就当没看见。我建议 SPC 软件把规则5、6 的报警单独标黄,和规则1的红色区分,养成"黄灯也要查"的习惯。
SPC 的落地顺序通常是先稳定再优化:过程尚未受控时计算能力指标意义有限,因为此时数据混合了特殊原因造成的波动,算出的能力值既不可比也不稳定。
控制图报警后直接调整工艺,未先确认报警是真实特殊原因还是量测或数据问题。
量测系统本身也有波动,所以任何工艺监控结论都建立在测量系统可信的前提上。MSA 的核心问题是:观测到的差异里,有多少是过程真实的差异,有多少只是量测的重复性与再现性。
量测方案的设计要与工艺控制目标对应:SPC 需要能反映过程波动的稳定数据,工艺开发需要更高精度的表征数据,两者对量测设备与抽样频率的要求不同。
五、规则7-8:分布异常
规则7:连续 15 点落在中心线 ±1σ 内。听起来"很稳定"是好事?错。过度集中往往意味着数据被截尾、测量分辨率不够、或过程被过度调整(过度控制)。规则8:连续 8 点全在 ±1σ 外(两侧都有)。这说明数据来自两个不同总体(分层),比如两批不同材质的料混用了。
规则8 我踩过:某参数连续 8 点全在 1σ 外两侧,查出来是两班用的载气供应商不同,纯度差一档。分层问题不解决,CPK 永远算不对。
有效 SPC 的前提是量测系统可信。测量系统波动占过程波动的比例过高时,控制图实际监控的是量测噪声而非过程,因此 MSA 应先于 SPC 完成。
GRR 用于量化量测系统的重复性(同一人同一次测量的波动)与再现性(不同人或不同设备之间的差异)。通行判据是 GRR 占公差比例控制在 10% 以内为优、30% 以上视为不可用。
APC 要解决的问题是设备漂移带来的工艺结果缓慢变化。传统做法靠定期标定与人工调整配方,滞后且不连续;APC 用测量反馈自动修正配方,把漂移及时补偿掉。
量测设备需要定期校准与漂移监控,但校准只保证准确性不保证稳定性。因此除校准外还需用标准片做日常趋势跟踪,才能发现缓慢漂移。
六、用 Python 自己实现一套
别完全依赖软件。我用 30 行 Python 把八条规则写成函数,每天把量测数据灌进去跑一遍,输出触发了哪几条。这样你既懂原理,又能对软件报警做交叉验证。
代码逻辑就是逐条判断:规则1比 3σ,规则2数同侧连续数,规则3数单调段……写成函数后,新数据进来自动标异常类型和位置,比肉眼看图快十倍。下篇我贴完整代码。
多变量监控能发现单变量监控的盲区:多个参数各自都在范围内,但其相互关系(如两个参数的差值或比值)已经偏离,这类异常在单变量控制图上完全不可见。
只做单变量 SPC 而不看参数相关性。实际异常常常联合出现在多个参数上,单变量图各自都不报警。
模型预测控制用过程模型预估参数变化的效果,在约束条件内求解最优调整量。相比简单比例修正,它能同时处理多输入多输出与约束边界。
APC 的控制对象与调整手段必须明确对应:控制对象是最终产品质量指标,调整手段是设备的可控参数。两者之间的传递关系通过模型描述,模型的准确性直接决定控制效果。
写在最后
你们厂 SPC 软件默认开了几条规则?有没有因为只开规则1漏过异常?评论区聊聊,我下篇直接贴 Python 实现八条规则的完整代码。
---
SPC 的核心思想是把过程波动区分为「普通原因」与「特殊原因」:前者是过程固有的随机波动,只能通过改变系统来降低;后者是外来干扰,必须立即定位并消除。混淆两者会导致越调越乱。
量测系统波动与过程波动的区分。
APC 不能替代工艺理解。模型失配、传感器失效或异常工况下,若无人判断干预,控制系统可能长时间运行在错误轨道上,因此必须设置异常识别与人工接管机制。
反馈控制基于已完成的批次结果修正下一批配方,属于事后补偿,对随机扰动无力;前馈控制依据来料状态的测量提前调整,属于事前预防。两者结合才能覆盖主要波动来源。
问题定位能力的核心是假设与验证的循环:先基于现象提出可能的原因排序,再设计成本最低的验证动作逐一排除。缺少这一循环的人往往靠经验直觉反复试错,效率与稳定性都受制于个人经历。
任何自动化流程都必须保留人工复核环节与异常处理路径。自动运行而不设校验的系统,在数据异常时会静默产出错误结果。
数据造假或选择性剔除。为了让图好看而剔除「异常」数据,等于放弃 SPC 的全部价值。
【常见坑】
- 这两类最容易被忽略,因为单个点没出 3σ 大家就当没看见。我建议 SPC 软件把规则5、6 的报警单独标黄,和规则1的红色区分,养成"黄灯也要查"的习惯。
- 规则8 我踩过:某参数连续 8 点全在 1σ 外两侧,查出来是两班用的载气供应商不同,纯度差一档。分层问题不解决,CPK 永远算不对。
- 把 Cpk 当作一次性验收指标,只在客户审核前算一次。Cpk 需要按时间滚动跟踪,才能反映过程是否在退化。
- 用规格线代替控制限画控制图,导致几乎不报警,SPC 沦为形式。控制限必须由过程数据算出。
- 控制限长期不重算。工艺经过改善后过程波动已显著缩小,仍用旧控制限会频繁误报。
常见问题(FAQ)
Q:Cpk 和 Ppk 有什么区别,该看哪个?
A:Cpk 用组内标准差估算,反映过程稳定状态下的固有能力;Ppk 用总体标准差,反映含换批、漂移在内的长期实际表现。日常工艺能力判断看 Cpk,交付能力评估与客户报告通常看 Ppk。两者差距大说明过程不稳定,应先解决稳定性再谈能力。
Q:控制图没有越限,但客户投诉超规格,怎么解释?
A:这是典型的「过程受控但能力不足」。控制限由过程自身波动决定,与规格无关;过程波动大于公差时,即使没有特殊原因,产品也会持续超出规格。解决办法是降低过程波动或放宽规格,而不是继续盯控制图。
Q:Cpk 达到多少才算够?
A:普遍引用的分档是 1.33 为基本要求、1.67 为良好、2.0 以上为优秀,具体应以客户与行业要求为准。需要注意的是,Cpk 是对稳定过程的度量,过程尚未受控时计算 Cpk 意义有限。
Q:多久需要重算一次控制限?
A:没有固定周期,判断依据是过程是否发生了持久变化:设备大修、换料、工艺变更后应重算;过程持续稳定则用较长的历史窗口滚动更新。关键是保留变更记录,避免新旧数据混算。
Q:合理子组是什么意思?
A:合理子组指把在尽可能相同的条件下产生的连续数据归为一组,其目的是让子组内的波动主要来自普通原因,从而真实反映过程固有波动。若把不同班次、不同设备的数据混为一组,子组内波动会包含特殊原因,控制限因此被高估,监控灵敏度下降。
Q:控制图报警频率太高怎么办?
A:先区分三类原因:控制限估计不当(子组划分问题)、过程确实不稳定、以及量测系统波动过大。处理顺序建议从量测系统查起,再修正子组划分,最后才是工艺调整。反过来做容易越调越乱。
【总结】
SPC 统计过程控制的难点往往不在单点技术,而在于把原理、数据与现场验证串成闭环。代码逻辑就是逐条判断:规则1比 3σ,规则2数同侧连续数,规则3数单调段……写成函数后,新数据进来自动标异常类型和位置,比肉眼看图快十倍。下篇我贴完整代码。控制限与规格线是两套完全不同的界限:控制限由过程自身数据计算得出,反映过程实际能力;规格线由客户或设计给定,反映需求。过程稳定但能力不足时会出现「没有越限却持续超规格」的情形。建议先用小范围试点验证有效性,再逐步扩大适用范围,并保留完整的数据与判断记录以便复盘。
术语速查
- SPC(Statistical Process Control,统计过程控制):用控制图等统计方法对过程进行实时监控,区分随机波动与异常波动的管理方法。 工程意义:是把「事后检验」变为「过程预防」的核心工具。
- CP(Chip Probing,晶圆针测):用探针卡对晶圆上每颗芯片进行功能与参数测试,并生成 Bin Map。 工程意义:CP 良率是判断是否继续封装的主要依据。
- Cpk(Process Capability Index,过程能力指数):同时考虑过程中心偏移与波动幅度、衡量过程满足规格能力的过程能力指标。 工程意义:Cpk 低于 1.33 通常被视为能力不足。
- Ppk(Process Performance Index,过程性能指数):以总体标准差计算的过程能力指标,反映长期实际表现。 工程意义:Ppk 与 Cpk 差距大说明过程存在系统性偏移。
- UCL(Upper Control Limit,控制上限):基于过程自身波动计算出的统计界限,超出即判为过程异常。 工程意义:注意控制限由过程数据算出,与规格线含义完全不同。
- OOC(Out Of Control,失控):过程数据超出控制限或触发判异规则的状态。 工程意义:OOC 不等于产品不合格,但必须立即追查原因。
- 8D(8 Disciplines,八步法):从成立小组、描述问题到根因、纠正、预防、固化的一条结构化问题解决路径。 工程意义:适合跨部门质量问题的闭环管理。
相关阅读
- 晶圆厂APC与SPC质量管控详解:控制图判异与Cpk实战
- 半导体FAB良率提升实战:从SPC告警到根因分析的完整闭环
- SPC控制图与Cpk计算Python工具免费下载|Xbar-R+判异
- [半导体FAB设备数据可视化平台实战
从InfluxDB+Grafana到Python自动化全流程](https://www.yezhihui.cn/?id=55)
📚 同栏目延伸阅读:半导体FAB数据采集避坑:花了20万买设备,结果数据不能用、EAP设备自动化:SECS-GEM对接的完整实施路径、MES选型避坑:上错系统产线被拖死还换不掉、半导体人的英语:阅读原版spec的“生存法则”让上手速度翻倍





