当前位置:首页 > MES/ERP 工厂落地实战 > 正文内容

半导体FAB设备OEE实战:从72%到89%

半导体FAB设备综合效率OEE实战:

【摘要】

本文系统梳理OEE 与产能分析领域的核心问题与落地路径。我是2019年开始接触FAB OEE改善的,当时所在工厂的光刻机综合效率只有72%。全文围绕「问题背景:OEE 72%徘徊,损失根因不明、技术原理:OEE三因子拆解、实战案例:8台光刻机OEE测算与TOP3损失识别、完整代码:Python OEE计算工具、效果对比:9维度量化数据」逐层展开,给出原理说明、实操步骤与验证方法。核心结论:行业趋势方面,TECS(Total Equipment Effectiveness Control System)正在成为高端FAB的标配,…。补充说明:OEE 由三个因子相乘构成:可用率(设备实际运行时间占计划时间的比例)、性能率(实际产出速度相对理论速度的比例)、良品率(合格品占产出的比例)。相乘而非相加,是因为三者互相独立且都是必要损耗。

【核心要点】

  • 问题背景:OEE 72%徘徊,损失根因不明:我是2019年开始接触FAB OEE改善的,当时所在工厂的光刻机综合效率只有72%。听起来好像还行,但对比行业标杆(85%-90%),差距触目惊心。
  • 技术原理:OEE三因子拆解:OEE(Overall Equipment Effectiveness)设备综合效率是TEEP(Total Effective Equipment Perfor…
  • 实战案例:8台光刻机OEE测算与TOP3损失识别:我们工厂有8台ASML光刻机参与OEE改善项目,基准数据采集了连续3个月。原始数据显示平均OEE为72.4%,其中可用率68%,性能率82%,质量率96.5%。
  • 完整代码:Python OEE计算工具:以下代码封装了OEECalculator类,支持从设备日志自动解析停机时间、产出数量和良率,并输出HTML格式报告。
  • 效果对比:9维度量化数据
  • 实施建议:三阶段推进路径:选择1-2台代表性设备,安装数据采集终端(与EAP对接);建立设备事件日志规范,统一event_type分类;采集至少4周连续数据,计算OEE基线;

【适用场景】

  • 产能瓶颈分析与非瓶颈识别。
  • 设备效率损失的分类与改善优先级排序。
  • OEE 统计口径的统一与数据可信度提升。
  • OEE 损失分类的规范化与改善优先级排序。
🔧 配套工具:本节的核算/判读可用站内工具直接跑,推荐 FAB_OEE_设备综合效率计算器 详解、OEE设备效率工具集 详解、OEE设备效率看板工具 详解(zip 包,含可运行 Python 脚本与示例数据)。
这个方向的工具共 59 款,完整清单与选型建议见 OEE与设备效能工具包。全部 351 款见 工具资源包下载页。

一、问题背景:OEE 72%徘徊,损失根因不明

我是2019年开始接触FAB OEE改善的,当时所在工厂的光刻机综合效率只有72%。听起来好像还行,但对比行业标杆(85%-90%),差距触目惊心。更要命的是,每次开会讨论损失原因,设备说工艺参数不对,工艺说设备不稳定,大家各执一词,根本没有统一的数据语言。

那一年,光刻层的报废率高达2.3%,其中超过40%可以追溯到设备非计划停机和速度损失。我们花了大半年时间做改善,项目验收时OEE定格在89%,年化节约成本超过800万。

本文把从72%到89%的完整踩坑路径分享出来,包括OEE三因子拆解方法、TOP损失识别技巧,以及用Python实现的OEE计算工具。

OEE 的单一数字便于横向比较,但只有拆解到六大损失才能指导改善:设备故障、换型调整、空转短暂停机、速度降低、工艺不良、启动废品。每一类损失对应不同的改善路径。

维修效率的提升通常比降低故障率更快见效:备件可得性、维修技能、故障诊断支持三方面的改善,可以直接压缩停机时长,且不依赖长期的可靠性改善。

用 OEE 做跨设备或跨厂比较时必须统一口径,尤其是计划时间的定义。把计划停机、无订单停机算作计划时间还是损失时间,会让同一状态得出完全不同的数值。

二、技术原理:OEE三因子拆解

OEE(Overall Equipment Effectiveness)设备综合效率是TEEP(Total Effective Equipment Performance)的重要组成部分。OEE的核心公式只有一条:

OEE = 可用率 × 性能率 × 质量率

可用率(Availability)=(负荷时间 - 停机时间)/ 负荷时间,反映设备因故障、换型等原因不能运行的比例。性能率(Performance)= 理想Cycle Time × 实际产出数量 / 负荷时间,反映设备运行速度偏离理想速度的程度。质量率(Quality)= 良品数量 / 实际产出数量,反映一次合格的比例。

OEE vs TEEP:OEE是基于计划生产时间的效率,TEEP= OEE × 设备利用率,是基于日历时间的综合效率。FAB通常关注OEE,工厂级管理层看TEEP。

OEE 由三个因子相乘构成:可用率(设备实际运行时间占计划时间的比例)、性能率(实际产出速度相对理论速度的比例)、良品率(合格品占产出的比例)。相乘而非相加,是因为三者互相独立且都是必要损耗。

备件管理在成本与可用性之间取平衡:关键备件缺货造成停机的损失通常远高于备件库存成本,因此备件分级应基于失效影响而非单价。

从人工流程到自动化的过渡应采取双轨并行:先让自动化流程与人工流程同时运行一段时间,用人工结果校验自动化结果,确认稳定后再停用人工环节。直接切换会让未发现的问题直接影响交付。

三、实战案例:8台光刻机OEE测算与TOP3损失识别

我们工厂有8台ASML光刻机参与OEE改善项目,基准数据采集了连续3个月。原始数据显示平均OEE为72.4%,其中可用率68%,性能率82%,质量率96.5%。

从帕累托图可以清晰看到,改善前待机停机(42小时/月)和速度损失(28小时/月)占总损失的80%以上,对应可用率和性能率的两大短板。

针对性改善措施:待机停机 → 推行TPM全员生产维护,设备自主保全小组每周2次预防性检查;速度损失 → 优化光刻机Recipe参数,实测吞吐量提升9.7%;产品报废 → 导入SPC(统计过程控制,Statistical Process Control)实时监控,哨兵点提前30分钟预警。

6个月后OEE从72.4%提升至89.0%,年化减少报废损失约680万,停机时间减少61%。

图1:光刻机OEE改善前后三因子对比(左)及TOP3损失帕累托分析(右)

图2:OEE改善趋势曲线(6个月追踪)

OEE 数据的可信度依赖采集自动化程度:依赖人工记录停机时间与原因的系统,数据质量随时间下降,改善决策也随之失准。

OEE 提升的边际收益递减:损失从高到低依次解决,收益最大的是排名第一的损失项,集中资源改善它比同时铺开多个改善项目更有效。

自动化的价值不仅是节省人力,更在于消除人工搬运带来的错误与延迟。数据时效性提升带来的决策改善,往往超过节省的工时本身。

四、完整代码:Python OEE计算工具

以下代码封装了OEECalculator类,支持从设备日志自动解析停机时间、产出数量和良率,并输出HTML格式报告。核心设计思路:将原始日志按事件类型分类(计划生产/故障停机/速度损失/换型/质量报废),再按OEE三因子公式计算各因子和综合OEE。

OEECalculator.py - OEE计算核心类

import pandas as pd
import numpy as np
from datetime import datetime, timedelta

class OEECalculator:
    """OEE计算器,支持FAB设备日志自动解析"""
    def __init__(self, equipment_id, shift_hours=22.5):
        self.equipment_id = equipment_id
        self.shift_hours = shift_hours * 3600  # 秒
        self.events = []
    
    def load_log(self, log_path):
        # 读取设备日志CSV,字段:timestamp, event_type, duration_sec, qty, reject_qty
        self.df = pd.read_csv(log_path, parse_dates=['timestamp'])
        self.events = self.df.to_dict('records')
    
    def calc_availability(self):
        # 可用率 = (负荷时间 - 故障停机 - 换型时间) / 负荷时间
        fault = sum(e['duration_sec'] for e in self.events if e['event_type'] == 'fault')
        changeover = sum(e['duration_sec'] for e in self.events if e['event_type'] == 'changeover')
        return (self.shift_hours - fault - changeover) / self.shift_hours
    
    def calc_performance(self):
        # 性能率 = (理想CT × 实际产出) / 运行时间
        running = sum(e['duration_sec'] for e in self.events if e['event_type'] in ['production', 'idle'])
        total_qty = sum(e.get('qty', 0) for e in self.events)
        ideal_ct = 12.5  # 秒/片,设备标称值
        return (ideal_ct * total_qty) / running if running > 0 else 0
    
    def calc_quality(self):
        # 质量率 = 良品数 / 总产出
        total = sum(e.get('qty', 0) for e in self.events)
        reject = sum(e.get('reject_qty', 0) for e in self.events)
        return (total - reject) / total if total > 0 else 0
    
    def calc_oee(self):
        a = self.calc_availability()
        p = self.calc_performance()
        q = self.calc_quality()
        return a * p * q, {'availability': a, 'performance': p, 'quality': q}

    def generate_report(self):
        oee, factors = self.calc_oee()
        return {
            'equipment': self.equipment_id,
            'oee': f"{oee*100:.1f}%",
            'availability': f"{factors['availability']*100:.1f}%",
            'performance': f"{factors['performance']*100:.1f}%",
            'quality': f"{factors['quality']*100:.1f}%"
        }

为什么这样写:使用面向对象封装,equipment_id作为实例属性便于多台设备批量计算;shift_hours参数化支持不同班次;calc_oee返回因子字典方便诊断;generate_report输出结构化数据,可对接MES(制造执行系统,Manufacturing Execution System)报表系统。

换型时间的缩短对 OEE 影响往往被低估:换型属于计划内停机但会计入可用率损失,缩短换型时间既能提升 OEE 也能支撑更小批量的生产,从而降低库存。

报表自动化的第一步是识别重复劳动的模式:固定格式、固定来源、固定周期、人工搬运。具备这四个特征的工作最适合自动化,投入产出比最高。

任何自动化流程都需要设置校验点与异常告警:源数据缺失、格式变化、数值异常都应触发告警而非静默产出错误结果。

五、效果对比:9维度量化数据

改善前后关键指标对比(8台光刻机,月度均值):

自动化的价值不仅是节省工时,更在于消除人工搬运带来的错误与延迟。数据时效性提升带来的决策改善往往比省下的人力更有价值。

报表自动化的第一步是流程标准化:口径频繁变化的报表即使自动化也会不断失效,因此先稳定口径与数据源格式,再投入自动化开发。

数据源稳定性是自动化的前提。源数据格式频繁变化时,自动化脚本会反复失效,此时应先推动源数据标准化,而不是不断修补脚本。

六、实施建议:三阶段推进路径

第一阶段(1-2月):数据采集与基线建立

选择1-2台代表性设备,安装数据采集终端(与EAP对接);建立设备事件日志规范,统一event_type分类;采集至少4周连续数据,计算OEE基线;这一步最大的坑是:很多设备的日志格式不标准,需要先做数据清洗,否则OEE计算出来差个10%都不知道原因。

第二阶段(3-4月):TOP损失根因分析与改善

用帕累托图识别TOP3损失;组建跨职能小组(设备+工艺+生产),每周复盘;优先解决可用率问题(改善效果最快);导入TPM自主保全,从被动维修转向预防性维护。

第三阶段(5-6月):标准化与横向推广

将改善措施固化到标准作业指导书;将OEE纳入设备绩效考核(占30%权重);横向推广到刻蚀、CVD(化学气相沉积,Chemical Vapor Deposition)等工序;建立OEE实时看板,每班次更新。

OEE 的改善应从损失最大的类别入手:故障、换型、空转、降速、不良、启动废品六类损失的改善手段完全不同,同时铺开不如集中解决排名第一的损失来得有效。

预测性维护的技术前提是可监测的劣化特征与足够的失效样本。缺少历史失效数据时,先做状态监控与趋势管理是更务实的第一步。

设备台账的准确性是维保管理的前提:设备、腔体、部件三层台账若不能准确对应,故障记录与备件消耗就无法归集,趋势分析也就失去基础。

七、进阶方向:从OEE到智能预测

当前OEE方案的主要局限:事后统计,无法预测未来;依赖人工录入,实时性差;多机台协同调度未覆盖。

下一步方向:基于LSTM时序模型预测未来4小时的OEE趋势,在设备性能劣化前30-60分钟发出预警;将OEE数据与生产排程系统联动,自动生成动态派工建议;引入数字孪生,构建FAB设备群虚拟模型,实现"what-if"场景模拟。

行业趋势方面,TECS(Total Equipment Effectiveness Control System)正在成为高端FAB的标配,将OEE与AI预测深度融合,真正实现从"看得见"到"预测准"的跨越。

📝 互动话题

你们FAB的设备综合效率OEE目前大概在什么水平?最大的损失来源是哪一块?

在实施OEE改善项目时,有什么坑是特别容易踩的?欢迎评论区分享!

觉得这篇文章有收获?欢迎收藏、点赞支持!

您的支持是我持续输出的最大动力!

本文首发于:blog.csdn.net/yeflashzhihui

---

报表自动化的价值需要量化才能持续获得支持:统计前的人工耗时、错误发生率、以及数据产出时间的变化,用具体数字说明收益,比强调技术含量更有说服力。

【常见坑】

  • 本文把从72%到89%的完整踩坑路径分享出来,包括OEE三因子拆解方法、TOP损失识别技巧,以及用Python实现的OEE计算工具。
  • 选择1-2台代表性设备,安装数据采集终端(与EAP对接);建立设备事件日志规范,统一event_type分类;采集至少4周连续数据,计算OEE基线;这一步最大的坑是:很多设备的日志格式不标准,需要先做数据清洗,否则OEE计算出来差个10%都不知道原因。
  • 只报 OEE 数字不拆解损失构成,改善无从下手。
  • 口径不统一导致数据不可比,跨部门争执数字而非事实。
  • 把 OEE 当作考核指标直接压给一线,引发数据美化(人为缩短记录停机时间)。

常见问题(FAQ)

Q:OEE 多少算好?

A:不同行业差异很大,离散制造与流程制造的基准完全不同。更实用的做法是与自身历史趋势比、与同类设备的先进水平比,并关注瓶颈工序的绝对损失。用外部通用数值做硬性目标容易失真。

Q:为什么 OEE 提升了但产出没增加?

A:最可能的原因是改善发生在非瓶颈工序。系统产出由瓶颈决定,非瓶颈的效率提升只会增加在制品堆积而没有产出收益。此外还需确认是否只是把损失从一个类别转移到了另一个类别。

Q:OEE 数据总是不准怎么办?

A:根因通常是停机记录依赖人工且粒度太粗。改进方向是让设备状态自动采集(如通过 PLC 信号或电流判断运行状态),减少人工填报,同时明确停机原因的分类字典,避免「其它」类占比过高。

Q:OEE 数据总是偏高或偏低,怎么校准?

A:先核对口径定义:计划时间是否包含计划保养、待料与无订单时间;良品率是否把返工品计入。口径确定后再检查采集方式,人工记录的停机时长通常偏短。校准的关键是定义文档化,而不是反复调整数值。

Q:OEE 和产能是一回事吗?

A:不完全等同。OEE 衡量设备在计划时间内的有效产出效率,产能则取决于瓶颈工序的有效产出速率。整体产能由瓶颈决定,非瓶颈设备的 OEE 提升通常不会转化为产出增加,但可能降低单位成本或增加柔性。

Q:预测性维护需要多长的数据积累?

A:没有固定门槛,但需要覆盖足够多次的失效过程才能建立劣化模型。实践中先做状态监控与阈值报警,积累数据后再逐步过渡到趋势预测,比一步到位更稳妥。

【总结】

OEE 与产能分析的难点往往不在单点技术,而在于把原理、数据与现场验证串成闭环。行业趋势方面,TECS(Total Equipment Effectiveness Control System)正在成为高端FAB的标配,将OEE与AI预测深度融合,真正实现从"看得见"到"预测准"的跨越。OEE 的单一数字便于横向比较,但只有拆解到六大损失才能指导改善:设备故障、换型调整、空转短暂停机、速度降低、工艺不良、启动废品。每一类损失对应不同的改善路径。建议先用小范围试点验证有效性,再逐步扩大适用范围,并保留完整的数据与判断记录以便复盘。

术语速查

  • OEE(Overall Equipment Effectiveness,设备综合效率):由可用率、性能率、良品率相乘得到的设备效率综合指标。 工程意义:单一数字便于横向比较,但必须拆解到六大损失才能定位问题。
  • MES(Manufacturing Execution System,制造执行系统):位于计划层与控制层之间,负责工单执行、过程追溯、数据采集与质量管控的信息系统。 工程意义:是打通 ERP 计划与车间现场的中间层。
  • CVD(Chemical Vapor Deposition,化学气相沉积):通过气相前驱体在硅片表面发生化学反应生成固态薄膜的工艺。 工程意义:保形性好,适合高深宽比结构的填充前铺垫。
  • SPC(Statistical Process Control,统计过程控制):用控制图等统计方法对过程进行实时监控,区分随机波动与异常波动的管理方法。 工程意义:是把「事后检验」变为「过程预防」的核心工具。
  • AP(Action Priority,措施优先级):按严重度、发生度、探测度的组合直接划分高/中/低优先级,替代单纯依赖 RPN 排序。 工程意义:解决了 RPN 相同但风险性质完全不同的问题。
  • MTBF(Mean Time Between Failures,平均故障间隔时间):设备两次故障之间的平均运行时长,衡量可靠性。 工程意义:MTBF 提升通常意味着维保策略从被动转为预防。
  • MTTR(Mean Time To Repair,平均修复时间):从故障发生到恢复正常的平均耗时,衡量可维护性。 工程意义:降低 MTTR 对产能的影响往往比提升 MTBF 更快见效。

相关阅读

从InfluxDB+Grafana到Python自动化全流程](https://www.yezhihui.cn/?id=55)

进阶:OEE 与产能分析的通用工程判据

瓶颈工序的 OEE 才是决定系统产出上限的关键

瓶颈工序的 OEE 才是决定系统产出上限的关键。非瓶颈工序的 OEE 提升往往只是增加在制品库存,无法转化为产出。

OEE 目标设定应参考设备的设计能力与实际工艺要

OEE 目标设定应参考设备的设计能力与实际工艺要求,盲目追求高 OEE 可能导致过度维修或牺牲产品质量。

设备管理的两类指标需要分开看

设备管理的两类指标需要分开看:MTBF 衡量可靠性(多久坏一次),MTTR 衡量可维护性(坏了多久能修好)。两者对应完全不同的改善动作——前者靠预防与设计,后者靠备件储备、维修技能与流程效率。

维保策略有三种

维保策略有三种:事后维修(坏了再修)、定期维护(按时间或运行量)、预测性维护(按实际状态)。选择依据是失效模式——随机失效适合事后维修,与运行量相关的磨损适合定期维护,有可监测劣化特征的适合预测性维护。

点检的价值在于标准化与可追溯

点检的价值在于标准化与可追溯。没有标准项、没有记录、没有异常反馈闭环的点检,只是形式上的巡查。

📚 同栏目延伸阅读:EAP设备自动化集成实战:Recipe误用事故后的全面重构、半导体FAB智能化仓储物流实战:AGV小车与立体仓库集成、FAB设备健康管理与预测性维护实战:从被动维修到主动预防、MES与RMS集成实战:Recipe配方全生命周期管控

📦 本文相关资源:文中方法可直接用站内工具落地,推荐 FAB_OEE_设备综合效率计算器、OEE设备效率工具集、OEE设备效率看板工具、设备维修知识库 AI 问答器、SPC 判异 AI 归因助手(zip 包,含可运行 Python 脚本与示例数据)。更多同类工具见 工具资源包下载页(共 351 款)。

相关文章

MES制造执行系统:半导体FAB的信息中枢到底管什么

MES制造执行系统:半导体FAB的信息中枢到底管什么

【摘要】 本文系统梳理MES 制造执行系统领域的核心问题与落地路径。Manufacturing Execution System — 当FAB遇上数字化转型,信息流如何驱动价值流?。全文围绕「问题背...

APC先进过程控制:工艺参数自动调控的秘密武器

APC先进过程控制:工艺参数自动调控的秘密武器

【摘要】 本文系统梳理APC 先进过程控制领域的核心问题与落地路径。我在FAB里做工艺工程师的时候,最头疼的事情就是调参数。全文围绕「问题背景:手动调整的局限性、技术原理:R2R控制与核心算法、实战...

半导体行业职业进阶:从新人到专家的成长路线图

半导体行业职业进阶:从新人到专家的成长路线图

【摘要】 本文系统梳理工程师能力与方法论领域的核心问题与落地路径。我做半导体工程师10年了,从FAB工艺工程师做到整合主管,再到现在做智能制造顾问。全文围绕「问题背景:为什么我要写这篇文章?、技术原...

存储器技术详解:DRAM/NAND/HBM一篇看懂

存储器技术详解:DRAM/NAND/HBM一篇看懂

从存储单元结构到市场格局:全面拆解三大存储技术的原理与应用 【摘要】 本文系统梳理工业 AI 与机器学习落地领域的核心问题与落地路径。从存储单元结构到市场格局:全面拆解三大存储技术的原理与应用。全文...

FDC故障检测与分类:FAB设备异常的"天眼系统"

FDC故障检测与分类:FAB设备异常的"天眼系统"

【摘要】 本文系统梳理设备管理与预测性维护领域的核心问题与落地路径。我在FAB做整合工程师的时候,有一次刻蚀机出了异常,射频功率悄悄漂移了5%,持续了整整2个小时才发现——因为没有实时监控,…。全文...

APC系统实施避坑指南:从选型到落地

APC系统实施避坑指南:从选型到落地

【摘要】 本文系统梳理APC 先进过程控制领域的核心问题与落地路径。APC(Advanced Process Control,先进过程控制)是半导体制造中用算法自动调控工艺参数的技术。全文围绕「什么...