当前位置:首页 > 随笔复盘 > 正文内容

用Whisper转写产线交接班录音:自动生成异常台账

[公开] 用Whisper转写产线交接班录音:自动生成异常台账

【摘要】交接班的口头信息是产线最宝贵也最容易丢失的资产:夜班发生了什么异常、怎么处置的、还有哪些遗留问题,全凭一张嘴和一本手写本。本文分享一个落地实践:用Whisper把交接班录音自动转成文字,再用LLM抽取结构化信息,自动生成异常台账,术语识别、信息抽取、隐私合规的坑全部踩过一遍。

分类:半导体AI融合 | 发布:2026-08-10 | 首发:半导体智能制造博客

一、背景故事:交接班本上的"信息黑洞"

产线的交接班,大概是信息损耗最严重的管理环节。白班下班前,当班工程师把本班发生的事口头讲给夜班同事:哪个腔体报警过、哪批wafer异常、哪个参数调过、还有哪些问题没处理完。夜班同事一边听一边记,运气好记个七八成,运气差漏掉关键信息。第二天白班再来,夜班又讲一遍,信息再打一次折。

我们厂的情况更具体:异常台账靠手工补录,白班工程师下班后花半小时把夜班发生的事填进系统,但夜班的人已经走了,很多细节记不清。统计下来,台账的完整率只有六成左右——意思是四成异常要么没记录,要么记录的信息残缺。更麻烦的是,交接班讨论里的"处置经验"(当时怎么判断的、为什么这么处理)完全没有沉淀,下次遇到同样问题还得从头摸索。

转机出现在今年年初:我们尝试用Whisper把交接班录音自动转写成文字,再用大模型抽取结构化信息,自动生成异常台账。跑通之后,台账完整率从六成提到了九成五,交接班知识第一次被完整保存下来。这篇文章把整个方案的技术细节、踩过的坑和效果数据完整分享出来。

二、技术原理:Whisper与信息抽取的流水线

Whisper是OpenAI开源的语音识别模型,核心是编码器-解码器的Transformer架构:编码器把音频转成特征序列,解码器逐token生成文本,支持多语言,自带时间戳对齐能力。对我们这种场景,最有用的是两点:一是中文识别质量高,二是可以输出每个词的时间戳,方便后续对齐到录音的哪个时间段。

整套流水线分四步。第一步:录音采集,交接班时用录音笔或手机录下全程。第二步:转写,Whisper把音频转成带时间戳的文本。第三步:信息抽取,把转写文本喂给LLM,用提示词抽取结构化字段,输出JSON。第四步:入库,JSON写入台账数据库,异常自动关联到设备、批次。四步里,前两步是通用能力,后两步的定制化决定了方案好不好用。

为什么不用现成的会议转写软件?试过,但产线场景有三个特殊需求它们满足不了:一是专业术语(CVD、ETCH、腔体号、SECS报警码)识别准确率要求高;二是输出必须是结构化字段而不是自由文本,要直接进台账系统;三是数据不出厂区的合规要求,云端的会议软件没法用。自建流水线虽然要花时间,但每一点都是刚需。

三、现状分析:传统交接班的流程与缺陷

先还原传统交接班的标准流程。班次结束前半小时,当班工程师开始整理本班记录,包括:设备异常(哪个腔体、什么报警、处理动作)、批次异常(哪些lot受影响、良率情况)、参数变更(谁改了哪个参数、为什么改)、遗留事项(哪些问题需要下一班继续跟进)。然后双方到交接班室,口头过一遍,签字确认。

这个流程的缺陷是系统性的。第一,口头传递的信息衰减:一次交接十几分钟,信息密度高,听的人记不全很正常。第二,记录介质脆弱:手写本容易丢、容易字迹难辨,电子表格靠人工录入,漏录错录难免。第三,信息不可检索:交接班记录是流水账,想查"上周三CVD-02腔体报过什么警"要翻半天本子。第四,经验不沉淀:处置思路、判断过程这些最有价值的信息,从来不会写进台账。

我们做了个摸底:随机抽了一个月的交接班记录,对照当天的设备日志和工单记录,发现漏记的异常占三成,记录信息不完整的占一成半,还有约一成记录与实际情况有出入。台账作为追溯依据的可靠性,其实比管理层以为的低得多。

四、瓶颈问题:落地时踩过的五个坑

坑一:术语识别。Whisper默认词表里没有"腔体""CVD""刻蚀机台""SECS报警"这类词汇,第一次测试,转写文本里把"ETCH"听成"爱去",把"腔体"听成"枪体",术语准确率只有六成。坑二:口语化与倒装。交接班讲话大量使用口语、省略主语、夹杂数字,"那个3号腔昨天换了heater,今天又报了"这种句子,LLM抽取时很容易把时间、设备、动作对应错。

坑三:多人同时讲话。交接班有时是两三个人一起说,交叉讲话时Whisper会把两句话混成一句,抽取结果直接乱掉。坑四:环境噪声。产线附近录的音有设备背景噪声,信噪比低的时候识别率明显下降。坑五:合规与部署。录音涉及产线信息,必须本地部署,Whisper大模型要GPU,当时IT只给了CPU机器,large模型跑不动,v3模型转写半小时录音要二十分钟,速度不达标。

还有一个隐性坑:台账字段设计。最初我们设计的字段跟传统台账一样(时间、设备、异常、处置),但LLM抽取时发现"处置经验"这类自由文本字段抽取质量很差,后来把字段重新设计成"异常现象、判断依据、处置动作、遗留事项"四个结构化字段,抽取质量立刻上来了。

五、解决方案:五个坑的对应解法

解法一:术语热词与提示词定制。Whisper的initial_prompt参数可以注入上下文,我们把厂里的设备清单、腔体编号、常用术语列表塞进去,术语识别准确率从六成提到九成以上。同时转写后加一道"术语修正"规则,用正则把常见的错误映射("爱去"→"ETCH")自动纠正。解法二:LLM抽取用结构化提示词,明确每个字段的定义、格式、示例,并让模型先输出"抽取依据"再输出结果,减少错配。

解法三:录音约束。规定交接班时主要发言人佩戴领夹麦,交叉讲话时按"谁主讲谁发言"的纪律来,实在避免不了的片段,转写后人工在抽取前过滤掉"噪声句"。解法四:降噪与分段。转写前先用简单的高通滤波去低频设备噪声,录音按时间戳分段转写,避免长音频的累积误差。

解法五:部署方案改为GPU推理。申请了一台带单张消费级GPU的服务器,Whisper large-v3转写半小时录音从二十分钟压到四分钟,交接班结束后五分钟内台账就能生成。数据全程本地处理,不出厂区,合规问题解决。字段设计上,把自由文本拆成四个结构化字段后,抽取准确率从七成五提升到九成五。

六、实战案例:一次完整的技术验证过程

验证过程分三个阶段。第一阶段(两周):概念验证。收集两周的真实交接班录音共四十八段,人工转写作为基准,对比Whisper自动转写的字错误率。初始字错误率约百分之十二,加入术语热词和降噪后降到百分之五,对台账场景完全够用。第二阶段(三周):抽取链路。设计提示词模板,用三十段录音人工标注抽取结果做评测,迭代了三版提示词,字段级准确率从八成提到九成五。

第三阶段(一个月):试点运行。选了一个工艺区试点,交接班录音自动转写、自动抽取、自动生成台账草稿,值班长审核确认后入库。试点一个月,共处理一百二十次交接班,生成台账一百一十条,对比传统手工补录:台账完整率从六成提升到九成五,平均补录时间从每班三十分钟降到五分钟,漏记的异常从每月约十起降到两起以内。

最惊喜的副产品是"处置经验库":转写文本里的判断过程和处置动作被结构化保存后,我们积累了上百条真实处置案例。新工程师遇到同类异常时,直接在系统里搜历史处置记录,相当于把最有经验的师傅的"口头禅"变成了可检索的知识库。

七、实施效果:台账从"应付检查"变成"决策资产"

方案上线三个月的整体效果:台账完整率稳定在九成五以上,异常记录的追溯准确性大幅提升,品保和工艺团队做异常复盘时终于有了可信的依据。交接班时长也因为信息传递效率提高而缩短——大家知道录音会被转写成台账,讲的时候更有条理,平均交接班时间从二十分钟缩短到十二分钟。

成本账也值得算:硬件投入是一台GPU服务器加录音设备,一次性成本约数万元;运行成本主要是推理电费,可以忽略;人力投入是开发期约两个月的工作量。对比的收益是:每月减少约八起漏记异常,按每起异常平均损失工时四小时、每小时产能成本数千元估算,两个月就收回了投入。

最后说三点经验:第一,这类AI落地的关键不在模型,在数据链路——录音质量、术语表、字段设计决定了效果上限;第二,让一线工程师参与提示词和字段设计,他们才知道什么信息对台账真正有用;第三,先从单点场景跑通再推广,别一上来就铺全厂。

八、常见问题与延伸阅读

Q1:转写文本里专业术语还是错,怎么办?

术语问题有三层解法,从简单到复杂依次上。第一层:Whisper的initial_prompt参数,把设备清单、腔体编号、工艺名词列表作为上下文注入,识别准确率会有明显提升;第二层:转写后加一道规则修正,把高频错误映射表做成正则替换(比如"爱去"替换为"ETCH"、"枪体"替换为"腔体"),错误映射表在试点期积累,两周就能覆盖八成以上的高频错误;第三层:对仍然识别错的术语,用LLM结合上下文自动纠错——把设备清单喂给LLM,让它根据语义判断"用户说的是哪个术语"。三层叠加,术语准确率可以稳定在九成五以上。

Q2:LLM抽取的信息不靠谱,敢直接进台账吗?

敢,但要有兜底设计,不能裸奔。我们的做法是三级审核:第一级,LLM抽取结果先做规则校验——时间格式、设备编号是否在清单里、必填字段是否齐全,不合规的直接标红;第二级,值班长在系统里做人工确认,看到的是"抽取结果加转写原文对照",确认时间从每班三十分钟降到五分钟;第三级,每周抽样复核,对比台账与原始录音,统计抽取准确率并回灌给提示词迭代。这套"机器抽取、人工确认、定期复核"的流程,既保留了自动化的效率,又守住了台账质量的底线。

Q3:录音涉及隐私和保密,合规上要注意什么?

合规是这类项目的前提,我们踩过的坑总结成四条。第一,知会同意:交接班区域张贴告示,向员工说明录音仅用于交接班信息记录,不用于监控个人;第二,最小化存储:录音文件保留三十天后自动删除,只保留转写文本和台账数据;第三,访问控制:录音和转写文本按角色授权,值班长以上才能访问,操作留痕;第四,数据不出厂:全部处理在厂内服务器完成,不调用任何云服务。把合规设计放在项目第一天而不是最后一天,否则上线前合规审查不过,前面全白做。

延伸思考:交接班知识库还能怎么用?

台账自动化只是起点,沉淀下来的转写文本是更值钱的资产。三个延伸方向:第一,异常处置案例库,把"异常现象加处置动作"结构化,新工程师遇到同类异常直接检索历史处置记录,相当于把老师傅的经验变成可查询的知识;第二,交接班质量分析,统计各班组交接班的完整度、异常报告的详细度,反向推动交接班规范;第三,与设备日志联动,台账里的异常事件自动关联设备日志和工艺参数,异常复盘时一条时间线看全所有信息。每走一步,交接班数据从"记录"向"资产"的转化就更深一层。

Q4:整套方案的硬件和运行成本大概多少?

按我们这套单厂区部署的配置算一笔账。硬件:一台带单张消费级GPU(显存二十四G左右)的服务器,约数万元;录音设备用领夹麦加录音笔,每间交接班室几百元,按十间算不到万元。软件:Whisper、LLM全部用开源模型,零授权费。运行成本:主要是电费,GPU推理半小时录音约四分钟,一天几十次转写,电费可以忽略;存储按录音保留三十天算,每月几十G,成本极低。人力成本是大头:开发期两个人月左右,日常维护每周几小时。总体看,一次性投入几万元,每月运营成本千元级,对比台账完整率提升带来的管理收益,投入产出比非常划算。

最后总结一下这个项目最核心的经验:AI工具在产线落地,难的不是模型,是"把模型嵌进现有流程"。Whisper再好用,如果交接班习惯不改、字段设计不合理、审核流程不配套,照样落不了地。我们花在流程设计上的时间,是模型调试的两倍,但正是这部分工作,让方案真正活了下来。给想做类似项目的同行一句话:先想清楚业务流程的每个环节,再谈技术选型,顺序别反。

九、行动清单:两周内跑通的最小验证

如果你对这个方案感兴趣,建议按最小成本先验证两周:第一周,用一台普通电脑跑Whisper(CPU也能跑,慢一点而已),把两周的交接班录音转成文字,手工整理术语错误清单,这就是你的热词表初稿;第二周,用你手上的大模型API或本地模型,写一版信息抽取提示词,把转写文本抽成台账字段,人工核对一周的抽取准确率。两周后你就有了一组真实数据:术语准确率多少、抽取准确率多少、完整率提升多少,拿着这组数据去申请GPU服务器和立项,比任何PPT都有说服力。先跑起来,再谈完善。

补充一个上线后的观察:方案跑顺之后,交接班的质量本身也在提升。因为知道录音会被转写、内容会被记录,大家交接班时讲得更完整、更有条理,很多以前"口头说说就完了"的细节,现在都会主动讲清楚。工具改变了流程,流程反过来塑造了习惯,这是这个项目最意外的收获。

八、配图:数据可视化

图1:录音转写台账自动化流水线

图2:转写与台账效果对比

九、异常台账结构化字段设计表

十、优化前后台账质量对比表

十一、配套资料与实战工具

本文配套了完整的实战工具包,包含文中涉及的参数模板、检查清单、SQL脚本和自动化脚本,可直接用于工厂落地实施。

点击上方「VIP资源」下载区,免费获取以下五项配套资料(持续更新中):

MES/设备通信接口性能优化参数模板(连接池、超时、限流配置)

缺陷回顾标准判读流程与SEM特征对照手册

SQL窗口函数良率分析实战脚本集(含示例数据)

光刻显影缺陷排查Checklist与DOE实验记录表

SPC箱线图分析与Whisper台账自动化Python脚本包

────────────────────────────────────────

本文首发于博客:半导体智能制造 | MES工程师实战笔记

你遇到过类似的问题吗?是怎么解决的?欢迎在评论区分享你的实战经验,一起交流进步。

标签:半导体AI融合 | Whisper | 语音转写 | 交接班 | 异常台账 | 自动化

标签: Python

相关文章

MES报表数据对不上:批次状态不一致排障

MES报表数据对不上:批次状态不一致排障

[公开] MES报表数据对不上:批次状态不一致排障 【摘要】本文针对半导体Fab生产中常见的MES/CIM系统落地类问题,从问题背景、原因定位、完整解决步骤到避坑经验,给出可直接落地复用的实战方案。文...

Python自动生成SPC周报:pandas+matplotlib实战

Python自动生成SPC周报:pandas+matplotlib实战

[公开] Python自动生成SPC周报:pandas+matplotlib实战 【摘要】本文针对半导体Fab生产中常见的Python自动化类问题,从问题背景、原因定位、完整解决步骤到避坑经验,给出可...

控制限和规格限混用:新人最常犯的致命错误

控制限和规格限混用:新人最常犯的致命错误

控制限和规格限混用:新人最常犯的致命错误 控制限(±3σ过程能力)与规格限(客户要求)的本质区别,混用导致的误判案例与正确用法 新人把USL/LSL当成控制限画在SPC图上,结果整天误报警——这两个&...

湿法清洗的颗粒控制:颗粒度检测与工艺优化

湿法清洗的颗粒控制:颗粒度检测与工艺优化

湿法清洗的颗粒控制:颗粒度检测与工艺优化 湿法清洗工艺中颗粒污染的来源、颗粒度检测方法(SPC/液滴激光)与工艺参数优化 【开篇】清洗完的晶圆颗粒数超标,良率掉了3个点——问题出在清洗液、槽体还是干燥...

Python实现CPK批量计算:多参数一键出报告

Python实现CPK批量计算:多参数一键出报告

Python实现CPK批量计算:多参数一键出报告 用Python批量计算几十个工艺参数的Cp/Cpk/Pp/Ppk,自动判定能力等级并生成Word报告 【开篇】每个月要算200个参数的CPK,手动算到...

光刻焦距窗口(DOF):工艺窗口的多因子分析

光刻焦距窗口(DOF):工艺窗口的多因子分析

光刻焦距窗口(DOF):工艺窗口的多因子分析 光刻焦深(DOF)与NA/波长/光刻胶厚度的关系,焦距窗口的DOE优化与良率影响 ────────────────────────────────────...