工艺参数聚类分群分析器(K-means)
这个工具解决什么问题
过拟合的典型症状是训练集完美、验证集平庸。这工具会同时给出两边指标。
> 同一套配方,良率却分成两档?参数空间里其实混着好几个工况族。
输入数据格式
数据文件 process_clustering.csv,列顺序为:lot、temp、pressure、flow、power、time、yield_pct。
示例首行:L01,400,2.0,120,800,60,96.4
示例输出(真实运行结果节选)
================================================================================ 工艺参数聚类分群分析报告 ================================================================================ 样本批数:21 参与聚类参数:温度C、压力Torr、流量sccm、功率W、时间s 良率仅作外部校验,不参与聚类 【一】分组数选择(轮廓系数越大分得越好,SSE 用于看下降是否还明显) -------------------------------------------------------------------------------- k 组内平方和SSE 轮廓系数 说明 2 27.28 0.678 3 1.36 0.875,SSE 较上一档下降 95% 4 0.98 0.730,SSE 较上一档下降 28% 5 0.72 0.627,SSE 较上一档下降 27% 6 0.53 0.652,SSE 较上一档下降 26% 最优分组数:k = 3(轮廓系数 0.875) 【二】各群规模与良率(外部校验) -------------------------------------------------------------------------------- 群 批数 占比 平均良率 与整体差 群1 8 38.1% 96.42% +2.42 个百分点 群2 7 33.3% 93.67% -0.34 个百分点 群3 6 28.6% 91.18% -2.83 个百分点 群间良率极差:5.24 个百分点 -> 分群有明确工程意义,建议按群区分工艺条件 【三】各群参数画像(原始单位均值,↑↓标记相对全体偏高/偏低) ---------------------------------------------
适用场景
· 工艺条件梳理、良率分层分析、新配方导入前的工况盘点 · 聚类给的是「参数形态相同」,不等于因果;下结论前要核对设备、配方版本与物料批次
怎么用
python process_clustering.py
首次运行会自动生成示例数据并输出一份完整报告; 把示例 CSV 换成你自己的数据(保持列名一致)后重新运行即可。
输入数据
process_clustering.csv:批号 / 温度 / 压力 / 流量 / 功率 / 时间 / 良率(脚本自带 21 批示例)
输出内容
· k=2~6 的组内平方和与轮廓系数表,自动选出最合适的分组数 · 各群规模占比、参数画像(原始均值 + 相对全体的高低标记)与群成员清单 · 群间平均良率极差(外部校验)、离群批清单与工艺窗口建议
依赖
无。仅使用 Python 标准库(csv / math / os / datetime / random 等), 不需要 pip 安装任何包,Windows / Linux / macOS 均可运行。
实用提示
· 报告里的判读阈值都写在脚本顶部常量区,可按自己厂内标准调整。 · 建议按周/按月滚动运行,看趋势比看单次结果更有意义。 · 换数据时保持 CSV 列名不变,脚本无需改动即可复用。
可调参数与计算口径
脚本顶部集中了主要阈值与常量:CSV_FILE="process_clustering.csv"、REPORT_FILE="process_clustering_report.txt"、RESTARTS=12、MAX_ITER=200、SEED=42、SAMPLE_ROWS=[。改完直接重跑即可,不必改动计算逻辑。
会生成哪些文件
运行后除控制台输出外,还会生成:process_clustering.csv、process_clustering_report.txt。
工具中出现的字段与提示
- 压力Torr
- 流量sccm
- 已生成示例数据:%s
- 至少需要 6 批数据
- 工艺参数聚类分群分析报告
- 样本批数:%d 参与聚类参数:%s 良率仅作外部校验,不参与聚类
- 【一】分组数选择(轮廓系数越大分得越好,SSE 用于看下降是否还明显)
- 组内平方和SSE
- 轮廓系数
- 最优分组数:k = %d(轮廓系数 %.3f)
- 【二】各群规模与良率(外部校验)
- 平均良率
- 与整体差
- %-8s %8d %7.1f%% %11.2f%% %+11.2f 个百分点
- 群间良率极差:%.2f 个百分点 -> %s
- 分群有明确工程意义,建议按群区分工艺条件
- 群间良率差不明显,分群更多是参数形态差异
- 【三】各群参数画像(原始单位均值,↑↓标记相对全体偏高/偏低)
其余字段以界面与示例报告为准。
下载与文件清单
压缩包内包含:主程序脚本、示例数据文件、示例输出报告、中文说明文档,以及同主题 AI 提示词一套。解压后按说明运行即可,示例数据可直接试跑。
主程序文件:process_clustering.py。
下载 工艺参数聚类分群分析器(K-means) 工具包(zip)
本站工具免费下载,无需注册。工具为 Python 脚本,Python 3.8 及以上环境可直接运行,核心功能尽量不依赖第三方库。
常见问题
输入数据要准备成什么样?
按 示例首行中的列顺序准备即可,共 7 列:lot、temp、pressure、flow、power、time、yield_pct。列为空或格式不符时结果会失真,建议先用示例数据试跑一遍。
阈值可以改成我们自己的标准吗?
可以,脚本顶部已把主要阈值与常量集中声明,按自己产线的标准修改后重跑即可,不需要改计算逻辑。
附赠的提示词怎么用?
把提示词与自己的数据一起交给大模型,可以让它按同一套口径帮你改写分析流程或扩展报告字段。
示例数据能直接跑吗?
可以。示例数据与主程序在同一压缩包内,解压后直接运行即可看到完整输出,确认无误再替换成自己的台账。
同分类的其它工具
本工具归在 工业AI与智能分析工具包,全部工具见 工具资源包下载页。





