属性一致性Kappa分析器|SPC实战工具
这个工具解决什么问题
针对「属性型」判定(外观目检、听音、通止规、颜色卡)的一致性分析: 同人两次重复(重复性)→ 各人与基准比对(准确度)→ 全体一致性(Fleiss kappa), 按 Landis & Koch 标准判读,并自动导出分歧零件清单做成标准件库。
输入数据格式
数据文件 attr_agreement.csv,列顺序为:part、ref、评价人A_T1、评价人A_T2、评价人B_T1、评价人B_T2、评价人C_T1、评价人C_T2。
示例首行:P01,合格,合格,合格,合格,合格,合格,合格
示例输出(真实运行结果节选)
属性一致性 Kappa 分析报告 ============================================================================== 样本:50 个零件 × 3 名评价人 × 2 次重复判定(类别:合格/不合格) 【一、各评价人:重复性(自己两次是否一致)与准确度(对基准)】 评价人 重复一致率 重复Kappa 对基准一致率 对基准Kappa 评价人A 98.0% 0.951 99.0% 0.975 评价人B 94.0% 0.848 97.0% 0.925 评价人C 92.0% 0.802 96.0% 0.901 【二、判读标准(Landis & Koch 1979)】 Kappa >0.81 极好 | 0.61~0.80 显著 | 0.41~0.60 中等 | 0.21~0.40 一般 | <0.21 差 质量体系通行门槛:同一评价人重复 Kappa ≥0.90;对基准 Kappa ≥0.75。 评价人A:重复 Kappa 0.951(极好(almost perfect));对基准 Kappa 0.975(极好(almost perfect))→ 综合达标 评价人B:重复 Kappa 0.848(极好(almost perfect));对基准 Kappa 0.925(极好(almost perfect))→ 综合不达标 评价人C:重复 Kappa 0.802(显著(substantial));对基准 Kappa 0.901(极好(almost perfect))→ 综合不达标 【三、全体一致性(Fleiss' Kappa,含所有评价人)】 平均成对一致率 P̄ = 0.9520 Fleiss Kappa = 0.881 → 极好(almost perfect) 最弱环节:评价人C(对基准 Kappa 0.901)—— 系统一致性的短板决定整体判定可信度。 【四、分歧零件清单(建议纳入标准件库复盘)】 P09 基准=合格 判定分布 合格×4 不合格×2 P16 基准=合格 判定分布 合格×5 不合格×1 P31 基准=合格 判定分布 合格×5 不合格×1 P37 基准=不合格 判定
解决什么问题
「这个检具/这个人到底靠不靠谱?」——属性判定没有数值可算,只看整体合格率 会掩盖两类问题:自己跟自己不一致(重复性差)与跟基准不一致(准确度差)。 本工具把两者拆开算,并指出具体是哪几个零件在制造分歧,可以直接拿去复盘。
使用方法
python attr_kappa.py # 自动生成示例数据并出报告 python attr_kappa.py 我的.csv # 用自己的数据
不依赖第三方库,Python 3.8+ 直接运行。
输入格式(CSV,UTF-8)
· ref:基准/标准判定(也可填「未知」只做一致性不算准确度) · 每位评价人 2 次判定的列名形如 评价人X_T1 / 评价人X_T2
输出说明
· attr_agreement.csv:示例数据(首次运行自动生成) · attr_kappa_report.txt:总体一致性、逐人重复性/准确度、kappa 判读、 分歧零件清单与改善建议
适用场景
目检工位上岗认证、检具 GR&R 的属性版本、客户投诉复判一致性核查。
注意事项
一致性分析要求样本中合格与不合格都要有足够数量(建议各占 30% 以上), 全是合格品的样本会算出虚高的 kappa。
可调参数与计算口径
脚本顶部集中了主要阈值与常量:CATS=["合格", "不合格"]、CSV_NAME="attr_agreement.csv"、REPORT_NAME="attr_kappa_report.txt"。改完直接重跑即可,不必改动计算逻辑。
会生成哪些文件
运行后除控制台输出外,还会生成:attr_agreement.csv、attr_kappa_report.txt。
脚本里的主要处理步骤
make_sample():3 名评价人各判定 2 次,50 件产品(36 合格 / 14 不合格),含 1 个疑难件。kappa():Cohen's kappa:pairs 为 (判定1, 判定2) 列表。fleiss_kappa():Fleiss' kappa:每个受试对象被多人多次判定(视为 n 次评定)。
以上步骤在脚本中是分开的函数,可以单独调用或按需替换其中一段,不必整体重写。
工具中出现的字段与提示
- 极好(almost perfect)
- 显著(substantial)
- 中等(moderate)
- 一般(fair)
- 差(slight/poor)
- 评价人A
- 评价人B
- 评价人C
- 属性一致性 Kappa 分析报告
- 样本:%d 个零件 × %d 名评价人 × 2 次重复判定(类别:%s)
- 【一、各评价人:重复性(自己两次是否一致)与准确度(对基准)】
- 重复一致率
- 重复Kappa
- 对基准一致率
- 对基准Kappa
- 【二、判读标准(Landis & Koch 1979)】
- 【三、全体一致性(Fleiss
- 平均成对一致率 P̄ = %.4f
其余字段以界面与示例报告为准。
下载与文件清单
压缩包内包含:主程序脚本、示例数据文件、示例输出报告、中文说明文档,以及同主题 AI 提示词一套。解压后按说明运行即可,示例数据可直接试跑。
主程序文件:attr_kappa.py。
本站工具免费下载,无需注册。工具为 Python 脚本,Python 3.8 及以上环境可直接运行,核心功能尽量不依赖第三方库。
常见问题
输入数据要准备成什么样?
按 示例首行中的列顺序准备即可,共 8 列:part、ref、评价人A_T1、评价人A_T2、评价人B_T1、评价人B_T2、评价人C_T1、评价人C_T2。列为空或格式不符时结果会失真,建议先用示例数据试跑一遍。
跑完最该关注哪几项?
报告按 二、判读标准(Landis & Koch 1979)、四、分歧零件清单(建议纳入标准件库复盘)、五、结论与改善动作 等部分组织,其中判定结论与建议部分直接对应下一步动作。
阈值可以改成我们自己的标准吗?
可以,脚本顶部已把主要阈值与常量集中声明,按自己产线的标准修改后重跑即可,不需要改计算逻辑。
附赠的提示词怎么用?
把提示词与自己的数据一起交给大模型,可以让它按同一套口径帮你改写分析流程或扩展报告字段。
同分类的其它工具
分类归属:SPC与质量分析工具包;完整清单在 工具资源包下载页。





