数据质量体检器|工程效率工具
这个工具解决什么问题
把重复劳动交出去,人的注意力才能放在判断上。
> 分析前先体检:缺失、非数值、重复行、离群、量级异常、日期乱序一次扫出来。
输入数据格式
数据文件 messy_data.csv,列顺序为:日期、设备、温度、产量、班次。
示例首行:2026-09-01,刻蚀机-01,250.4,4800,A班
示例输出(真实运行结果节选)
数据质量体检报告
表:messy_data.csv,5 列 × 18 行
==========================================================================
一、逐列体检
--------------------------------------------------------------------------
列名 类型 缺失率 唯一值 离群值 量级异常 常量列
日期 日期 0.0% 17 0 0 否
设备 文本 0.0% 3 0 0 否
温度 数值 5.6% 16 0 1 否
产量 数值 5.6% 15 1 0 否
班次 文本 0.0% 1 0 0 是
二、问题清单
--------------------------------------------------------------------------
• [重复行] 第 8 行
整行内容与前面的行完全相同,应删除或确认是否重复录入
• [缺失值] 第 12 行
列「温度」存在空值,需补齐或标记为无数据
• [非数值混入] 第 6 行
列「温度」混入非数值内容(N/A(第6行)),需统一口径
• [量级异常] 第 5 行
列「温度」有远小于列中位数的值:25.0(第5行) —— 疑似录入漏位或单位不一致
• [缺失值] 第 4 行
列「产量」存在空值,需补齐或标记为无数据
• [非数值混入] 第 10 行
列「产量」混入非数值内容(待确认(第10行)),需统一口径
• [离群值] 第 15 行
列「产量」有超出 3.5σ 的值:99999(第15行)
• [常量列] 全表
列「班次」取值唯一(A班),对分析无信息量,可考虑删除
• [日期乱序] 第 12 行
第 12 行日期 2026-09-12 早于上一行 2026-09-20,需确认是否排序错误或补录
• [日期乱序] 第
适用场景
· 任何做数据分析/建模前的第一步,也适合交给新人当数据规范教材 · 量级异常专门抓「25.0 本应 250.0」这类录入漏位,常规 3σ 抓不到
怎么用
python data_quality_profiler.py
首次运行会自动生成示例数据并输出一份完整报告; 把示例 CSV 换成你自己的数据(保持列名一致)后重新运行即可。
输入数据
messy_data.csv:任意业务表(脚本自带 18 行含 8 类典型脏数据)
输出内容
· 逐列体检表:类型、缺失率、唯一值、离群值、量级异常、常量列 · 问题清单(带行号与说明) · 体检得分与评级、修复建议
依赖
无。仅使用 Python 标准库(csv / math / os / datetime 等), 不需要 pip 安装任何包,Windows / Linux / macOS 均可运行。
实用提示
· 报告里的判读阈值都写在脚本顶部常量区,可按自己厂内标准调整。 · 建议按周/按月滚动运行,看趋势比看单次结果更有意义。 · 换数据时保持 CSV 列名不变,脚本无需改动即可复用。
可调参数与计算口径
脚本顶部集中了主要阈值与常量:CSV_NAME="messy_data.csv"、REPORT_NAME="data_quality_report.txt"。改完直接重跑即可,不必改动计算逻辑。
会生成哪些文件
运行后除控制台输出外,还会生成:messy_data.csv、data_quality_report.txt。
工具中出现的字段与提示
- 刻蚀机-01
- 薄膜机-02
- 非数值混入
- 列「%s」混入非数值内容(%s),需统一口径
- 列「%s」有超出 3.5σ 的值:%s
- 量级异常
- 列「%s」有远小于列中位数的值:%s —— 疑似录入漏位或单位不一致
- 日期乱序
- 第 %d 行日期 %s 早于上一行 %s,需确认是否排序错误或补录
- 日期格式不一致
- 日期列混用斜杠与横杠两种写法,需统一为 YYYY-MM-DD
- 数据质量体检报告
- 表:%s,%d 列 × %d 行
- 一、逐列体检
- 二、问题清单
- 未发现明显数据质量问题。
- 第 %s 行
- 三、体检得分
其余字段以界面与示例报告为准。
下载与文件清单
压缩包内包含:主程序脚本、示例数据文件、示例输出报告、中文说明文档,以及同主题 AI 提示词一套。解压后按说明运行即可,示例数据可直接试跑。
主程序文件:data_quality_profiler.py。
本站工具免费下载,无需注册。工具为 Python 脚本,Python 3.8 及以上环境可直接运行,核心功能尽量不依赖第三方库。
常见问题
输入数据要准备成什么样?
按 示例首行中的列顺序准备即可,共 5 列:日期、设备、温度、产量、班次。列为空或格式不符时结果会失真,建议先用示例数据试跑一遍。
阈值可以改成我们自己的标准吗?
可以,脚本顶部已把主要阈值与常量集中声明,按自己产线的标准修改后重跑即可,不需要改计算逻辑。
附赠的提示词怎么用?
把提示词与自己的数据一起交给大模型,可以让它按同一套口径帮你改写分析流程或扩展报告字段。
示例数据能直接跑吗?
可以。示例数据与主程序在同一压缩包内,解压后直接运行即可看到完整输出,确认无误再替换成自己的台账。





