当前位置:首页 > 未命名 > 正文内容

工业AI与智能分析工具包(36款)|良率预测·异常检测·大模型落地

工厂里谈 AI,最贵的成本不是算力,是「做出来没人用」。原因往往是模型没有嵌进任何一条现有流程:预测结果浮在一个页面上,工程师还得手工去比对、去抄写。这个分类的取向是把模型做成工艺科自己就能跑、能解释、能接进日报的形式,先解决一个具体的小问题,再谈平台。

这类问题,工具是怎么解决的

  • 模型准确率 93%,但工程师不信任:特征含义说不清,出结果也没法解释为什么
  • 样本量不够就上深度学习:几百条数据训出来的模型,换一批产品就失效
  • 预测结果无法落地:模型跑在笔记本上,没有接口、没有告警、没人负责看
  • 大模型用起来像聊天机器人:问它工艺问题答得很流畅,但数据对不上现场

工具清单(共 36 款)

每款工具为一个 zip 包,内含可运行的 Python 脚本、示例数据与说明文档,基于标准库实现,无需安装额外依赖。点击名称可直接取用。

能耗·水耗·碳排核算(14 款)

异常检测与预测建模(14 款)

大模型与智能助手(5 款)

良率·缺陷·参数优化(3 款)

怎么选:三条建议

  1. 先从异常检测和报表自动化这类「错了也没大损失」的场景入手,让现场先看到模型每天自动跑出来的东西,再逐步过渡到影响决策的预测。
  2. 样本有限时优先选树模型与统计方法(XGBoost、逻辑回归、阈值 + 统计检验),它们在几百条样本上的外推表现通常比神经网络稳,而且特征重要性可以直接解释。
  3. 要验证工具是不是真的做了样本外测试。只在训练集上报准确率的模型,在现场翻车的概率极高;工具默认按时间切分训练/验证集,并输出样本外指标。

配套阅读

下面这些文章讲的是同一批问题的现场做法,工具怎么用、结论怎么读,先看文章再动手更快。

常见问题

几百条数据能做良率预测吗?

能,但要做对两件事:一是特征要选物理上有因果关系的(不能把事后数据当特征),二是必须按时间切分做样本外验证。工具默认这么做,并会提示样本量不足的风险。

大模型能直接读我的工艺文件回答问题吗?

可以,做法是把工艺文档切块做检索再交给模型(RAG)。关键是限制模型只能依据检索到的原文回答,检索不到就明确说不知道,避免它用通用知识编一个看起来合理的参数。

异常检测没有标签怎么验证效果?

用植入信号的方式验证:往正常数据里人为注入已知幅度的偏移,看模型能不能在合理延迟内报出来。工具自带这套验证——报不出来或延迟过大,就在报告里直接指出来。

这些脚本要 GPU 吗?

不需要。全部基于 Python 标准库或轻量依赖实现,普通办公电脑即可运行完成示例规模的训练与推理。

工具包导航

全部工具按方向分成 7 个分类,可按需直达:

本类工具详解页

每款工具的输入格式、输出解读、算式口径与常见坑都有独立说明页:

以上工具均基于公开的行业方法论(GB/T 2828.1、ISO 2859-1、SEMI 相关规范等)实现,用于工艺与运营侧的核算分析;结果请结合实际现场条件复核后使用。