一句话答案

传统设备管理只有两种状态——正常和故障。但真实情况里设备大部分时间在中间地带:还能转但效率在降。PHM 把健康数字化为 H(t) 连续标量,驱动产能从"满负荷"到"降权"到"停机"自适应调节。

"坏了再修"的成本有多高?

风机主轴轴承抱死——不只是换轴承的几万块,还有塔上拆装、大件运输、停机发电损失,综合成本动辄数十万甚至上百万元。轴承从开始退化到完全抱死,中间有几个月的时间窗口,但因为没有量化监控,这段时间被白白浪费了。

工厂里大多数设备的状态不是"正常"和"故障"二选一,而是两者之间的灰色地带——振动偏大但没超标,温度偏高但还能坚持。传统阈值告警在这时要么不报(恶化继续),要么误报(频繁停机)。

PHM三层融合架构

三层融合:CNN 识别已知故障 → VAE+孤立森林交叉验证发现未知异常 → 规则引擎加权融合计算 H(t)

H(t):把"健康"变成一个可以计算的数字

H(t) = Σ wᵢ · pᵢ。CNN 输出各故障类型的概率 pᵢ,规则引擎根据故障严重度和所处发展阶段确定权重 wᵢ——轴承碎裂的权重远低于轻微润滑不良(前者的 sᵢ=0.9,后者 sᵢ=0.3)。EWMA 指数加权移动平均做时间平滑,消除瞬时毛刺。

H(t) ∈ [0, 1]。H=1 表示设备完全健康。H=0 表示必须停机。不是"振动超标就报警",而是"健康度在持续下降,还有 48 小时到达停机阈值"。

H(t)计算流程

H(t) 计算:概率分布 × 动态健康权重 → 加权求和 → EWMA 时间平滑 → 连续健康标量

A[H(t)]:一个数字,三种产能状态

H(t) 是诊断结果,A[H(t)] 是控制信号。分段函数把 H(t) 转成设备产能指令:

A[H(t)]分段函数

三态产能调节:A=0 强制停机 → 0

A[H(t)] 进了 OEE 公式,设备效率才算真实

传统 OEE 的可用率 A = 实际运行时间 / 计划运行时间。但这不反映设备健康——设备在亚健康状态满负荷运行,虽然"运行时间"拉满了,但效率实际在降。

PHM 把 A[H(t)] 上报 Online 后,Online 的 OEE 公式中 A 不再是简单的时间统计,而是健康驱动的可用率。OEE 真正反映了"健康的设备在高效生产",而不只是"设备在运转"。

三层融合 vs 一个模型:差距不是精度,是"覆盖度"

CNN 擅长分类已知故障但不擅长发现新故障;VAE 擅长发现新异常但不能告诉你是哪种故障;孤立森林在手工特征上表现好但覆盖面有限。

三层融合的要义不是"三个模型一起跑"——是每层纠正上一层的漏检和误判。CNN 第一层粗筛,VAE+孤立森林第二层交叉验证(发现 CNN 没见过的模式),规则引擎第三层把各路的输出变成可计算的健康值。去掉任何一层,都会在特定场景下出现盲区。

技术快照

维度规格
模型CNN 25KB/0.3ms + VAE 300KB/3ms + 孤立森林 50KB/0.1ms
推理204.8ms 窗口(2048 点@10KHz),32 通道并行,总延迟 <5ms
量化INT8(CNN)+INT16(VAE),RK3588 NPU 6TOPS
输出H(t) ∈ [0,1] · A[H(t)] ∈ [0,1] · normal/abnormal/unknown 三态

让设备"会说话"

振动、温度、电流——这些信号设备一直在产生,只是没人去解读。PHM 把这几路信号变成两个数字:H(t) 告诉你设备还能撑多久,A[H(t)] 告诉你在当前健康状态下还能跑多快。从"坏了再修"到"知道什么时候该修",差的不是传感器,是数字化的那一步。