传统设备管理只有两种状态——正常和故障。但真实情况里设备大部分时间在中间地带:还能转但效率在降。PHM 把健康数字化为 H(t) 连续标量,驱动产能从"满负荷"到"降权"到"停机"自适应调节。
"坏了再修"的成本有多高?
风机主轴轴承抱死——不只是换轴承的几万块,还有塔上拆装、大件运输、停机发电损失,综合成本动辄数十万甚至上百万元。轴承从开始退化到完全抱死,中间有几个月的时间窗口,但因为没有量化监控,这段时间被白白浪费了。
工厂里大多数设备的状态不是"正常"和"故障"二选一,而是两者之间的灰色地带——振动偏大但没超标,温度偏高但还能坚持。传统阈值告警在这时要么不报(恶化继续),要么误报(频繁停机)。
三层融合:CNN 识别已知故障 → VAE+孤立森林交叉验证发现未知异常 → 规则引擎加权融合计算 H(t)
H(t):把"健康"变成一个可以计算的数字
H(t) = Σ wᵢ · pᵢ。CNN 输出各故障类型的概率 pᵢ,规则引擎根据故障严重度和所处发展阶段确定权重 wᵢ——轴承碎裂的权重远低于轻微润滑不良(前者的 sᵢ=0.9,后者 sᵢ=0.3)。EWMA 指数加权移动平均做时间平滑,消除瞬时毛刺。
H(t) ∈ [0, 1]。H=1 表示设备完全健康。H=0 表示必须停机。不是"振动超标就报警",而是"健康度在持续下降,还有 48 小时到达停机阈值"。
H(t) 计算:概率分布 × 动态健康权重 → 加权求和 → EWMA 时间平滑 → 连续健康标量
A[H(t)]:一个数字,三种产能状态
H(t) 是诊断结果,A[H(t)] 是控制信号。分段函数把 H(t) 转成设备产能指令:
- H(t) < H_stop(如 0.3) → A=0。强制停机,触发维修工单。
- H_stop ≤ H(t) < H_full(如 0.8) → A 从 0 到 1 线性变化。按比例降速降功率运行,同时安排预防性维护。
- H(t) ≥ H_full → A=1。满负荷,无干预。
三态产能调节:A=0 强制停机 → 0A[H(t)] 进了 OEE 公式,设备效率才算真实
传统 OEE 的可用率 A = 实际运行时间 / 计划运行时间。但这不反映设备健康——设备在亚健康状态满负荷运行,虽然"运行时间"拉满了,但效率实际在降。
PHM 把 A[H(t)] 上报 Online 后,Online 的 OEE 公式中 A 不再是简单的时间统计,而是健康驱动的可用率。OEE 真正反映了"健康的设备在高效生产",而不只是"设备在运转"。
三层融合 vs 一个模型:差距不是精度,是"覆盖度"
CNN 擅长分类已知故障但不擅长发现新故障;VAE 擅长发现新异常但不能告诉你是哪种故障;孤立森林在手工特征上表现好但覆盖面有限。
三层融合的要义不是"三个模型一起跑"——是每层纠正上一层的漏检和误判。CNN 第一层粗筛,VAE+孤立森林第二层交叉验证(发现 CNN 没见过的模式),规则引擎第三层把各路的输出变成可计算的健康值。去掉任何一层,都会在特定场景下出现盲区。
技术快照
维度 规格 模型 CNN 25KB/0.3ms + VAE 300KB/3ms + 孤立森林 50KB/0.1ms 推理 204.8ms 窗口(2048 点@10KHz),32 通道并行,总延迟 <5ms 量化 INT8(CNN)+INT16(VAE),RK3588 NPU 6TOPS 输出 H(t) ∈ [0,1] · A[H(t)] ∈ [0,1] · normal/abnormal/unknown 三态 让设备"会说话"
振动、温度、电流——这些信号设备一直在产生,只是没人去解读。PHM 把这几路信号变成两个数字:H(t) 告诉你设备还能撑多久,A[H(t)] 告诉你在当前健康状态下还能跑多快。从"坏了再修"到"知道什么时候该修",差的不是传感器,是数字化的那一步。
