训练和管理设备模型
设备模型需要经过受控生命周期。训练只产生待审阅候选,不会自动替换当前保护设备的判据。
本指南说明预测性维护使用的两类模型、用户当前可以在界面中执行的操作,以及仍需要管理员 API 的生命周期动作。
先确认正在管理哪类模型
预测性维护将以下产物分开管理:
| 模型轨道 | 用途 | 当前训练入口 | 生产权限来源 |
|---|---|---|---|
设备基线分布 (PDM_BASELINE_DISTRIBUTION) | 描述设备在运行工况下的观测分布,用于设备自身基线比较。 | 预测性维护 > 模型控制台 | 模型控制台中的基线晋升门 |
可执行异常模型 (PDM_ANOMALY_MODEL) | 针对指定设备目标运行异常评分 artifact。 | 模型控制台 > 优化检测、设备详情或管理员 API | 引用已验证不可变 artifact 的 ACTIVE assignment |
不要把基线分布当作可执行异常模型。基线计算成功不能证明异常模型运行过,异常分数也不是故障概率。
入口和权限
| 任务 | 入口 | 所需权限 |
|---|---|---|
| 查看模型控制台 | /pdm/model-console | mlops.model.read 或 system.config |
| 查看模型使用详情 | /ai-models/registry/:registryId | mlops.model.read 或 system.config |
| 训练或晋升设备基线 | 模型控制台 | pdm:write |
| 启动或取消异常检测优化 | 模型控制台、设备详情或 Platform AutoML API | mlops.model.write、pdm:write 或 system.config |
| 查看优化进度和结果 | 优化抽屉或 Platform AutoML API | mlops.model.read、pdm:read 或 system.config |
| 直接训练单个可执行异常模型候选 | 管理员 API | pdm:write |
| 晋升或回滚可执行 assignment | 管理员 API | pdm:write |
| 审阅设备 Finding | /pdm/anomalies 和 Finding 详情 | pdm:read |
标准模型使用详情页是只读页面。它展示 assignment 和运行证据,但当前不提供 assignment 晋升或回滚按钮。
生命周期概览
SHADOW 表示候选可以参与对比计算,但不改变告警、健康分、维护建议或 Finding。ACTIVE 给予 assignment 生产选模权限,但只有出现新鲜的成功运行证据后,才能确认生产链真实使用了该模型。

训练统计设备基线
- 打开 预测性维护 > 模型控制台。
- 找到目标设备。
- 审阅就绪结果和每个未满足条件。
- 确认设备身份、目标信号、单位、运行态历史和训练窗口正确。
- 当设备满足条件且当前角色具有
pdm:write时,选择训练操作。 - 等待控制台刷新,确认新版本和训练时间。
就绪结果具有不同含义:
| 结果 | 含义 | 下一步 |
|---|---|---|
| 满足训练条件 | 当前数据满足必要条件。 | 启动训练,然后审阅生成的 SHADOW 候选。 |
| 条件不足 | 一个或多个可量化要求未满足。 | 补充运行历史或修复必要信号。 |
| 无法判断 | 服务无法做出就绪判断。 | 处理页面给出的身份、数据或服务问题,不要把它写成历史不足。 |
| 注意事项 | 可以训练,但窗口存在已知限制。 | 记录限制,并在发布审阅中明确考虑。 |
训练设备基线只生成对比候选,现有生产判据继续生效。
优化异常检测
优化流程把受控、可解释的候选方法与任务启动时正在生效的判定路径进行比较。可以从两个入口打开:
- 预测性维护 > 模型控制台 > 优化检测;
- 设备详情 > 优化检测。
抽屉会先冻结准确的设备、测点和单位、建议训练窗口、数据截至时间以及当前判定依据。启动前必须逐项确认,这些字段是训练证据的一部分,不只是展示信息。
先处理数据就绪问题
每个就绪条件都会显示实际值和要求值。任务被阻塞不等于模型训练失败,也不应被当作模型结果汇报。
| 阻塞原因 | 处理方式 |
|---|---|
| 没有有效振动源,或存在多个匹配绑定 | 在数据接入中修正设备与数据源绑定。 |
| 测点缺少单位 | 在数据源绑定中补充单位,不要在优化抽屉里猜测或换算。 |
| 无法确定 ISO 对比区带 | 点击 补齐设备档案,补充额定功率和轴承/支承方式后返回。 |
| 运行样本、周数、跨度或连续性不足 | 继续收集有效运行态历史或修复数据源,不要用停机时段替代。 |
| 时序证据不可用 | 恢复受治理的数据服务,然后刷新就绪状态。 |
| 没有可用 Runner 或租户队列已满 | 等待容量,或请管理员检查私有化/staging Runner 池。反复点击不会产生有效证据。 |
选择受控搜索预算
| 预算 | 适用场景 |
|---|---|
快速 (QUICK) | 日常设备审阅的受控初筛。 |
标准 (STANDARD) | 工程审阅所需的更广候选比较。 |
深入 (DEEP) | 已批准的专项调查,允许使用更多时间和计算资源。 |
页面只显示租户策略和 Runner 容量允许的预算。某个预算没有出现不代表浏览器异常。选择更大预算也不保证一定产生赢家或更准确的结果。
确认目标和就绪证据后点击 开始优化。任务是持久化的,关闭抽屉不会丢失;重新打开同一设备可恢复最近任务。需要停止时使用 取消任务,已经完成的证据仍会保留。
理解任务实际产出
任务依次准备受治理训练快照、比较候选方法、验证时间窗口、校验 artifact,并在候选合格时登记 SHADOW 模型。当前受控搜索可以比较 Isolation Forest 和统计基线候选,不会执行任意用户代码。
终态结果分为:
| 结果 | 含义 | 下一步 |
|---|---|---|
NO_WINNER / 保留当前判定路径 | 没有候选同时通过可行性和实质改进门,没有创建 SHADOW 模型。 | 保持当前路径;如有数据限制先修复,只在证据或批准预算变化后重跑。 |
| SHADOW 候选已就绪 | 某个候选通过门禁,并登记为不可变 SHADOW assignment。 | 打开模型证据进行审阅。它仍不能改变客户告警、健康分、维护建议或 Finding。 |
| 失败或超时 | 页面给出安全原因,例如 Runner 不可用、依赖失败、超时或 artifact 无效。 | 先处理原因,不要把部分 trial 当成模型结果。 |
按四层读取训练结果
完成后按以下顺序阅读抽屉:
- 结论:当前生产判据保持不变,或已经产生一个 SHADOW 候选。
- 影响:现在允许发生什么变化。SHADOW 结果不能改变客户告警、健康分数、维护建议或 Finding。
- 证据:查看已冻结的当前生产判据、参与评估的方法、逐门槛结果、证据窗口、样本数和数据截止时间。
- 行动:保持当前路径、修复数据缺口、在有依据时更换预算重跑,或进入已登记 SHADOW 模型的证据页。
候选比较表可以包含一行 当前生产判据。它与被比较候选使用相同的评估窗口、指标语义、单位和观察数。每个候选会显示门槛实际值和要求值,例如 覆盖率:实际 68%;要求不低于 70%。缺失值显示为 未评估,不会显示为零。
| 证据 | 运维含义 |
|---|---|
| 覆盖率 | 历史运行窗口中具备可用证据的比例;越高表示数据空洞越少。 |
| 稳定性 | 不同历史折叠窗口中的告警负担是否一致,不代表模型准确率。 |
| 告警负担 | 该方法会标记为待复核的运行样本比例,不是每天告警数。 |
| 工况漂移 | 训练窗口和验证窗口的数据分布变化。 |
| SHADOW 分歧 | 候选与当前判据给出不同判断的样本比例,不是错误率。 |
| 计算成本 | 每个受限样本量的处理时间,只说明资源需求。 |
需要区分三种选择结果:
- 没有可行候选:没有候选通过全部门槛。界面显示每个候选未通过的项目,不会把其中一个标成“最佳候选”。
- 可行但没有实质提升:界面标明实际与已冻结生产判据比较的候选,生产路径保持不变。
- 已选择候选:候选只登记为 SHADOW 供后续审查,不会自动晋升。
引入逐门槛证据之前创建的历史任务仍然可以读取。界面会显示汇总解释和明确的旧证据提示,不会在浏览器中重算门槛或猜测比较候选。
没有经过确认的故障标签时,只能比较覆盖率、稳定性、告警负担、漂移、SHADOW 分歧和计算成本。这些值说明行为和运维负担,不能证明准确率、precision、recall 或故障概率。NO_WINNER 本身是有效且有价值的结果。
API 边界
界面使用持久化 Platform AutoML 任务合同:
| 方法 | Endpoint | 用途 |
|---|---|---|
POST | /api/v1/platform/automl/jobs | 创建受治理候选搜索任务。 |
GET | /api/v1/platform/automl/jobs/{jobId} | 读取持久化进度。 |
GET | /api/v1/platform/automl/jobs/{jobId}/outcome | 读取 trial、选择证据和下一步。 |
POST | /api/v1/platform/automl/jobs/{jobId}:cancel | 请求取消,但不删除已有证据。 |
POST /api/v1/pdm/model-console/{equipmentId}/train-anomaly-model 仍保留为管理员直接创建单个可执行候选的集成接口,它不是多候选优化流程。
生成 SHADOW 候选后,打开准确的 registry 记录,确认设备和目标绑定、不可变 artifact 验证状态以及运行对比证据,再做发布决策。所有界面和 API 操作都必须在目标租户内执行;不要复用从其他租户或环境复制的 assignment、job 或 registry 标识。
审阅 SHADOW 行为
在模型使用详情页检查候选:
- 准确的设备和目标绑定;
- assignment 状态;
- artifact 类型、runtime、format 和验证状态;
- 训练窗口和样本数量;
- 最近的 SHADOW 执行窗口;
- executed、refused、timed-out 和 failed 数量;
- SHADOW disagreement 数量和原因。
Disagreement 表示 SHADOW 结果在至少一个已记录对比中不同于当前生产路径。它不能证明哪一方正确。候选产生的告警更少不代表更准确,也可能意味着漏掉了应关注的情况。

决定候选是否有价值时,应结合现场发现、已审阅维护结果、运行工况和数据质量证据。
审慎晋升
在界面中晋升设备基线
对于处于 SHADOW 的合格基线,模型控制台可向具有 pdm:write 的用户显示晋升操作。后端发布门只验证基线是否能与当前判据进行可比回放,不会声称该基线更准确。
如果晋升被拒绝,按返回原因处理。典型动作包括修复设备档案、先训练候选、等待有效运行样本或恢复时序服务。
通过 API 晋升可执行 assignment
可执行异常模型 assignment 使用管理员 endpoint:
| 方法 | Endpoint |
|---|---|
POST | /api/v1/pdm/model-console/assignments/{assignmentId}/promote |
晋升以原子方式改变生命周期状态。成功后确认:
- 目标 assignment 为
ACTIVE; - 目标 registry 版本为
PRODUCTION; - 原设备级生产 assignment 已退役;
- artifact 仍为已验证状态;
- 出现新鲜的
ACTIVE运行证据; - 如果产生客户可见 Finding,其模型 provenance 指向预期版本。
页面报告 ACTIVE_AWAITING_EVIDENCE、STALE、FALLBACK、CONFLICT 或 ARTIFACT_UNAVAILABLE 时,不要宣称模型正在生产运行。
回滚可执行 Assignment
回滚目前属于管理员 API 工作流:
| 方法 | Endpoint |
|---|---|
POST | /api/v1/pdm/model-console/assignments/{assignmentId}/rollback |
assignmentId 指向需要沿生命周期历史回滚的 assignment。使用当前租户模型 API 返回的标识,不要从 URL、模型名称或其他环境推断。
回滚后:
- 确认替代 assignment 为
ACTIVE; - 确认被回滚 assignment 和 registry 的历史状态正确;
- 等待恢复 artifact 的新鲜运行证据;
- 确认旧 artifact 不再被 live assignment 引用;
- 检查客户可见 Finding 和告警是否连续。
回滚会改变模型选择路径,但不会删除历史 assignment、生命周期事件、运行证据、Finding 或反馈。
理解主要状态
| 状态 | 能证明什么 | 不能证明什么 |
|---|---|---|
STAGING | Registry 版本是候选。 | 它可以影响客户结果。 |
SHADOW | Assignment 可用于非写入对比。 | 它是生产模型。 |
ACTIVE | Assignment 具有生产选模权限。 | 最近一次执行成功。 |
PRODUCTION | Registry 版本是其治理范围的生产版本。 | 每次设备评估都使用了它。 |
RETIRED 或 ROLLED_BACK | 版本或 assignment 已成为历史。 | 它的审计证据被删除。 |
要判断是否真实执行,请查看模型使用详情页的运行证据。
故障处理
| 现象 | 检查项 |
|---|---|
| 看不到训练操作 | pdm:write、就绪状态、当前 assignment 状态,以及当前是否属于 API-only 的异常模型流程。 |
| 训练被拒绝 | 设备身份、目标信号、运行态历史、窗口覆盖和返回原因。 |
| 候选一直是 SHADOW | 在人工发布决策前这是正常安全状态;继续审阅对比证据和晋升前置条件。 |
| 晋升成功但页面没有显示生产使用 | 等待新鲜运行证据,并检查 ACTIVE_AWAITING_EVIDENCE、过期数据、fallback 或 artifact 验证。 |
| 页面报告多个 live assignment | 停止生命周期操作,请管理员处理冲突。 |
| 找不到回滚按钮 | Assignment 回滚目前是管理员 API,不是标准模型使用详情操作。 |
| 模型运行过但没有 Finding | 检查数据质量、持续性、融合条件和 Finding 启用范围;没有 Finding 不等于没有执行。 |
验证清单
- 设备和目标正确。
- 没有混淆统计基线和可执行异常 artifact。
- 训练只创建候选,没有静默改变生产。
- SHADOW 证据没有改变客户可见结果。
- 授权用户在完成审阅后执行晋升。
- 新鲜
ACTIVE运行证据确认真实使用。 - 执行回滚时恢复了目标 artifact,并保留审计历史。