跳到主要内容

训练和管理设备模型

设备模型需要经过受控生命周期。训练只产生待审阅候选,不会自动替换当前保护设备的判据。

本指南说明预测性维护使用的两类模型、用户当前可以在界面中执行的操作,以及仍需要管理员 API 的生命周期动作。

先确认正在管理哪类模型

预测性维护将以下产物分开管理:

模型轨道用途当前训练入口生产权限来源
设备基线分布 (PDM_BASELINE_DISTRIBUTION)描述设备在运行工况下的观测分布,用于设备自身基线比较。预测性维护 > 模型控制台模型控制台中的基线晋升门
可执行异常模型 (PDM_ANOMALY_MODEL)针对指定设备目标运行异常评分 artifact。模型控制台 > 优化检测、设备详情或管理员 API引用已验证不可变 artifact 的 ACTIVE assignment

不要把基线分布当作可执行异常模型。基线计算成功不能证明异常模型运行过,异常分数也不是故障概率。

入口和权限

任务入口所需权限
查看模型控制台/pdm/model-consolemlops.model.readsystem.config
查看模型使用详情/ai-models/registry/:registryIdmlops.model.readsystem.config
训练或晋升设备基线模型控制台pdm:write
启动或取消异常检测优化模型控制台、设备详情或 Platform AutoML APImlops.model.writepdm:writesystem.config
查看优化进度和结果优化抽屉或 Platform AutoML APImlops.model.readpdm:readsystem.config
直接训练单个可执行异常模型候选管理员 APIpdm:write
晋升或回滚可执行 assignment管理员 APIpdm:write
审阅设备 Finding/pdm/anomalies 和 Finding 详情pdm:read

标准模型使用详情页是只读页面。它展示 assignment 和运行证据,但当前不提供 assignment 晋升或回滚按钮。

生命周期概览

SHADOW 表示候选可以参与对比计算,但不改变告警、健康分、维护建议或 Finding。ACTIVE 给予 assignment 生产选模权限,但只有出现新鲜的成功运行证据后,才能确认生产链真实使用了该模型。

中性模型控制台示例,显示设备基线候选因运行历史不足而无法训练
准备状态应解释未满足条件,而不是把证据缺失显示成健康结果。

训练统计设备基线

  1. 打开 预测性维护 > 模型控制台
  2. 找到目标设备。
  3. 审阅就绪结果和每个未满足条件。
  4. 确认设备身份、目标信号、单位、运行态历史和训练窗口正确。
  5. 当设备满足条件且当前角色具有 pdm:write 时,选择训练操作。
  6. 等待控制台刷新,确认新版本和训练时间。

就绪结果具有不同含义:

结果含义下一步
满足训练条件当前数据满足必要条件。启动训练,然后审阅生成的 SHADOW 候选。
条件不足一个或多个可量化要求未满足。补充运行历史或修复必要信号。
无法判断服务无法做出就绪判断。处理页面给出的身份、数据或服务问题,不要把它写成历史不足。
注意事项可以训练,但窗口存在已知限制。记录限制,并在发布审阅中明确考虑。

训练设备基线只生成对比候选,现有生产判据继续生效。

优化异常检测

优化流程把受控、可解释的候选方法与任务启动时正在生效的判定路径进行比较。可以从两个入口打开:

  • 预测性维护 > 模型控制台 > 优化检测
  • 设备详情 > 优化检测

抽屉会先冻结准确的设备、测点和单位、建议训练窗口、数据截至时间以及当前判定依据。启动前必须逐项确认,这些字段是训练证据的一部分,不只是展示信息。

先处理数据就绪问题

每个就绪条件都会显示实际值和要求值。任务被阻塞不等于模型训练失败,也不应被当作模型结果汇报。

阻塞原因处理方式
没有有效振动源,或存在多个匹配绑定在数据接入中修正设备与数据源绑定。
测点缺少单位在数据源绑定中补充单位,不要在优化抽屉里猜测或换算。
无法确定 ISO 对比区带点击 补齐设备档案,补充额定功率和轴承/支承方式后返回。
运行样本、周数、跨度或连续性不足继续收集有效运行态历史或修复数据源,不要用停机时段替代。
时序证据不可用恢复受治理的数据服务,然后刷新就绪状态。
没有可用 Runner 或租户队列已满等待容量,或请管理员检查私有化/staging Runner 池。反复点击不会产生有效证据。

选择受控搜索预算

预算适用场景
快速 (QUICK)日常设备审阅的受控初筛。
标准 (STANDARD)工程审阅所需的更广候选比较。
深入 (DEEP)已批准的专项调查,允许使用更多时间和计算资源。

页面只显示租户策略和 Runner 容量允许的预算。某个预算没有出现不代表浏览器异常。选择更大预算也不保证一定产生赢家或更准确的结果。

确认目标和就绪证据后点击 开始优化。任务是持久化的,关闭抽屉不会丢失;重新打开同一设备可恢复最近任务。需要停止时使用 取消任务,已经完成的证据仍会保留。

理解任务实际产出

任务依次准备受治理训练快照、比较候选方法、验证时间窗口、校验 artifact,并在候选合格时登记 SHADOW 模型。当前受控搜索可以比较 Isolation Forest 和统计基线候选,不会执行任意用户代码。

终态结果分为:

结果含义下一步
NO_WINNER / 保留当前判定路径没有候选同时通过可行性和实质改进门,没有创建 SHADOW 模型。保持当前路径;如有数据限制先修复,只在证据或批准预算变化后重跑。
SHADOW 候选已就绪某个候选通过门禁,并登记为不可变 SHADOW assignment。打开模型证据进行审阅。它仍不能改变客户告警、健康分、维护建议或 Finding。
失败或超时页面给出安全原因,例如 Runner 不可用、依赖失败、超时或 artifact 无效。先处理原因,不要把部分 trial 当成模型结果。

按四层读取训练结果

完成后按以下顺序阅读抽屉:

  1. 结论:当前生产判据保持不变,或已经产生一个 SHADOW 候选。
  2. 影响:现在允许发生什么变化。SHADOW 结果不能改变客户告警、健康分数、维护建议或 Finding。
  3. 证据:查看已冻结的当前生产判据、参与评估的方法、逐门槛结果、证据窗口、样本数和数据截止时间。
  4. 行动:保持当前路径、修复数据缺口、在有依据时更换预算重跑,或进入已登记 SHADOW 模型的证据页。

候选比较表可以包含一行 当前生产判据。它与被比较候选使用相同的评估窗口、指标语义、单位和观察数。每个候选会显示门槛实际值和要求值,例如 覆盖率:实际 68%;要求不低于 70%。缺失值显示为 未评估,不会显示为零。

证据运维含义
覆盖率历史运行窗口中具备可用证据的比例;越高表示数据空洞越少。
稳定性不同历史折叠窗口中的告警负担是否一致,不代表模型准确率。
告警负担该方法会标记为待复核的运行样本比例,不是每天告警数。
工况漂移训练窗口和验证窗口的数据分布变化。
SHADOW 分歧候选与当前判据给出不同判断的样本比例,不是错误率。
计算成本每个受限样本量的处理时间,只说明资源需求。

需要区分三种选择结果:

  • 没有可行候选:没有候选通过全部门槛。界面显示每个候选未通过的项目,不会把其中一个标成“最佳候选”。
  • 可行但没有实质提升:界面标明实际与已冻结生产判据比较的候选,生产路径保持不变。
  • 已选择候选:候选只登记为 SHADOW 供后续审查,不会自动晋升。

引入逐门槛证据之前创建的历史任务仍然可以读取。界面会显示汇总解释和明确的旧证据提示,不会在浏览器中重算门槛或猜测比较候选。

没有经过确认的故障标签时,只能比较覆盖率、稳定性、告警负担、漂移、SHADOW 分歧和计算成本。这些值说明行为和运维负担,不能证明准确率、precision、recall 或故障概率。NO_WINNER 本身是有效且有价值的结果。

API 边界

界面使用持久化 Platform AutoML 任务合同:

方法Endpoint用途
POST/api/v1/platform/automl/jobs创建受治理候选搜索任务。
GET/api/v1/platform/automl/jobs/{jobId}读取持久化进度。
GET/api/v1/platform/automl/jobs/{jobId}/outcome读取 trial、选择证据和下一步。
POST/api/v1/platform/automl/jobs/{jobId}:cancel请求取消,但不删除已有证据。

POST /api/v1/pdm/model-console/{equipmentId}/train-anomaly-model 仍保留为管理员直接创建单个可执行候选的集成接口,它不是多候选优化流程。

生成 SHADOW 候选后,打开准确的 registry 记录,确认设备和目标绑定、不可变 artifact 验证状态以及运行对比证据,再做发布决策。所有界面和 API 操作都必须在目标租户内执行;不要复用从其他租户或环境复制的 assignment、job 或 registry 标识。

审阅 SHADOW 行为

在模型使用详情页检查候选:

  • 准确的设备和目标绑定;
  • assignment 状态;
  • artifact 类型、runtime、format 和验证状态;
  • 训练窗口和样本数量;
  • 最近的 SHADOW 执行窗口;
  • executed、refused、timed-out 和 failed 数量;
  • SHADOW disagreement 数量和原因。

Disagreement 表示 SHADOW 结果在至少一个已记录对比中不同于当前生产路径。它不能证明哪一方正确。候选产生的告警更少不代表更准确,也可能意味着漏掉了应关注的情况。

中性模型控制台示例,显示 SHADOW 基线候选、可比窗口、差异数量和需审阅的晋升动作
候选训练完成后仍保持 SHADOW,直到独立的授权晋升决策。

决定候选是否有价值时,应结合现场发现、已审阅维护结果、运行工况和数据质量证据。

审慎晋升

在界面中晋升设备基线

对于处于 SHADOW 的合格基线,模型控制台可向具有 pdm:write 的用户显示晋升操作。后端发布门只验证基线是否能与当前判据进行可比回放,不会声称该基线更准确。

如果晋升被拒绝,按返回原因处理。典型动作包括修复设备档案、先训练候选、等待有效运行样本或恢复时序服务。

通过 API 晋升可执行 assignment

可执行异常模型 assignment 使用管理员 endpoint:

方法Endpoint
POST/api/v1/pdm/model-console/assignments/{assignmentId}/promote

晋升以原子方式改变生命周期状态。成功后确认:

  • 目标 assignment 为 ACTIVE
  • 目标 registry 版本为 PRODUCTION
  • 原设备级生产 assignment 已退役;
  • artifact 仍为已验证状态;
  • 出现新鲜的 ACTIVE 运行证据;
  • 如果产生客户可见 Finding,其模型 provenance 指向预期版本。

页面报告 ACTIVE_AWAITING_EVIDENCESTALEFALLBACKCONFLICTARTIFACT_UNAVAILABLE 时,不要宣称模型正在生产运行。

回滚可执行 Assignment

回滚目前属于管理员 API 工作流:

方法Endpoint
POST/api/v1/pdm/model-console/assignments/{assignmentId}/rollback

assignmentId 指向需要沿生命周期历史回滚的 assignment。使用当前租户模型 API 返回的标识,不要从 URL、模型名称或其他环境推断。

回滚后:

  1. 确认替代 assignment 为 ACTIVE
  2. 确认被回滚 assignment 和 registry 的历史状态正确;
  3. 等待恢复 artifact 的新鲜运行证据;
  4. 确认旧 artifact 不再被 live assignment 引用;
  5. 检查客户可见 Finding 和告警是否连续。

回滚会改变模型选择路径,但不会删除历史 assignment、生命周期事件、运行证据、Finding 或反馈。

理解主要状态

状态能证明什么不能证明什么
STAGINGRegistry 版本是候选。它可以影响客户结果。
SHADOWAssignment 可用于非写入对比。它是生产模型。
ACTIVEAssignment 具有生产选模权限。最近一次执行成功。
PRODUCTIONRegistry 版本是其治理范围的生产版本。每次设备评估都使用了它。
RETIREDROLLED_BACK版本或 assignment 已成为历史。它的审计证据被删除。

要判断是否真实执行,请查看模型使用详情页的运行证据。

故障处理

现象检查项
看不到训练操作pdm:write、就绪状态、当前 assignment 状态,以及当前是否属于 API-only 的异常模型流程。
训练被拒绝设备身份、目标信号、运行态历史、窗口覆盖和返回原因。
候选一直是 SHADOW在人工发布决策前这是正常安全状态;继续审阅对比证据和晋升前置条件。
晋升成功但页面没有显示生产使用等待新鲜运行证据,并检查 ACTIVE_AWAITING_EVIDENCE、过期数据、fallback 或 artifact 验证。
页面报告多个 live assignment停止生命周期操作,请管理员处理冲突。
找不到回滚按钮Assignment 回滚目前是管理员 API,不是标准模型使用详情操作。
模型运行过但没有 Finding检查数据质量、持续性、融合条件和 Finding 启用范围;没有 Finding 不等于没有执行。

验证清单

  • 设备和目标正确。
  • 没有混淆统计基线和可执行异常 artifact。
  • 训练只创建候选,没有静默改变生产。
  • SHADOW 证据没有改变客户可见结果。
  • 授权用户在完成审阅后执行晋升。
  • 新鲜 ACTIVE 运行证据确认真实使用。
  • 执行回滚时恢复了目标 artifact,并保留审计历史。

相关文档