外观
指标口径
这一页给出对外可引用的评测方法、指标定义与当前数字。原则只有一条:数字怎么来的说清楚,说不清的不写。
两条评测线
| 评测线 | 怎么做 | 回答什么 |
|---|---|---|
| 人工真值留出集 | 从现场真实样本里分层留出一批,由人工判定并在训练前锁定,模型不曾见过 | 模型在真实样本上判得对不对 |
| 生产影子对比 | 同一批线上最近事件,两个模型各判一次,分歧样本人工逐条看图 | 换上新模型会不会多出误报 |
留出集的真值先锁定再看模型输出。分歧只允许两种结论:"人标错了"或"模型错了",看了模型的理由再改真值是不允许的。
演示与内测环境的数据一律不进评测。评测按客户分批,一家客户的数字只用那家客户自己的样本算,不掺别家的。
指标定义
| 指标 | 定义 |
|---|---|
| 类型严格命中 | 模型给的类型与人工真值在叶子类目上完全一致 |
| 类型同族命中 | 模型给的类型与真值同属一个父类即算对。企业字典里父子混标很常见,同族口径更贴近现场实际 |
| 等级命中 | 模型给的等级与人工确认的等级一致 |
| 高等级虚判 | 真值为一般隐患,模型判成重大或更高。这是误报方向最要紧的一项 |
| 行为误判 | 正常画面被判成异常,或一种异常被判成另一种 |
| 影子一致率 | 同一批线上事件两个模型结论一致的比例 |
| 新增误报 | 影子对比里的分歧样本,人工核实后属于新模型误判的条数 |
| 单张 / 单段延迟 | 现场推理节点上含推理与结构化输出的耗时 |
当前版本的数字
| 指标 | 数值 | 说明 |
|---|---|---|
| 隐患类型同族命中 | 95.9% | 现场照片留出 73 张,类型对齐企业检查项字典 |
| 隐患类型严格命中 | 71.2% | 同一批,严格到叶子类目 |
| 高等级虚判 | 0 条 | 同一批,一般隐患没有一条被判成重大 |
| 与通用模型一致率 | 87.2% | 生产影子对比 141 条 |
| 新增误报 | 0 条 | 18 条分歧样本人工逐张核实,没有一条是蓝精灵新增的误报 |
| 行为误判 | 常见错法清零 | 行为片段留出 67 段。把打架判成倒地、把正常画面判成攀爬这类错法在留出集上不再出现 |
| 单张照片判定 | 约 5 秒 | 现场推理节点 |
| 单段视频复核 | 约 8 秒 | 连续画面一次判定 |
指标随版本更新,以交付文档所载版本为准。
我们不报什么
- 不报召回的自证数字。 漏报要靠人工在现场核实,模型自己说"我没漏"没有意义。对外只报误报方向的指标与人工复核口径。
- 不报演示数据上的成绩。 演示环境的样本是造的,只用于走流程。
- 不把等级命中当主要指标。 等级受先验影响大,高等级样本少,单看命中率会被一般隐患的占比抬高。等级看的是"有没有虚判"。
人工复核流程
蓝精灵给建议,人做决定。复核发生在三处:
| 环节 | 谁复核 | 复核结果去哪 |
|---|---|---|
| 随手拍上报 | 安全员在模型建议的基础上确认或修改类型、等级与描述 | 修改结果回流,作为下一版口径调整的依据 |
| 行为告警 | 值守人员在智悟值守台看蒙太奇与理由,确认或驳回 | 裁定写回虹元,误报回流边缘节点 |
| 定期复盘 | 按批次抽出模型与人工不一致的样本,逐条看原图归因 | 归因结果进知识库,区分口径不清与模型判错 |
复盘归因时先看原图再看模型输出,不拿模型的理由当证据。