AI 质检异常诊断助手 | Demo Day

AI 质检异常
诊断助手

面向制造业视觉质检场景,连接质检记录、缺陷样本、模型版本与产线环境数据,帮助质量团队定位异常原因、核验证据并推动处理闭环。

综合视图产品界面

让分散数据,成为可追踪的诊断依据。

质检记录缺陷图片模型版本班次信息产线设备材料批次
业务问题

AI 质检上线后,
异常排查仍然很慢

AI 视觉检测效果会受到光照、材料批次、设备角度、样本覆盖和模型版本等因素影响。当漏检率或误检率突然升高时,质量团队需要跨系统查指标、看图片、找模型版本、问产线变化,才能判断问题来自哪里。

数据分散

质检记录、缺陷图片、标注结果、模型版本和设备信息分布在不同系统。

原因难判断

同一个漏检率上升,可能来自样本不足、光照变化、模型老化或新材料批次。

处理难闭环

补样本、重新标注、模型复训、设备排查和效果验证往往分散推进。

一条可追踪链路

让系统主动把异常、证据、建议和任务组织成一条可追踪链路。

异常闭环

从异常发现
到处理验证的闭环流程

产品以质量工程师的异常排查路径为主线,把分散数据整合成可执行流程。AI Agent 负责汇总、分析和建议,用户负责确认、分配和验收。

01

发现异常

今天哪条产线最需要处理

按风险等级聚合产线、缺陷类型和趋势变化

02

AI 诊断

异常为什么发生

读取指标、样本、模型和产线数据,生成原因排序

03

证据核验

AI 的判断是否可信

展示代表性样本、班次对比和关键指标证据

04

任务创建

下一步谁来处理

把建议动作转为标注、复训、设备排查任务

05

效果追踪

处理后是否真的改善

对比漏检率、召回率和任务闭环状态

质量闭环流转组件

AI 不止输出诊断结论,还将建议动作转化为可执行任务,并持续追踪改善结果。

验证场景

从发现异常
到形成可验证的改善闭环

以下内容为产品概念验证中的设计目标,用于说明产品希望改善的工作方式,不代表真实上线结果。

01

异常定位

跨系统人工排查统一证据链
02

处理方式

口头协同责任到人的任务闭环
03

改善验证

只看当前指标对比处理前后效果
04

决策依据

依赖个人经验指标、样本与上下文共同验证
产品界面

五个核心页面
支撑完整质检诊断链路

综合视图

让主管快速看到运营总览和风险信号

运营总览 · 质量闭环流转 · 异常定位工作台

异常看板

帮助质量工程师优先处理高风险异常

风险产线分布 · 异常列表 · 趋势和筛选

AI 诊断

展示 Agent 的诊断结论、原因排序和证据链

可信度 · 诊断依据样本 · 推理步骤 · 建议动作

问题样本

把诊断结论落到真实缺陷图片证据上

缺陷缩略图 · AI 框选 · 置信度 · 复核状态

处理任务

把 AI 建议转为可执行任务并验证效果

负责人 · 优先级 · 状态 · 处理前后指标
为什么需要 Agent

不是多一个聊天框
而是补齐异常处理链路

质检异常的答案不在一份文档里。系统需要跨指标、样本、模型和产线数据持续判断,并把结论转成可执行任务。

固定规则

适合已知条件

按阈值告警和固定分支执行,稳定可控,但难以覆盖组合异常与动态上下文。

判断清晰,路径固定
普通问答 + RAG

适合知识查询

能检索 SOP 和历史案例并回答问题,但通常停留在信息层,不能主动完成跨系统动作。

问题明确,只需答案
AI Agent

适合动态任务

根据异常规划步骤,调用工具补齐证据,遇到高风险动作请求人工确认,再创建工单。

路径变化,需要执行闭环
选择 Agent 的判断 路径随证据变化数据分散在多系统结论必须可追溯关键动作需要审批
AI 诊断

AI Agent 如何完成
质检异常诊断

Agent 对比质检指标、缺陷样本、模型版本与产线上下文,输出可复核的原因排序、证据链和建议动作。

质检指标

漏检率、召回率和趋势变化

问题样本

缺陷图片、人工标注和复核

模型版本

版本表现和样本覆盖

产线信息

班次、设备和材料批次

时间对比班次对比缺陷类型对比样本覆盖对比模型版本对比
AI 诊断证据与建议组件
诊断示例 · 3 号产线

从异常指标,
找到可验证的原因

3 号产线细微划痕漏检率升高,主要与夜班光照变化和细微划痕样本覆盖不足有关。

6.8%夜班漏检率
2.1%白班漏检率
图片平均亮度下降 23%当前模型 v2.346 天未更新
处理任务与效果验证组件
建议动作

让诊断结果,
进入可执行的处理流程

  • 补充 300 张夜班样本
  • 重新标注细微划痕
  • 基于 v2.3 发起增量复训
  • 检查夜班光源稳定性

建议由用户确认后进入任务流程,并持续追踪处理效果。

夜班低亮度样本
光照变化 · 亮度证据
细微划痕样本
细微划痕 · 样本覆盖
边缘缺陷样本
缺陷类型 · 对比证据
AI 可做

汇总、分析和建议

诊断结论、原因排序、证据链、建议动作、风险等级。

人需确认

确认、分配和验收

复训模型、调整阈值、上线模型和关闭异常必须人工确认。

Agent 如何工作

用一条真实异常
演示完整诊断与执行

示例异常 AL-20260904-001:3 号产线夜班细微划痕漏检率由 2.1% 升至 6.8%,风险等级高。

产线 / 班次3 号产线 · 夜班
材料批次B-0927
异常指标漏检率 6.8%
处理原则先核验证据,再执行
01
MCP 工具

读取异常上下文

调用 get_anomaly_context,汇总班次、批次、设备与模型版本。

02
Skill

拆解诊断计划

按“指标对比、样本核验、知识检索、风险判断”生成可检查步骤。

03
MCP 工具

对比班次指标

调用 compare_shift_metrics,确认夜班漏检率显著高于白班。

04
RAG 检索

查找 SOP 与历史案例

检索光照校准规范、同类划痕案例,并保留来源和版本。

05
Agent 推理

形成原因排序

综合证据给出光照变化、样本覆盖不足、模型老化三项候选原因。

06
人工确认

确认高风险动作

质量工程师复核证据,并选择先排查光源、再补充样本。

07
MCP 工具

创建处理工单

调用 create_quality_ticket,写入负责人、截止时间和验收指标。

可追问的诊断助手

结论不是黑盒,用户可以继续核验

AI Agent已完成证据核验

夜班图像平均亮度下降 23%,且异常集中在光源衰减区域;同批次白班数据未出现同幅度变化,因此光照变化的解释力最高。

班次指标对比光照校准 SOP v4.2历史案例 QC-184
产品架构

让 RAG、Agent 与工单系统
各自承担正确的职责

结构化数据通过 MCP 工具读取,知识与案例由 RAG 检索,Agent 负责规划和编排,关键动作由人确认。

01输入

业务系统

质检记录、缺陷图片、模型监控、产线设备

02连接

MCP 工具层

统一查询指标、样本、设备状态并创建工单

03组装

诊断上下文

绑定异常、班次、批次、版本和权限信息

04知识能力

RAG / Skills

检索 SOP 与历史案例,执行标准诊断步骤

05决策中枢

Agent 编排

规划步骤、选择工具、排序原因并生成证据链

06风险控制

人工确认

复核证据,审批停线、复训等高风险动作

07执行

工单系统

分配标注、复训、设备排查与验收任务

RAG 不查实时指标只检索已治理的 SOP、规则与历史案例,并返回引用来源。
MCP 不替代业务权限工具沿用原系统鉴权,高风险写操作必须经过人工确认。
Agent 不直接下最终结论输出候选原因、证据与置信度,让责任人完成决策。
如何评测与迭代

不只看模型回答
还要看任务是否真的闭环

下面是产品落地时使用的评测框架和目标口径,不将模拟数据包装为线上结果。

01 · RAG

检索是否可靠

Recall@5
标准答案相关资料是否进入前 5 条
MRR / nDCG
最相关证据是否排在前面
引用准确率
结论是否能回到正确来源
02 · Agent

执行是否正确

工具选择准确率
是否调用了正确的 MCP 工具
参数准确率
产线、批次和时间范围是否正确
任务完成率
是否在约束内完成诊断和建单
03 · 业务

有没有带来改善

平均诊断时长
从告警到确认原因所需时间
Top-3 原因命中率
候选原因是否覆盖最终根因
按期闭环率
工单是否按时验收并产生改善
04 · 安全

边界是否守住

无依据结论率
没有证据支撑的判断占比
人工驳回率
高风险建议被责任人否决的比例
越权执行次数
目标始终为 0
上线后同步监控工程指标 P50 / P95 响应时间单次工具调用数单次 Token 成本失败恢复率
迭代故事

沿着用户任务
逐步增加 AI 能力

每一版只解决一个更深的问题,并用可观测指标判断是否值得继续。

V1
用户问题

看见异常

聚合异常指标与风险列表,减少跨系统找数。

关注:发现时延
V2
用户问题

理解异常

加入样本、班次和模型证据,形成可复核的原因排序。

关注:Top-3 命中率
V3
用户问题

追问核验

接入 RAG 与工具调用,让用户能追问依据、排除假设。

关注:引用准确率
V4
用户问题

闭环执行

经人工确认后创建工单,把建议交给明确的负责人。

关注:按期闭环率
下一步计划

让每一次异常处理,
成为下一次诊断的依据

接入更多设备数据 · 沉淀异常案例库
支持跨产线复用诊断策略