质检报告是制造业里最典型的"看起来简单、做起来难"的自动化对象。

说它简单,是因为任务描述只有一句话:把报告里的关键字段提取出来。说它难,是因为实际收到的报告可能是供应商 A 的 PDF 表格、供应商 B 的扫描件、供应商 C 的手写批注照片,还夹杂着多语言术语和自定义缩略语。

要把它跑通,靠的不是单个模型能力,而是一条设计完整的处理链路。

一份质检报告的 AI 处理全链路

一、难点不在识别,在结构

多数团队第一次尝试时的做法是:把报告丢给模型,让它提取字段。单份测试效果不错,一旦批量处理就会暴露三个问题。

模板多样性。同一类报告在不同供应商手里格式完全不同,字段位置不固定,有的在表格里,有的在正文段落里,有的在页眉页脚。

术语不一致。同一项指标在不同报告里有不同叫法,缩写、全称、别名混用,还有些是行业内的习惯表达。

批注干扰。手写标记、印章、划线、涂改会干扰识别,有些批注本身就是关键信息(比如"此项已复检"),不能简单当作噪声去掉。

这三个问题决定了:质检报告的自动化不能只做"抽取",必须做"解析 + 校验 + 回写"的完整链路。

二、第一步:解析与结构化抽取

链路的起点是把非结构化文档转成结构化数据。

先做文档分类与模板识别,判断这份报告属于哪种版式,调用对应的解析策略。再做字段抽取,把报告编号、产品批次、各项指标、判定结果、检验日期等按预定 Schema 提取出来。

这里有个关键设计:每个字段都要记录原文坐标。也就是不仅输出"某项指标的值是 0.5",还要标明这个值来自第几页第几行的哪个位置。

坐标的作用有两个:业务人员核对时可以快速定位原文,出现争议时能追溯依据。没有坐标的结构化数据,业务侧不敢直接用。

对制造企业中大量存在的工单、质检报告、设备说明书、物料清单,这一步把非结构化资料变成了可计算的输入,后续所有优化都建立在它之上。

三、第二步:规则校验与异常识别

抽取出来的数据不能直接入库,中间需要一道校验。

校验分三层。格式校验看数据类型和取值范围是否正确,比如某个指标不可能为负,某个日期不能晚于今天。逻辑校验看字段之间是否自洽,比如判定为合格但某项关键指标超标,就存在矛盾。业务校验对照企业标准和历史数据,识别偏离常规的情况,比如某个供应商的某批次指标明显低于其历史均值。

三层校验通过的报告可以直接进入下一步;未通过的转到人工复核队列,并附上未通过的具体原因。

这样设计的好处是,AI 处理的是量大、规则清晰的常规部分,人只需要关注少数异常项。人力不是被替代,而是被集中到了真正需要判断的地方。

四、第三步:结果回写与人工复核

最后一步是把结果接回业务系统。

结构化数据按目标系统的接口规范写入质量管理系统或 ERP,同时生成处理记录:这份报告什么时候处理的、用了哪个模板、校验是否通过、哪些字段被人工修改过。

人工复核环节处理的是校验未通过的报告。复核人员看到的是已经抽取好的字段和对应的原文位置,不需要从头读报告,只需要确认或修正少数几项。修正记录会回流,用于优化后续的解析与校验规则。

到这里链路才真正闭环——从报告进入到数据入库、异常分流、记录留存,中间不需要人工搬运。

五、上线后看什么指标

链路跑通之后,需要盯三类指标判断运行状况。

效率看单份处理时长,对比上线前的基线。常规报告的处理时间通常能压缩到原来的一个零头,但更值得关注的是整体吞吐量的提升。

质量看字段抽取准确率和漏检率。准确率决定业务人员敢不敢直接用,漏检率决定有没有风险项被放过去。这两个指标要分开统计,因为它们的优化方向不同。

覆盖看自动处理占比,也就是多少比例的报告不需要人工介入就完成了。这个比例会随着规则优化逐步提升,是衡量链路成熟度的核心指标。


质检报告只是制造业里的一类单据。同样的链路结构——解析抽取、规则校验、结果回写、异常分流——可以复用到采购合同、设备维保记录、物料清单、报关单据等场景。

安思派 FDE 服务在制造行业的交付中,正是把这些链路沉淀为可复用的工程模板。第一个场景跑通之后,后续同类场景的接入成本会明显下降,因为数据准备方式、校验框架和验收口径都已经有了参照。