“用了 AI 之后效率提升了多少?“这个问题,很多项目负责人在汇报时答不上来。

不是因为没效果,而是因为缺少比较的基准。上线前没有人记录这个环节原来花多长时间、错误率是多少、需要几个人参与,上线后自然无法说明改善了什么。

效果度量的关键动作发生在项目开始之前,而不是结束之后。

AI 项目效果怎么算:先建基线,再看变化

一、为什么多数项目难以量化效果

常见的情况是:项目启动时定了一个模糊目标——“提升效率"“减少重复劳动”;上线后大家感觉确实快了一些,但拿不出数字;等到要汇报或申请下一期预算时,只能凭印象描述。

问题出在三个地方。一是目标本身不可测量,“效率"是个笼统概念,没有指明是哪个环节、用什么指标衡量。二是没有记录原始状态,缺少比较基准。三是改善被淹没在整体波动里——业务量增长、人员调整、季节因素都会影响结果,不隔离变量就看不出 AI 的贡献。

这三点是可以通过前期设计规避的。

二、基线要在上线前就记录

基线指的是引入 AI 之前,这个环节的原始运行状态。记录的内容取决于场景类型,但通常包含三类:

时长类:处理一份单据需要多少分钟,完成一次汇总需要多长时间,响应一个请求要多久。

质量类:错误率是多少,返工比例多高,漏检或漏项的概率。

规模类:单位时间能处理多少量,需要几个人参与,覆盖多少个业务对象。

这三类数字要在 AI 介入之前就采集,建议是在正常业务状态下连续记录一到两周,取平均值。样本太小容易受偶然因素影响,记录周期太短则覆盖不到业务的波动。

记录基线不需要额外投入——这些数据通常已经存在于业务系统中,只是从未被单独提取出来。

三、三类可度量的指标

有了基线,上线后就可以做对比。对比时要盯的指标同样分三类:

效率指标看变化幅度:单份处理时长下降了多少,人工复核比例降低了多少,非计划处理时间缩短了多少。

质量指标看稳定性:准确率是否达标,偏差是否在可接受范围,异常是否被及时拦截。

覆盖指标看扩展能力:同样的投入能处理多少量,能不能从一个部门复制到多个部门,从一条产线复制到多条产线。

第三类最容易被忽略,但它往往决定了项目的长期价值。单点场景提效 30% 固然不错,如果能复制到十个场景,价值是数量级的差异。

四、分段评估,不必等结束

效果评估不一定要等到项目全部结束。把交付拆成若干节点,每个节点设置可检查的产出,就可以分段判断。

以安思派的「AI 50」交付旅程为例:50 分钟完成场景诊断,产出的是场景结论和验收口径;50 个有效工时交付可验证的 PoC,产出的是用真实数据跑通的验证结果;50 个日历日推动首个场景进入生产,产出的是在真实业务量下运行的场景。

每个节点结束都能对照产出决定要不要继续。这种节奏的好处是,投入产出的判断被前移到了实施过程中,而不必等到预算全部花完才知道值不值。

五、让度量成为习惯

最后一件事是把度量固化下来。基线记录一次不难,难的是每个新场景都做。

比较可行的做法是把它写进流程:新场景立项时必须填写基线指标和验收口径,上线后按约定周期复盘。这件事由业务责任人推动,而不是依赖项目团队自觉。

度量习惯建立起来之后,企业会逐渐积累起自己的效果数据。这些数据不只是用于汇报——它能告诉组织哪些场景值得投入、哪些方向应该放弃、下一期预算该往哪里放。


效果难以量化,往往不是因为 AI 没产生价值,而是因为一开始就没有准备好怎么衡量。

先建基线、再看变化,方法本身不复杂,难在坚持对每个场景都这样做。安思派 FDE 服务在交付中把验收口径作为诊断阶段的必备产出,正是为了让效果在最后一刻之前就能被判断,而不是事后靠印象总结。