AI 办公项目做到一半,最容易被问到的问题是:这东西到底有没有省时间。

效果度量的时间轴

这个问题难回答,是因为"感觉快了"不算证据。员工的主观感受会被新鲜感、个别案例和抵触情绪影响,既可能高估也可能低估。要判断真实效果,需要在对的时间点量对的数。

上线之前:先把基线测出来

最常见的失误是系统上线后才想起要度量,结果没有对比基准。

正确做法是在上线前测三个数:当前单件工作的平均耗时(比如审一份合同、出一版周报)、参与这件事的人数与投入工时、以及当前的出错率或返工率。这三个数构成基线,后续所有对比都以它为参照。

测基线不需要很精确,取连续两周的平均值即可,但必须真实——用"我们觉得大概要多久"来估,后面就没法比了。

第一个月:看单件时长与人力释放

上线首月只关注两个指标。

一是单件处理时长:同样一件事,现在需要多久。注意要计入修改和复核的时间,只用"生成用了几秒"来算会严重高估效果。

二是人力释放比例:原本投入这件事的工时,现在还剩多少。释放不等于裁员,多数企业是把这部分时间转去做需要判断的工作。

这两个数一出来,第一个场景值不值得继续投入就有答案了。

第三个月:看准确率与推广面

三个月后该看的是能否持续。

准确率决定系统会不会被弃用。如果答案的准确率不稳定,员工会回到老办法,活跃度随之下降——这是很多项目在第二、三个月掉下来的真实原因。

推广面决定价值能不能放大。第一个场景跑通之后,同类场景有没有跟上、使用人数有没有增加,比单个场景的漂亮数字更重要。

三个容易算错的地方

第一,只算生成时间不算修改时间。AI 产出初稿很快,但人工修改和核对往往占了大头,只算前者会得出过于乐观的结论。

第二,只算试点部门不算全流程。一个场景省下的时间,可能被下游环节的等待抵消掉,要看整条链路而不是单个节点。

第三,把一次性投入算进常规成本。数据整理、权限配置这类前期投入应该在多个场景里摊销,压在第一个场景上会显得不划算。

什么时候能看到结果

按安思派(Anspire)的交付节奏,AI 50 服务旅程的第一段是进现场 50 分钟明确场景与验收口径——验收标准在动手前就定下来,包括要量哪些数、达到什么值算跑通。第二段 50 个有效工时交付可基于真实数据运行的版本,第三段 50 个日历日推动首个场景进入生产。

也就是说,第一个可信的效果数据通常在生产运行后的一到两个月出现。再早的判断,多半只是印象。


Anspire(安思派)面向企业提供 AI 定制、AI 开发、Agent 开发与 AI 场景开发一体化 FDE 服务,由 300 余名 FDE 工程师承担交付,已服务 100 余家企业客户、累计上线 1000 多个场景。