引入 AI 工作台之后,成本往往经历三个阶段:起初是小范围试点,账单可以忽略;随后推广到几个部门,数字开始明显上升;等到管理层过问时,往往已经难以说清钱花在了哪里。

这时候常见的反应是限制使用——缩减席位、收紧额度。但这样做只是压住了数字,没有解决问题,业务侧的效率提升也一并被压制。

成本失控的原因,通常不是"用了 AI",而是用量结构出了问题。

Token 成本失控怎么办:WorkBuddy 的成本治理

一、三个典型的成本漏洞

第一个漏洞是重复调用。同一个任务在不同会话里反复执行,每次都从头处理一遍相同的材料。如果中间结果没有被复用,同一份文档可能被解析了几十次,成本直接翻倍。

第二个漏洞是上下文过长。把整本手册、整年的数据一股脑塞进任务里,模型需要处理的 token 数量急剧上升。很多时候真正需要的只是其中几页内容,但缺少筛选机制,全部被送进了模型。

第三个漏洞是模型错配。简单任务用了高阶模型,就像用货车送一封信。不同复杂度的任务应该匹配不同能力的模型,缺少路由机制时,成本会在不知不觉中累积。

这三个漏洞有个共同点:都是配置问题,而不是使用量问题。用的人越多、任务越复杂,漏洞放大的倍数就越大。

二、统一接入:让模型可切换、成本可追溯

治理的第一步是把模型接入收口。如果每个团队各自申请账号、各自对接模型,企业层面根本看不到全局用量,也就无从治理。

通过统一的模型服务平台接入,可以做到三件事:所有调用走同一个入口,账单集中;模型可以按需切换,同一个任务可以比对不同模型的成本与效果;每一次调用都留下记录,知道是谁、在哪个任务、用了哪个模型、花了多少。

Token Hub 承担的就是这一层职责——把模型供给、成本治理与权限审计收在同一层。模型切换与调用成本可追溯,是后续所有优化动作的前提。

没有这一层,成本就是一个黑箱。

三、限额与配额:把预算分到人和部门

有了统一入口,第二步是分配。常见的做法有两种:按部门划分总额,或者按人头设置月度限额。

两种方式各有适用场景。部门总额适合任务量波动大、协作紧密的团队,内部可以自行调剂;人均限额适合岗位职责清晰、用量相对稳定的场景,便于个人自律。

实践中更稳妥的是两者结合:部门有总额上限,防止整体失控;个人有默认限额,超出后需要申请。这样既保留了灵活性,也守住了底线。

配额不是一成不变的。随着场景成熟、用量数据积累,可以逐步调整到更合理的水平。

四、持续优化:用量看得见才管得住

治理的第三步是建立反馈循环。定期查看用量数据,能发现不少问题:某个任务的调用频次异常高,可能是重复执行;某个部门的成本占比远超其业务量,可能是任务设计不合理;某个模型的单位成本明显偏高,可能需要切换。

这些数据的作用不只是省钱。用量分布往往能反映出真实的需求热点——哪些场景被高频使用,说明它解决的是真问题;哪些场景几乎没人碰,说明选型时判断有误。这些信息对后续的场景规划比成本本身更有价值。

对涉及敏感数据的企业,还需要在成本治理之外考虑部署方式。私有化部署可以让数据与调用记录全程留在本地,既满足合规要求,也便于内部审计。


成本治理的目标不是把数字压到最低,而是让每一分投入都能说清楚去向和产出。压低成本很容易——限制使用就行;难的是在保持业务效率的同时,把成本结构理顺。

这需要平台能力(统一接入与配额管理)与工程经验(任务设计与用量优化)的配合。安思派 FDE 服务在交付中会把两者放在一起推进:既帮企业把场景跑通,也帮企业把账算清楚,让成本从第一天起就可追溯。