2026 年 3 月,Rippling 的 CFO 在管理层会议上放出一组数字:按当时增速,这家公司下一年会把研发部门人力预算的 90% 烧在 AI token 上。管理层当场决定成立紧急小组,先搞清楚钱花在哪、换来了什么。
这不是孤例。企业 AI 应用开发的门槛已经从「能不能做」变成「成本能不能度量」——度量体系是 ROI 的前提,没有度量,就没有投资回报可言。
五个失控信号:先确认你还在「可度量」范围内
Rippling 复盘时发现,失控不是一夜发生的。它有五个可观察的信号,任何一个亮红灯都该警觉。
| 信号 | 含义 | Rippling 实测 |
|---|---|---|
| token 支出占人力预算比例 | 没有占比锚点,就无法判断贵不贵 | 40%(R&D 人力预算) |
| 月度增速 | 支出曲线斜率比绝对值更危险 | 月增 80% |
| 头部消耗者集中度 | 少数人烧掉大部分预算 | 10-15% 员工驱动约 60% 支出,单个工程师月烧 5 万美元 |
| 是否有多模型路由 | 全员默认用最新最贵模型 | 无路由,所有任务都打前沿模型 |
| 支出与产出是否关联 | 财务只能看到总额,看不到产出 | 财务手工汇总多家供应商面板,无法回答「钱换来了什么」 |
如果你答不上其中任何一栏,说明企业 AI 应用开发的成本还没有进入度量体系。先别急着砍用量,先把账算清楚。关于企业 AI 应用开发整体成本水位,可参考AI 软件开发成本重估一文中的行业数据。
AI Spend Console 五模块:Rippling 自建的支出控制台
这家公司的解法是自建一个支出控制台(AI Spend Console),把分散在各家模型供应商后台的数据收拢到一个视图。五个模块对应五个问题。
- 个人/团队支出追踪:按部门、团队、角色、职级拆解调用消耗,回答「谁在烧钱」。
- 生产力关联:把支出与 PR 数量、代码行数、代码评审返工率挂钩,识别「高支出但总被要求返工」的工程师。
- 模型网关路由:把提示词路由到性价比最优的模型,而非一律打前沿旗舰。
- 预算告警:与各供应商谈判支出上限,超限自动拦截。
- 成本归因:把费用归集到具体业务线,支持 CFO 层面的月度分析。
这套体系的价值不在某一个模块,而在「能回答 CFO 的问题」。财务此前只能看到总账单,现在能回答:哪个团队、哪个模型、哪类任务在烧钱,以及烧得值不值。
40% 到 15%:路由降本的机制分析
最关键的结论是:降到 15% 没有削减用量。2026 年 4 月(CFO 警告当月)消耗了 6050 亿 token 的峰值;7 月内部用量回到 6000 亿 token,但成本只有 4 月的 37%。
省钱的机制有三层。第一层是模型分层:Parker Conrad 在内部评测中发现,开源模型 GLM 5.2 比前沿模型便宜约 85%,性能几乎持平,适合编码类任务;模型分层的完整选型逻辑,见这篇国产与海外旗舰的选型重估。第二层是网关路由:按任务类型自动选择模型,销售团队做语法修改不再调用旗舰模型。第三层是支出上限:与几家主流工具分别谈定预算上限,避免单点失控。
对绝大多数企业来说,不需要自建整个控制台。先接一个模型网关、配好路由规则,就能吃到 40%→15% 里的大部分红利。
从成本度量到 ROI 度量:把 token 与产出关联
成本度量解决「花了多少」,ROI 度量要回答「换来了什么」。这家公司的做法是把调用消耗与工作产出挂钩:代码类看 PR 量、代码行数与评审返工率;非代码类看具体业务指标,比如客户入职团队自动化处理了多少封邮件、完成了多少次数据对账。模型选择本身也直接影响成本水位,Vercel 七月 Production Index 的四个反直觉发现值得对照。
负责该项目的负责人说得很直接:如果不能把调用消费与生产力关联起来,「一切免谈」。这也意味着,度量体系缺位时,企业 AI 应用开发的投资无法向董事会证明价值,甚至会被叫停。
优码云在交付企业 AI 应用开发项目时,会把「可度量」写进架构设计:接入网关记录每次调用的模型、任务类型与成本,用埋点把调用与业务事件关联。上线第一天就有成本与产出的基线,而不是等账单爆了再回头补。
CTO 落地清单:30 天建最小度量体系
不一定要学 Rippling 自研控制台。对大多数企业,30 天可以搭一套最小可用体系。
- 第 1 周:摸底。把各供应商后台的账单导出来,按上表五个信号填一遍,算出占比、增速、头部消耗者。
- 第 2 周:接网关。部署一个模型网关(自建或商业方案),让所有调用经过网关,记录模型与成本。
- 第 3 周:定路由与告警。把编码、总结、翻译、推理等任务类型与模型档位对应,设预算上限与超限告警。
- 第 4 周:关联产出。先挑一个团队试点,把调用消耗与 PR、交付周期、返工率关联,形成第一张 ROI 报表。
部署环节的可靠性同样关键,可对照Web 端模型部署五道可靠性关卡一文补齐监控。这套体系跑起来之后,你会第一次对「企业 AI 应用开发投入产出比」有可量化的答案。想直接找有经验的团队搭,可以看看优码云的案例,或带着当前的 token 账单来聊一次 30 天度量体系评审。
常见问题
企业 AI 应用开发成本失控的第一个信号是什么?
token 支出占人力预算的比例。这家公司到 40% 才警觉,多数企业到 10% 就该建度量体系。不知道占比,就没有判断基准。
一定要自建支出控制台吗?
不必。先接模型网关加路由规则就能拿掉大部分成本水分;控制台是规模大了以后的事。关键是先让调用经过网关,拿到可度量的数据。
网关路由会不会降低模型质量?
按任务分档路由不会。GLM 5.2 在编码任务上与前沿模型几乎持平但便宜 85%;旗舰模型留给复杂推理。质量用评测集和返工率监控,而不是默认全部用最贵。
小团队也要做 ROI 度量吗?
要,但可以更轻。一张表记录每个项目的调用成本与交付成果即可。规模越小,越要在早期建立度量习惯,避免复刻这家公司的路径。
