2026 年 8 月 7 日,Canva 向股东发出预警:由于过度依赖第三方前沿模型驱动平台 AI 功能,公司把 2026 年营收预期下调约三分之一。CEO Melanie Perkins 的表述很直接——自家模型尚未就绪,而定价、消费模型和使用控制没能跟上超预期的需求。AI 模型调用成本开始直接决定 SaaS 公司的增长报表,而不再只是工程师嘴里的预算项。
Canva 事件复盘:模型依赖如何吃掉 SaaS 毛利
据 The Verge 报道,Canva 营收预期大幅下调的直接原因,是平台 AI 功能过度依赖外部提供方的前沿模型。公司首席运营官 Cliff Obrecht 向同事表示:引入 AI 之前,服务大量免费用户的成本"非常低";AI 功能上线后,"这些成本大幅攀升,单位经济模型发生了根本性变化"。
同赛道 Figma 也未能幸免。2026 年 8 月 Figma 披露业绩预期:9 月所在财季营收增速回落至 36%,低于 6 月时的水平,股价单日暴跌约 15%。两家头部设计软件公司的经历说明:当 AI 推理成本直接挂在 SaaS 毛利上,模型账单会变成增长报表里的最大变量。
Canva 的应对有三条:主动放缓 AI 功能推出节奏;把内部模型与顶级实验室的第三方模型做成本比较,逐步替换;重估定价与用量控制。对普通团队,这三条同样适用——只是顺序应该反过来:先做用量控制,再谈自研。关于 AI 模型调用成本的具体账本结构,可以参考优码云此前整理的AI 模型 TCO 成本测算。
Web 端 AI 模型调用成本失控的三类场景
第一类:长上下文累积。Web 端 AI 应用常把整段对话历史、文档切片、工具返回结果全部塞进上下文。输入 token 随轮次线性膨胀,一次长对话的输入费用可能超过单次输出。
第二类:Agent 循环放大。多步骤任务每步都调用一次模型,失败重试再乘一轮。一个 6 步任务配 2 次重试,实际调用次数是 18 次而不是 6 次,账单随之放大到计划外。
第三类:低质任务误用旗舰模型。文本分类、关键词抽取、简单改写这类任务用旗舰模型完成,输出单价是轻量模型的数倍甚至十余倍,而效果差异微乎其微。
反面案例来自华南某电商 SaaS 团队:为追求"最佳效果"把所有请求统一打到旗舰模型,一个月内账单膨胀到原来的 3.2 倍,同时代码评审合并率从 78% 掉到 64%——成本失控与工程质量下滑同时发生,最后只能全部下线重做路由。模型选型与质量门禁如何协同,可参考AI 代码审查工程化实践中的评审指标设计。
三层成本治理框架:路由、缓存、熔断
第一层是路由层。按任务类型分级:分类、抽取、检索用低成本模型;创意生成、代码推理用旗舰模型。路由判定可以靠规则、关键词,也可以靠轻量分类模型。目标是让 60%-80% 的流量落在低成本模型上。
第二层是语义缓存层。相同或相似请求不重复调用模型,直接从缓存返回。缓存命中率从 23% 提升到 61% 通常分三步:把请求模板拆分,让缓存键更稳定;把关键锚点前置到 prompt 开头;按 TTL 感知调度,冷热数据分层缓存。
第三层是熔断层。设定月度预算与日预算告警线,超过阈值自动降级:旗舰模型切换为低成本模型、关闭非核心功能、返回兜底结果。熔断不是事后补救,而是成本失控的最后一道闸门。
四类成本治理方案对比
| 方案 | 落地周期 | 初始成本 | 语义缓存 | 熔断能力 | 团队要求 | 适用规模 |
|---|---|---|---|---|---|---|
| 自建网关 | 2-4 周 | 高 | 可深度定制 | 强 | 需专职后端 | 日均调用 10 万+ |
| 云网关 | 1-3 天 | 低 | 内置 | 强 | 低 | 各规模 |
| 模型路由库 | 1-2 周 | 中 | 需自接 | 中 | 需后端 | 日均 1 万-10 万 |
| 人工管控 | 当天 | 无 | 无 | 弱 | 低 | 日均 1 万以下 |
自建网关适合有专职后端团队、调用量大的产品;云网关适合快速上线;模型路由库适合已有代码基础、希望保留控制权的团队;人工管控只适合验证期。无论选哪种,路由、缓存、熔断三个能力缺一不可。团队在 Web 端 AI 应用上的成本结构可以横向参考优码云对桌面端 AIcoding 成本拆解的隐性成本口径。
CTO 五步落地清单
- 建立调用基线:接入 LLM 可观测性,统计每个功能的模型、token、成本分布,一周内给出账单构成报告。
- 任务分级:列出全部 AI 功能点,标注任务类型与质量要求,输出"可用低成本模型"清单,通过标准是低成本模型流量占比 ≥ 60%。
- 上线路由层:优先覆盖调用量最大的 3 个功能,验证效果回退率,通过标准是 P95 延迟 ≤ 1.2s、任务成功率不下降。
- 接入语义缓存:对检索、抽取、文案生成等重复度高的功能开启缓存,通过标准是缓存命中率 ≥ 40%。
- 部署熔断层:设置月度预算与日预算告警,配自动降级路径,通过标准是月度预算超支 ≤ 5%。
每一步都有可验证的通过标准,可以直接搬进 CTO 评审会。预算有限的小团队可以从第 1、2 步做起——先看清钱花在哪,再决定怎么省。
常见问题
小团队没有专职后端,能落地这套框架吗?
能。云网关和模型路由库都有托管版本,1-3 天即可接入。先做任务分级和预算告警,这两步不需要写一行路由代码,收益立竿见影。
开源模型能不能替代闭源 API 来降成本?
可以,但要区分任务。轻量开源模型适合分类、抽取、检索等确定性任务;复杂推理与创意生成仍建议保留旗舰 API。团队已有数据显示,开源模型处理 29% 的 token 量只占约 4% 的支出,但工程成本与效果验证不能省。
语义缓存命中率做到多少算正常?
起步 23% 左右,经过模板拆分、锚点前置、TTL 分层三步后普遍可以到 50%-61%。缓存收益取决于任务重复度:检索、客服、文案改写这类场景最高,一次性创意任务基本没有缓存空间。
从旗舰模型迁到低成本模型,迁移成本有多大?
大部分是 prompt 适配成本,不是架构成本。通过路由层做灰度切换,一个功能 1-2 天即可完成验证。建议先迁调用量最大的三个功能,用效果回退率决定是否全量。
Canva 在自研模型,我们也要自研吗?
不需要。Canva 自研是因为它要服务 2.6 亿月活用户,推理量级完全不同。普通团队在自研前先把路由、缓存、熔断做好,成本通常能降 40%-60%,投入产出比远高于自研。
如果团队正在评估 Web 端 AI 应用的模型选型与成本治理,可以带着账单来找优码云做一次架构评审——联系优码云,或直接查看历史案例里同类项目的落地方式。
