2026 年出现一个反直觉现象:前沿模型每百万 token 价格比 2024 年跌了 70%–85%,同时英伟达通知大客户 AI 服务器涨价超 15%。两边都是真事。对大多数服务端团队来说,推理账单没有因此下降——本文用公开价格数据把这一笔账拆开看。
一份矛盾的价格信号
芯片侧在涨价。Bloomberg 报道并经 Fortune 确认,英伟达合同服务器厂商已通知微软、谷歌、Oracle,AI 服务器系统价格涨幅多数超过 15%,涉及 Vera Rubin 与 Grace Blackwell 旗舰机型,明年初交付生效,主因是三星、SK 海力士、美光 DRAM 涨价。新浪财经转引了这份通知。
API 侧在降价。Wavect 2026 年 5 月整理的公开标价显示,前沿推理模型每百万 token 从约 $15/$75(输入/输出)降到约 $3/$15;前沿通用从 $3/$15 降到 $0.60/$3;缓存输入降到 $0.30。
两条曲线方向相反,说明推理账单不再由单价主导,而由用量与利用结构主导。还按 2024 年单价预期做成本模型的团队,2026 年预算大概率失守——行业口径的成本重估可以参考这篇AI 软件开发成本重估。
服务端推理账单的真实构成
| 账单项 | 2024 年 | 2026 年 | 是否在降价 |
|---|---|---|---|
| 前沿模型输入/输出(每 1M token) | $15 / $75 | $3 / $15 | 大幅降价 |
| 缓存输入 | 不适用 | $0.30 | 新增低价档 |
| 高并发延迟 / 出网带宽 | 高 | 更高 | 未降 |
| 向量数据库托管 | 中 | 中 | 未降 |
| 工程与评测人力 | 高 | 高 | 未降 |
表内数字基于公开价格趋势的示意,源自 Wavect,非任何厂商承诺。一张典型服务端账单可以拆成四块:token 消耗、缓存命中与未命中、实时与批量通道的价差、预留资源利用率。Wavect 的观点很直接:厂商 prompt 缓存已经是"一等架构原语",没命中的长上下文才是大头。
隐性消耗同样要算:重试风暴、agent 循环里的冗余调用、每次请求都携带超长系统提示词。这些不在单价表上,却在账单上逐行累积;多智能体编排尤其容易放大这类消耗,见LangGraph 多智能体编排实战。
账单失控的三个放大器
- 模型月更:模型迭代从季度缩短到月级,每次升级都引入新的调用惯性,成本模型还没来得及更新。
- 调用量增长:AI 进入生产链路后,token 消耗随用户量线性放大;增长本身是好事,账单失控通常来自没有做容量预期。
- 缓存与路由缺陷:缓存命中率低、请求无差别打到最贵模型、异步任务走了实时通道——在单价下降的年份里,这些反而成了主要成本来源。
从账单反推治理动作
治理不是砍价,是让每一类消耗回到它该有的价格档位。按账单构成逐项落动作:
- 接缓存:先接厂商 prompt 前缀缓存(几乎零成本),再用语义缓存覆盖"换措辞问同一问题"的重复场景,适合客服与文档问答。
- 开批量通道:离线分析、异步生成走 batch API,通常省 50% 量级费用;实时任务保留同步通道。
- 做分级路由:贵模型只跑复杂任务,简单任务走便宜默认模型;用置信度阈值做升级,而不是按请求来源硬分。路由的架构做法可参考企业级多模型路由实战。
- 设预算门禁:按日/月预算分级告警,先限流非核心业务,再降级核心链路;硬熔断留给极端场景。
- 把成本归属到业务线:按业务/功能/租户分摊,让每笔钱有负责人,账单可解释、可问责。
AI 模型调用成本与质量的度量口径
只压成本会伤质量。成本侧看单次任务成本、缓存命中率、每业务线月成本;质量侧看 P99 延迟、错误率、任务成功率。
"便宜默认 + 置信度升级"是把两者绑定的常见旋钮:升级率上升说明质量在退,缓存命中率下降说明策略失效。每周一张表复盘环比,再决定动哪个杠杆。AI 模型调用成本治理是持续工程,不是一次性砍价;桌面端 AIcoding 的成本治理也有相近逻辑,可参考Cursor 企业落地中的成本治理实践。
常见问题
Q1:为什么模型 token 降价了,推理账单还在涨?
A1:单价只占账单一部分。调用量增长、prompt 变长、缓存命中率低、agent 循环多次调用都会推高总成本;硬件与带宽成本也在涨。治理重点放在调用结构与缓存,而不是等厂商继续降价。
Q2:语义缓存和厂商 prompt 缓存有什么区别?
A2:prompt 缓存按前缀精确匹配,命中部分几乎免费;语义缓存按 embedding 相似度匹配,能覆盖"换措辞问同一问题"的场景,但需要自己维护一致性策略。两者互补,不是二选一。
Q3:分级路由会不会明显降低回答质量?
A3:取决于任务复杂度分布。多数线上任务复杂度不高,便宜默认模型够用;复杂任务通过置信度阈值升级到强模型。关键是度量升级率与错误率,把降级控制在对业务无感的水位。
Q4:预算门禁怎么做才不会误伤线上流量?
A4:分级门禁:先告警,再限流非核心业务,最后才降级核心链路;配合成本归属按业务线设置不同阈值。硬熔断只留给极端场景。
