2026 年 8 月 17 日起,DeepSeek API 峰谷定价正式生效:V4-Pro 高峰时段输出涨到 27 元/百万 tokens,空闲时段 13.5 元。价差翻倍,服务端的大模型 API 成本控制从可选优化变成必做功课。
这篇文章把新计价表拆开,给一个可复用的成本测算模型,再落到四类服务端改造动作。适合后端、平台、AI 应用团队的负责人直接拿去排期。
峰谷定价新计价表:三档价格 × 两个时段
根据官方公告,新价格已于北京时间 8 月 17 日 00:00 生效:高峰时段为北京时间 9:00-12:00、14:00-18:00,其余时间均为空闲时段,空闲时段价格为高峰时段的 50%。央广网报道与观察者网报道给出的两档模型完整价格为:
| 模型 | 计费档(元/百万 tokens) | 空闲时段 | 高峰时段 |
|---|---|---|---|
| V4-Flash | 输入 · 缓存命中 | 0.05 | 0.10 |
| V4-Flash | 输入 · 缓存未命中 | 1.50 | 3.00 |
| V4-Flash | 输出 | 4.50 | 9.00 |
| V4-Pro | 输入 · 缓存命中 | 0.15 | 0.30 |
| V4-Pro | 输入 · 缓存未命中 | 4.50 | 9.00 |
| V4-Pro | 输出 | 13.50 | 27.00 |
这张表有三个结构性事实。
第一,输出 token 是最贵的计费档,V4-Pro 高峰输出价是缓存命中输入价的 90 倍。成本优化的第一刀应该砍在输出量上,而不是纠结输入。
第二,缓存命中与未命中之间隔着 30 倍价差(V4-Pro:0.15 对 4.5),这是所有杠杆里倍数最大的一个,比峰谷错峰本身还大。
第三,这次涨价不是孤例。据观察者网梳理,智谱 CEO 4 月表示一季度 API 调用定价提升 83%,豆包专业版 6 月起采用 68/200/500 元三级阶梯套餐。国产大模型集体把价格从补贴期推向成本期,服务端做成本工程是确定性方向。
成本测算模型:日均 100 万 tokens 输出,峰谷错峰省多少
下面用可复制的测算口径,算清楚错峰和缓存优化各值多少钱。假设:主力模型 V4-Pro,日均输出 100 万 tokens,日均输入 500 万 tokens,输入缓存命中率 70%,高峰/空闲流量各占 50%。
先看输出成本。全高峰为 100 万 × 27 元 = 2700 元/日;全空闲为 100 万 × 13.5 元 = 1350 元/日;一半高峰一半空闲则为 2025 元/日。仅把一半输出挪到空闲时段,每日省 675 元,月(22 个工作日)省约 1.5 万元。
再看输入成本。500 万输入里 350 万缓存命中、150 万未命中:全高峰为 350×0.3 + 150×9 = 1455 元/日;错峰一半为 350×0.225 + 150×6.75 ≈ 1091 元/日,再省约 364 元/日。
把命中率从 70% 提到 90%(450 万命中、50 万未命中),输入成本进一步降到约 439 元/日。三项叠加,从全高峰 + 70% 命中到错峰 50% + 90% 命中,总成本从约 4155 元/日降到约 2464 元/日,降幅约 40%。
| 场景 | 输出成本(元/日) | 输入成本(元/日) | 合计 | 较全高峰 |
|---|---|---|---|---|
| 全高峰 + 命中 70% | 2700 | 1455 | 4155 | — |
| 错峰 50% + 命中 70% | 2025 | 1091 | 3116 | -25% |
| 错峰 50% + 命中 90% | 2025 | 439 | 2464 | -41% |
| 全空闲 + 命中 90% | 1350 | 392 | 1742 | -58% |
这是模型测算,实际以账单为准;但 30%-50% 的降本空间是真实可达的量级。知乎上有工程师做了可交互的峰谷定价成本计算器,把你们的调用量、命中率、错峰比例填进去能拿到更精确的数。
四类可执行策略:把账单压下来的服务端动作
策略一:错峰调度,把批处理任务移到 18:00 后
高峰时段 9:00-12:00、14:00-18:00 正好是企业在线业务最忙的窗口,但很多延迟不敏感任务根本不必挤在高峰。
- 报表生成、数据标注、异步总结、批量 embedding、向量化回流——这类任务通过任务队列定时在 18:00 后执行。
- 离线任务用独立队列 + 定时触发(如 cron),与应用在线流量解耦。
- 在线交互只保留实时推理,非实时路径统一走空闲窗口。
- 监控脚本也要错峰:巡检、健康检查、日志分析不在高峰凑热闹。
策略二:上下文缓存命中率优化,这是倍数最大的杠杆
官方上下文缓存按 prompt 前缀自动命中,命中价与未命中价差 30 倍。把动态内容往 prompt 尾部放,是命中率优化的第一原则。
- 系统提示词、few-shot 示例、工具定义做成固定前缀,不随请求变化。
- 用户问题、会话变量放在前缀之后,避免污染缓存前缀。
- 多轮对话复用同一个会话前缀,避免每轮重发完整历史。
- 对同 prompt 同参数的请求做服务端结果缓存,直接省掉重复推理。
策略三:Flash/Pro 分级路由,简单任务别用重模型
V4-Flash 输出价 4.5 元/百万 tokens,V4-Pro 是 13.5 元。同量输出走 Flash 直接省三分之二,代价是推理深度下降。
- 分类、抽取、摘要、翻译、意图识别这类判别型任务默认走 Flash。
- 代码生成、多步规划、长文档理解走 Pro,按任务类型配置路由表。
- 对不确定难度的请求先走 Flash,检测到低置信度再升级 Pro 重试,形成两级路由。
- 把路由规则沉淀成配置中心的一份映射表,让产品侧也能调整。
策略四:批量接口与缓存层建设
合并短请求能显著降低输出 token 总量:多条消息合并一次生成,减少重复的格式输出与开场白。
- 流式输出配合前端逐字渲染,避免超时重试造成重复计费。
- 服务端加一层结果缓存(KV 语义缓存),相同问题直接命中不调模型。
- 统一网关做限流、预算监控与账单告警,超预算自动降级到 Flash。
与开源模型 / 私有化部署的成本对比边界
峰谷定价本质是算力调度工具:平台用价格把弹性需求引向空闲时段。雅虎财经援引的公告同样强调这一点。对服务端团队而言,私有化部署不是无脑答案,要看清边界。
| 维度 | 官方 API(错峰 + 缓存优化) | 开源模型自部署 |
|---|---|---|
| 初始投入 | 按量付费,无前置成本 | GPU 采购或租赁,起步数十万元级 |
| 单位成本 | 高峰贵、空闲减半;依赖命中率与路由 | 利用率高时边际成本低,利用率低时平均成本反而高 |
| 运维复杂度 | 平台承担扩容与容灾 | 自己扛 GPU 运维、扩缩容、模型升级 |
| 迭代速度 | 新版本自动可用 | 升级、对齐、验证都要自己做 |
| 适合场景 | 需求波动大、团队小、上线快 | 稳定高吞吐、数据合规要求严 |
一个务实的边界是混合架构:敏感或高吞吐任务走私有化,弹性与长尾任务走 API 并错峰。先算清楚各自的日均 token 分布,再决定切割点。
落地检查清单
- 导出过去 30 天账单,按模型、按计费档拆出 token 分布。
- 把调用量按高峰/空闲切分,确认哪些任务可以错峰。
- 检查 prompt 结构,把动态内容挪到前缀之后,验证缓存命中率变化。
- 建立 Flash/Pro 路由表,先按任务类型粗分,再按置信度细化。
- 给批处理任务接上任务队列与定时调度,观察高峰流量占比。
- 设置预算告警,超阈值自动降级,防止单日费用失控。
如果你们的服务端已经在某家大模型 API 上产生稳定账单,需要做成本测算与改造排期,可以联系优码云,我们有服务端成本工程与 AI 应用落地的实战经验,直接对着你们的调用量给方案;同类项目的交付方式可以看优码云案例库。
常见问题
DeepSeek 峰谷定价的高峰时段是几点?
北京时间 9:00-12:00、14:00-18:00 为高峰时段,其余时间为空闲时段。空闲时段价格为高峰时段的 50%。
V4-Pro 高峰 27 元/百万 tokens 具体指什么?
指输出 token 计费档,高峰时段每 100 万输出 tokens 27 元,空闲时段 13.5 元。输入按缓存命中/未命中两档计价,分别为 0.15/0.30 元和 4.5/9.0 元。
怎么提高 API 缓存命中率?
把系统提示词、few-shot 示例、工具定义做成固定前缀,动态内容放在 prompt 尾部,多轮会话复用同一前缀。命中价与未命中价差 30 倍,是最值得先做的优化。
峰谷定价对已接入的现有应用有影响吗?
计价规则变了,调用方式不变。成本会随调用时段和命中率波动,需要按新价格重新测算预算,并把错峰调度和缓存优化排上日程。
错峰调度会不会影响用户体验?
在线交互请求保留在高峰时段,只把延迟不敏感任务移到空闲时段,用户无感知。响应时间要求高的场景用 Flash 兜底,进一步控制成本。
