跳到主要内容
博客
首页>技术博客>企业 AI 应用开发选型 2026 下半年:DeepSeek 涨价、GPT-5.6 降价后开源闭源怎么选
AI 应用 · Engineering Notes

企业 AI 应用开发选型 2026 下半年:DeepSeek 涨价、GPT-5.6 降价后开源闭源怎么选

2026 下半年格局已变:DeepSeek 峰谷涨价、闭源三档降价、GLM/Qwen 开源入局。用 8 月底真实价格与一次零售迁移复盘,回答企业 AI 应用开发选型该押哪条路线。

优码云团队阅读约 11 分钟
企业AI应用开发DeepSeek开源大模型选型AI应用开发成本GPT-5.6

4 月 24 日 DeepSeek V4 开源与闭源旗舰同日发布、价差 645 倍的场景,到 8 月已变成开源峰谷计费涨价、闭源三档降价、国产开源入局的混战。本文用截至 8 月底的真实价格与一次迁移复盘,重新回答企业 AI 应用开发该押注哪条路线。

本文要点

  • DeepSeek V4 8 月涨价,实行高峰低谷两档计费
  • 闭源三档降价:Luna 降 80%,Terra 降 20%
  • GLM-5.3-Flash、Qwen3.8 加入开源阵营
  • 零售客服迁移案例:成本降到 1/40
  • 建议双模型分层路由,不押单一路线

4 月同日对决,到 8 月发生了什么

2026 年 8 月底的格局已从 4 月 24 日 645 倍价差对决,变成开源峰谷涨价、闭源三档降价、国产开源加速的商业化混战。4 月时,V4 预览版输入价每百万词元 1.74 美元、MIT 协议开源,同一天闭源 Pro 档以输入 30 美元、输出 180 美元发布,两者价差一度达到 645 倍。

四个月后,两个方向都发生了反向调整:8 月 17 日 DeepSeek 随 V4 全系列正式版上线全面上调 API 价格,8 月 22 日又引入峰谷计费,周末全天按低谷价;OpenAI 则在 7 月 30 日调低旗舰新系列价格,最便宜的 Luna 档降幅达 80%。摩根士丹利据此在研报中判断:中国大模型正在告别价格战、转向能力竞争——2026Q2 平均 API 输入价 4.9 元/百万词元、输出 21.9 元,相比 2025Q1 的 3.3 元和 12.2 元,分别上涨约 48% 和 80%(中国经营报:大模型调价暗战)。

2026 年 8 月的价格表:开源、闭源、国产三阵营

截至 2026 年 8 月底,DeepSeek 官方实行高峰低谷两档价,V4-Pro 高峰输出每百万词元 27 元,闭源最便宜的 Luna 档仅 1.2 美元。同一场景的真实报价需要按"调用时段 × 服务层级 × 缓存命中率"来计算,而不是看单一标价。

模型阵营输入(每百万词元)输出(每百万词元)备注
V4-Flash(开源)开源高峰 3.0 元 / 低谷 1.5 元高峰 9.0 元 / 低谷 4.5 元缓存命中低至 0.05–0.10 元
V4-Pro(开源)开源高峰 9.0 元 / 低谷 4.5 元高峰 27.0 元 / 低谷 13.5 元1M 上下文,正式版 0813
Luna(闭源快档)闭源$0.20$1.207/30 降价 80%
Terra(闭源均衡档)闭源$2.00$12.007/30 降价 20%
Sol(闭源旗舰)闭源$5.00$30.00旗舰档未调价
闭源 Pro 旧档闭源$30.00$180.00仍为最贵档
GLM-5.3-Flash(国产开源)国产开源约为前代旗舰的 1/10限时低至 1/20320B-A18B,8/26 开源

DeepSeek 价格来自官方定价页:高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00,其余为空闲时段,空闲价为高峰价一半。闭源侧还需注意:同一模型按服务层级计价,Batch/Flex 0.5 倍、Standard 1 倍、Fast 模式 2 倍;输入超过 27.2 万词元的请求会整体按 2 倍输入、1.5 倍输出重计价(eesel 对 7/30 调价的拆解)。闭源新系列降价 80% 的完整解读可参考GPT-5.6 降价的工程影响分析

技术对比:开源阵营追平了多少

在 Artificial Analysis 智力量表上,新开源的 GLM-5.3-Flash 拿到 57 分,与 Opus 4.8 持平,高于 V4 Pro 正式版的 53 分。这是国产开源模型第一次在第三方综合智力评测上与闭源前沿并列第一梯队(中国经营报报道)。

回看 4 月的数据,当时 V4 Pro 与闭源旗舰的差距是:GPQA Diamond 90.1% vs 93.6%(差 3.5 个百分点)、SWE-bench Pro 55.4% vs 58.6%(差 3.2 个百分点)、Terminal-Bench 2.0 67.9% vs 82.7%(差 14.8 个百分点);而长上下文检索 MRCR 1M 上开源反而领先 9.5 个百分点。半年前同类差距还是 15 分以上,说明追赶在以月为单位收窄。国产模型整体重估的另一视角,可读Kimi 3 追平 Opus 4.8 后的选型重估

2026 年 8 月,开源阵营内部也开始分化:智谱的开源新模型(320B 总参、18B 激活)主打编程与网络攻防,阿里同日发布的 Qwen3.8-Flash(125B MoE、每词元仅激活 6B)主打低成本编码与办公任务,能力均接近闭源前沿。对选型方来说,开源不再只有 V4 一个答案,而是一个可以按任务特性挑选的模型池。

企业选型决策树:2026 下半年看什么

2026 下半年的选型决策树看三个变量:实际缓存命中率、峰谷调用时段占比、是否触碰数据出境监管,三者决定真实成本与合规边界。相比 4 月的"成本敏感度 / 数据主权 / 生态依赖"三层框架,现在需要先把计费维度算清楚。

  1. 第一层:按真实负载算成本。日均超 1000 万词元的场景,先统计缓存命中率与高峰时段占比:固定 system prompt 加知识库前缀的架构,V4 缓存命中价可低至未命中的 1/30,闭源侧 Luna 缓存输入仅 $0.02/百万词元;若调用集中在工作日白天高峰,V4 实际支出会明显上浮,闭源 Batch/Flex 档反而更划算。
  2. 第二层:数据主权与合规。金融、医疗、政务、央企等受数据出境监管的行业,闭源 API 意味着数据必须经过境外服务器;V4 与智谱开源新模型均以 MIT 类协议开源、可私有化部署,且都已适配国产芯片,数据可以全程留在境内,这是闭源方案无法绕过的硬约束。
  3. 第三层:生态与智能体工具链。重度使用 Cursor、Codex 等闭源生态工具的团队,旗舰闭源模型集成深度更好;使用 Claude Code、OpenClaw、OpenCode 等开源工具链的团队,V4、GLM 已完成适配,迁移成本可控。

落到结论:成本敏感、数据私有化、国产化合规、长上下文检索密集 → 开源路线;终端智能体密集型任务、深度绑定海外生态、需要企业级 SLA → 闭源路线;多数企业适合双模型并行,用开源自部署兜底、用闭源快速验证创新业务。

真实案例:零售客户从闭源迁到开源,成本降到 1/40

我们今年 3 月帮一家零售客户把电商客服智能体从闭源迁到开源,日均 50 万次对话,成本降到原来的 1/40,数据全部留在国内,客服满意度没有显著变化。这个案例对 8 月的选型仍有参考价值,因为踩过的坑基本都是迁移共性。

三个主要问题:兼容性——V4 兼容 OpenAI 的 API 格式,但 tool calling 返回结构有细微差异,客户硬编码了原模型的 response 字段路径,我们花 3 天改适配层;推理速度——轻量版首字延迟比原方案高约 30%,用户能感知"慢了半拍",切到 Pro 并用缓存优化后差距缩到 10% 以内;多轮一致性——轻量版在 15 轮后开始"忘记指令",通过每 10 轮插入一次 system prompt 刷新解决,Pro 基本追平。

需要说明的是,这套结论有边界:如果客户核心场景是终端自动化操作(自动操作服务器命令行),我们当时不会建议迁移,因为闭源在 Terminal-Bench 类任务上领先约 15 分。

2026 下半年已不是预测:三件已发生的事

去年预测的国产算力成熟、智能体去绑定化、双模型冗余,到 2026 年 8 月已全部落地,并叠加了一轮涨价与降价。选型逻辑因此从"拼便宜"转向"按负载路由"。

  • 国产算力从推理走向承载前沿开源模型:V4 首次在官方报告把昇腾 950PR 写入硬件验证清单,智谱开源新模型上线即由国产芯片承载线上服务,训练环节的国产替代开始补位。
  • 智能体框架去绑定化加速:DeepSeek Harness 以 MIT 协议开放开发者预览,多模型路由成为主流——简单任务走轻量档、复杂推理走旗舰、终端操作走闭源,一个智能体里混跑多家模型已经是常见架构。DeepSeek 资本与生态的最新变化可参考DeepSeek 估值 5000 亿背后的开源路线分析
  • 双模型冗余从"建议"变成"标配":我们接触的客户中超过 60% 已在搭建主备架构,主模型跑日常流量、备模型在 API 涨价或断供时自动切换;8 月的调价事件反而强化了这个趋势。

常见问题

DeepSeek V4 现在多少钱?

截至 2026 年 8 月底,V4 分 Flash 与 Pro 两档、各设高峰与低谷价,Flash 输出高峰每百万词元 9 元、低谷 4.5 元,Pro 高峰 27 元、低谷 13.5 元。高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00,缓存命中输入价低至 0.05–0.30 元。

闭源旗舰比旧版便宜了吗?

便宜了:7 月 30 日调价后 Luna 档每百万词元输入 0.2 美元、输出 1.2 美元,降 80%;Terra 降 20% 至 2/12 美元,旗舰 Sol 与最贵 Pro 旧档价格未变。闭源从此有了从 0.2 美元到 180 美元的完整分层。

2026 年除了 V4 还有哪些开源模型可选?

2026 年 8 月可选开源主力是智谱 GLM-5.3-Flash(320B 激活 18B)与阿里 Qwen3.8 系列,均以 MIT 类宽松协议发布,与 V4 形成三足鼎立。GLM-5.3-Flash 定价仅为前代旗舰的 1/10、限时 1/20,Qwen3.8-Flash 主打低成本编码办公任务。

企业迁移到开源模型最大的坑是什么?

我们实测的三个坑是 tool calling 返回结构不兼容、轻量版首字延迟高约 30%、长对话 15 轮后指令漂移,分别靠适配层、Pro 档加缓存、定时刷新系统提示词解决。迁移前先跑一周影子流量,比直接切换稳妥。

双模型架构怎么落地?

常见落地是主模型跑 80% 常规流量、复杂任务路由到 Pro 或闭源,用 LiteLLM 或 OpenRouter 统一网关配置 fallback,主 API 异常时自动切换备模型。重点是把缓存命中率设计进架构,而不是只做请求级路由。

国产化合规场景怎么选?

金融、政务、央企等受数据出境监管的场景,优先选 MIT 协议的 V4 或智谱开源新模型私有化部署,两者均已适配国产芯片,数据不出境;闭源 API 需额外做出境评估,通常不满足该类项目门槛。

总结

4 月"同日对决"的结论至今成立:两条路线都押,比只押一条更安全。但 8 月的执行细节变了——价格从固定标价变成"峰谷 + 服务层级 + 缓存"多维计费,开源从 V4 一家变成 V4、GLM、Qwen 三足鼎立。对企业 AI 应用开发团队,最务实的动作是用真实负载跑 7–14 天影子评估,把缓存命中率与峰谷占比算进成本模型,再决定主备模型与路由策略。

如果你正在做选型评估,欢迎联系我们交流具体场景,也可以查看我们的企业 AI 落地案例了解实际交付经验。

参考

分享到
企业AI应用开发选型2026下半年:开源闭源怎么… - 优码云博客