2026 年 7 月 6 日至 12 日当周,OpenRouter 全球调用量排名前六全部是中国开源模型。据每日经济新闻基于 OpenRouter 数据的测算,当周全球总调用量 54.6 万亿 Token,中国模型占约 27.58 万亿、占比约 61%,连续十一周超过美国阵营。数据来源
这对 AI 软件开发团队意味着什么:模型路由的主干正在从海外闭源换成国产开源。过去一年「用国产模型省成本」还是边缘话题,现在它已经是默认选项。本文不讨论「谁更聪明」,只讨论企业级 AI 软件开发怎么重新排兵布阵:榜单数据、三梯队路由、成本剪刀差、切换隐性成本,以及一份可以直接搬进评审会的五步清单。模型集成的工程决策可以在另一篇文章里对照看。
一、榜单数据解读:国产开源实际承接了哪些任务
当周前六的具体调用量:腾讯 Hy3(限时免费)6.13 万亿 Token、小米 MiMo-V2.5 5.95 万亿(环比 +36%)、DeepSeek V4 Flash 5.22 万亿(此前连续七周榜首)、MiniMax M3 4.26 万亿、智谱 GLM-5.2 3.19 万亿(环比 +24%)。
增长的斜率比绝对值更关键。Wing VC 复盘显示,2025 年初中国模型在 OpenRouter 的 Token 占比不足 2%,2026 年 5 月超过 60%,十八个月从边缘走到主干。同期 Google 份额从约 37% 跌至 13%,Meta 在路由量中跌破 1%,OpenAI 降至个位数。
这些调用量主要来自三类任务:通用对话与客服、长上下文处理(文档理解、代码库检索)、研究型与编码型智能体。它们的共同点是量大、单价敏感、容忍一定延迟波动——正好是国产开源模型的优势区间。
需要提醒的是,榜单含「限时免费」的腾讯 Hy3,真实付费口径会略有收缩。但即使剔除免费项,前五里仍有三款中国模型,方向没有改变。
二、三梯队路由表:按任务类型×质量×成本六维对比
企业级 AI 软件开发不建议「全线切换」,而是按任务分梯队。下面是三梯队路由对比,可直接用于方案评审:
| 维度 | 国产开源梯队 | 海外闭源梯队 | 混合路由梯队 |
|---|---|---|---|
| 典型任务 | 通用对话、长上下文、批量编码、研究型智能体 | 高难度推理、专有工具调用、合规强约束场景 | 按任务质量门槛分流 |
| 质量基线 | 主流基准达闭源 85%-95%,代码任务差距更小 | 基准领先,但增量收窄 | 按任务配置质量阈值 |
| Token 成本 | 约闭源 1/16 输入、1/10-1/22 输出 | 高,Agent 场景易账单失控 | 整体成本下降 60%-80% |
| 部署灵活性 | 可私有化、可本地推理 | 仅 API,受订阅与用量限制 | 可逐任务灰度迁移 |
| 数据合规 | 需评估数据出境与出口管制 | 需评估境外数据处理与订阅条款 | 按数据分级路由 |
| 运维复杂度 | 低(API)到中(私有化) | 低 | 需要网关与评测体系 |
长江证券研报与 OpenRouter 官方定价对比显示,输入端国产旗舰约为海外闭源的 1/16,输出端差距扩大到 1/9.8 至 1/22.7。CNBC 实测跑一轮基准评估,Claude 约 4811 美元,智谱 GLM 约 544 美元,约 9 倍价差。
路由的粒度建议到「任务」而不是「产品」:客服、检索、代码补全这类量大任务优先国产开源;合同审查、复杂多步推理等保留闭源或混合。国产模型追平后的具体选型路径,可以参考Kimi 3 追平 Opus 4.8 后的三条新路径。
三、成本剪刀差:开源 29% Token、4% 支出叠加降价后的 TCO
行业数据已经验证了剪刀差的存在。Vercel 2026 年 7 月 AI Gateway Production Index 显示,开源模型承担了约 29% 的 Token 量,但支出只占约 4%——量价严重背离。
2026 年 8 月又有两个变量叠加:DeepSeek V4 Flash 经 Novita 渠道降价约 90%,输入价降到约 0.09 美元/百万 Token、输出约 0.18 美元;同时 DeepSeek 以约 740 亿美元估值重启融资(2026-08-07 报道),供给侧的资本强度在提升。
一个具体账本:每天处理 500 万 Token 的研究型智能体,用海外闭源旗舰每天成本约 125 美元,用 DeepSeek 系列约 0.70 美元。按 30 天算,单任务年化差出 4.5 万美元量级。OpenRouter 数据还显示,智能体单次请求的 Token 消耗约为人类正常使用的 15 倍——任务一旦自动化,成本差异被指数放大。更宏观的成本重估信号,可对照7500 亿美元烧钱与电力 4 倍暴增一文。
三年 TCO 三情景测算(以 10 人 AI 软件开发团队、日均 2000 万 Token 为例):
| 情景 | 配置 | 首年成本 | 三年 TCO |
|---|---|---|---|
| 单闭源 | 全部任务走海外闭源 API | 约 48 万元 | 约 150 万元,且随用量线性上涨 |
| 单国产开源 | 全部任务走国产开源 API | 约 8 万元 | 约 26 万元,含适配与质量返工 |
| 混合路由 | 按任务分梯队 + 本地缓存 | 约 15 万元 | 约 40 万元,含网关与评测建设 |
混合路由不是最便宜的,但风险调整后最稳。成本节省幅度取决于你能接受多少任务交给国产开源——这才是路由重估的核心决策。
四、切换的三笔隐性成本
只看 Token 单价会低估切换成本。以下是企业 AI 软件开发切换模型路由时最容易被忽略的三笔隐性账:
1. 兼容性回归
提示词模板、工具调用 Schema、函数命名与输出格式在不同模型间并不一致。国产开源模型的工具调用实现与海外闭源有差异,批量迁移后轻则返回格式不匹配,重则智能体链路断裂。
2. 质量验收
基准分数高不代表你的业务场景达标。需要为每个迁移任务建立评测集,用 pass^k 与漂移检测跑回归。这一笔通常占切换总成本的 20%-30%,也是最容易被预算忽略的。
3. 出口管制与数据合规
这不是新问题,但路由切换把它推到台前。出海业务涉及 open-weight 模型出口管制与数据出境评估;国内部署涉及备案与供应链稳定性。国产模型供给本身的波动风险,可以读Kimi K3 供给风险下的选型重估。某 SaaS 团队曾因单一闭源依赖导致 API 账单翻倍,被迫做 4.2 周迁移,期间叠加合规补丁与兼容性返工,整体切换成本远超省下的 token 费——反向案例是「只算单价、不算切换」的典型。
五、CTO 五步路由重估清单
- 盘点任务与用量:按任务统计 Token 消耗与质量基线。通过标准:输出「任务 × 月 Token × 当前成本」表,覆盖 80% 以上调用量。
- 建立评测集:为每个迁移任务沉淀 200 条以上带标注用例。通过标准:迁移模型在评测集上达到原模型 95% 的通过率(代码类任务可放宽到 90%)。
- 搭建路由网关:按任务配置优先级与降级链。通过标准:任一上游故障可在 30 秒内切到备用模型,且可观测到每次调用的模型与成本。
- 小流量灰度:先迁 10% 流量跑 1-2 周,盯延迟与错误率。通过标准:P95 延迟不超原方案 1.2 倍,错误率不升。
- 设定成本红线与回滚机制:给每任务设月成本预算与质量告警。通过标准:成本超预算 20% 或质量连续 3 天不达标即自动回滚,全程可逆。
优码云在企业 AI 软件开发与模型路由工程化上有完整落地经验,涉及网关搭建、评测体系与私有化部署,欢迎查看真实案例或直接联系我们。
常见问题
国产开源模型质量够用吗?
取决于任务类型。通用对话、长上下文、编码辅助等量大任务,主流国产开源已到闭源 85%-95% 基线;高难度多步推理与专有工具调用仍需按场景评测。建议用业务评测集验证,而不是看基准榜单。
切换路由要多久?
单任务灰度迁移通常 2-4 周,含评测集建设、兼容性适配与灰度验证。全量切换 4.2 周的团队案例属于反面教材——他们是在账单翻倍后才被迫迁移,提前规划可显著压缩周期。
会不会受出口管制或数据合规影响?
会。出海业务需评估 open-weight 模型出口管制与数据出境;国内部署需关注备案与供应链稳定性。建议按数据分级路由,敏感数据走本地或合规通道,这也是混合路由的重要理由。
小团队怎么起步?
不要一上来搭复杂网关。先从用量最大的单一任务开始,用路由工具或简单降级链切 10% 流量,跑通评测再扩展。省钱效果会立刻体现在账单上。
混合路由会不会增加运维负担?
会,但可控。核心是网关 + 评测 + 可观测性三件套,建设成本约一个后端工程师 1-2 个月。相比单闭源方案的账单失控风险,这笔投入回报明确。
