2026年7月13日,Vercel发布了最新的AI Gateway Production Index——这份月报汇总了其网关在6月份路由的数十万亿Token生产数据,覆盖从文本生成到视频、从开源模型到前沿闭源旗舰的全量调用。Vercel AI Gateway是当前企业AI应用最主流的流量入口之一,这份报告相当于一个「企业AI模型选型的真实投票箱」——不是你问了CTO们选什么,而是他们的生产环境到底在跑什么。
我们通读了全文,提炼出四个可能颠覆你现有选型逻辑的反直觉发现。如果你的团队正在做2026年下半年模型选型预算,下面这些数字值得你花5分钟读完。
反直觉一:开源模型跑了29%的Token量,只花了4%的钱
这是整份报告里最震撼的数字:开源模型在AI Gateway上贡献了29%的Token量,但只消耗了不足4%的总支出。相当于每处理100个Token,将近30个走的是开源模型,而这些Token的成本仅为闭源方案的1/25。
趋势还在加速。开源模型的Token份额从4月份的11%一路攀升到6月的29%,三个月翻了两倍多。驱动这波增长的主力是DeepSeek——它以22.6%的Token量稳居第三,距离第二名Google仅差不到两个百分点。Vercel原话是:"按当前轨迹,一家开源实验室很快将成为AI Gateway上Token量第二大的供应商。"
与之对照:四家美国前沿闭源实验室拿走了95%的支出,其中头部模型企业一家就以32%的Token量吃掉了61%的花费。另一个有趣的信号是:聊天产品开发商的Token份额从12.5%跌到10.3%,但支出份额却从13.3%涨到16.1%——客户发给它的Token变少了,但每个Token都更贵,说明其流量正在向高价值任务集中。
一个值得记住的量化指标:大约每8家使用AI Gateway的企业中,就有1家已经在生产环境运行开源模型。我们在企业级多模型路由实战中详细拆解了如何用路由层把开源和闭源模型编排到一起——不是"二选一",而是"各走各的"。
| 维度 | 开源模型(DeepSeek为代表) | 闭源前沿(头部模型企业等) |
|---|---|---|
| Token量占比 | 29% | ~65%(前四前沿实验室) |
| 支出占比 | <4% | 95%(前四前沿实验室) |
| 单Token相对成本 | ≈ 闭源均价的 1/10 | 基准 |
| 增长趋势(vs 4月) | 11% → 29%(+164%) | 稳中有升(均价+12%) |
| 典型适用场景 | 高吞吐文本生成、嵌入、内部工具 | 高精度编码、金融合规、客服Agent |
| 生产环境采用率 | ~12.5% 企业客户 | 接近全覆盖 |
反面教训:某跨境电商SaaS团队在2026年Q1将所有AI流量——从内部数据分析到客户Chatbot——全部走同一家闭源旗舰模型。Q2收到账单时发现API支出涨了42%,其中客服模块的Token成本占了大头,而这些对话的复杂度根本不需要旗舰级推理能力。他们用两周做了路由分层:客服走DeepSeek、代码生成保留走头部模型企业、图像走GPT Image,次月账单回落了31%,且客户体验指标没有下降。
反直觉二:四个模态、四个王者——「一个模型通吃」是幻觉
"我们选一个最好的模型就行了"——这句话在2026年已经行不通了。Vercel的数据显示,文本、图像、视频三个模态分别由不同实验室统治,没有任何一家在所有模态上都是第一。报告原话:"要在每个模态上运行领先模型,需要横跨至少三家实验室。"
关于多模型协作的完整策略和工程落地框架,参见我们此前发布的2026年多模型协作策略与工程落地指南——其中详细拆解了路由层架构、模型切换的灰度策略和成本门禁机制。
| 模态 | 领导者 | 份额/指标 | 单Token相对成本 | 推荐路由策略 |
|---|---|---|---|---|
| 文本(含代码) | 头部模型企业(Opus系列) | 61% 支出 / 32% Token | 高(基准) | 高精度编码/Agent编排 |
| 图像生成 | GPT Image + Nano Banana | 53% + 39% = 92% 图像量 | 中高 | 双供应商,按场景切换 |
| 视频生成 | Grok Imagine(量)+ Seedance(额) | 42% 量 / 49% 额 | 高(视频单价最高) | 按预算选量或质 |
| 嵌入(Embedding) | 开源模型主导 | 量价双优 | 极低 | 默认开源 |
图像生成是双头格局——GPT Image和Nano Banana两家就吃掉了92%的图像生成量。视频赛道的格局更值得关注:中国实验室拿走了视频生成约三分之二的支出(Seedance、Kling、Wan三家合计),其中Seedance以34%的视频量拿走了49%的视频花费——高价高质的定位清晰。而Grok Imagine以42%的视频量仅占19%的视频支出,走的是"量大管饱"路线。
对企业CTO的启示很直接:你的模型选型不是一个决策,而是一组决策。代码生成和客服对话应该走不同的模型,就像你不会用同一把螺丝刀拧所有尺寸的螺丝。
反直觉三:Fable 5四天追到Opus 4.8的22%——模型切换窗口正在消失
6月9日,头部模型企业发布了旗舰模型Fable 5。仅四天后的6月12日,它的请求量已达到Opus 4.8的22%——每100个发给Opus 4.8的请求,就有22个已经切换到了Fable 5。
然后故事急转直下。6月12日,一项美国出口管制指令生效,Fable 5被暂停访问,直到6月30日管制解除、7月1日恢复服务。一个发布四天就冲到22%采纳率的旗舰模型,就这样被按下了暂停键——整整18天无法使用。
这件事暴露出两个正在加速的趋势:
- 新模型采纳速度刷新纪录:作为对比,Vercel提到此前跟踪过的最快迁移是Gemini 3.1 Pro,它在第二个月才达到类似的家族内份额。Fable 5四天就走完了别人一个月的路。
- 企业的切换窗口期在急剧缩短:四个月前的模型选型结论,今天可能已经失效。如果你的采购周期是按季度甚至半年走的,等你签完合同,市场上可能已经迭代了两茬模型。
落地的建议:不要把模型选型写死在合同里。在AI软件开发外包或采购协议中,留一条「模型升级条款」——当同系列新模型发布且性能基准测试提升超过15%时,允许在30天内切换到新模型,不额外计费。
反直觉四:GLM 5.2两周增长50倍,出口管制掐断Fable 5——地缘政治已是模型供应链的核心变量
6月16日,Z.ai发布了GLM 5.2——一个MIT许可证的开源模型,定位长周期Agent任务,价格约为Opus 4.8的五分之一。到6月底,它的日Token量增长了约50倍,在6月最后一周排到了AI Gateway Token量第11名,个别单日冲到第7名。更惊人的是:它6月总Token量的76%来自最后两周。
把GLM 5.2的增长曲线和Fable 5的被禁放在一起看,一个清晰的信号浮出水面:模型供应链的地缘政治风险已经从"黑天鹅"变成了"灰犀牛"——它不是会不会发生的问题,而是下一次什么时候发生。
对中国企业来说,这意味着:
- 开源模型是出口管制的对冲工具:MIT/Apache 2.0许可证的模型一旦下载到本地,不受后续出口管制影响。DeepSeek和GLM的增长证明企业已经在这么做了。
- 多供应商策略不再只是成本优化:它首先是供应链韧性。如果你只绑定一家美国前沿实验室的闭源模型,一次出口管制就可能让你的核心产品功能下线18天。
- 国产模型的能力差距在急速缩小:GLM 5.2两周50倍的增长不只是低价驱动——企业不会把生产流量交给一个"凑合能用"的模型。
CTO五步选型清单:2026年下半年模型选型可照此执行
基于以上四个反直觉发现,我们总结了一份可以直接搬进技术评审会的五步清单。每一步都设了通过标准:
第一步:拆解你的AI流量结构(1-2天)
把过去30天的AI API调用按「任务类型×复杂度」分成至少三类:高精度任务(代码生成、金融风控)、中等任务(客服对话、内容摘要)、批量任务(嵌入、数据标注、内部翻译)。通过标准:每类任务的Token量占比和支出占比都能量化。
第二步:为每类任务匹配一个主模型+一个备用模型(3-5天)
不要追求"一个模型吃所有"。高精度走闭源旗舰(Opus系列)、中精度走性价比路线(DeepSeek/GLM)、批量走开源嵌入。每个任务都要有一个备用模型——不是"万一挂了再找",而是提前配好、一键切换。通过标准:任一模型供应商断供时,核心功能可以在4小时内切到备用模型。
第三步:建立模型路由的成本门禁(1周)
用AI Gateway或自建路由层设置规则:Token单价超过阈值自动降级到低成本模型、延迟超过SLA自动切换区域。给每个任务设一个月度预算上限,超预算自动告警而非自动断供。通过标准:路由层上线后,API月支出中至少有15%的Token走的是非旗舰模型。
第四步:合同里加上模型升级和出口管制条款(与法务同步)
模型选型不要写死在合同里。留一条「同系列模型升级」「出口管制不可抗力」条款。如果供应商因出口管制无法提供服务超过7天,有权切换至替代模型且不承担违约责任。通过标准:法务审核通过,CTO确认条款覆盖了6月份Fable 5级别的中断场景。
第五步:设定月度复盘机制(持续)
每月看一次Vercel AI Gateway Production Index(或其他生产数据源),对比自己的模型组合与行业趋势是否出现偏差。当某个模型在行业中的采纳率一个月内变化超过10个百分点时,触发模型选型复盘。通过标准:每月的模型组合评审有书面记录,且至少做过一次基于数据的模型切换决策。
常见问题
Q1:小团队(10人以下)有必要搞多模型路由吗?
有必要,但可以从简单的规则开始。两模型就够了:一个闭源旗舰处理高精度任务,一个开源模型(DeepSeek或GLM)处理批量任务。不需要自建复杂的路由层,直接用AI Gateway或LiteLLM的配置文件就能实现基础路由。投入时间约1-2天,首月就能看到账单变化。
Q2:开源模型真的够用吗?精度损失怎么办?
分场景。Vercel的数据已经表明,生产环境中12.5%的企业正在用开源模型——他们不是在做实验。对于客服对话、内容摘要、数据标注、内部翻译等场景,DeepSeek的精度与闭源旗舰的差距在5%以内,但成本差一个数量级。关键是用路由层把高精度任务和高吞吐任务分开,别把客服对话和金融风控跑在同一个模型上。
Q3:出口管制对我们有什么实际影响?应该做什么准备?
最实际的准备:确保你使用的每个闭源模型都有至少一个可行替代方案,且替代方案已经完成接入测试——而不是"理论上能找到"。Fable 5被禁18天的事说明:出口管制的执行速度可能比你的采购流程快得多。对技术栈的影响:优先选择MIT/Apache 2.0许可证的开源模型作为备用方案,它们下载到本地后不受后续管制影响。
Q4:从单模型切换到多模型路由,迁移成本有多高?
如果用的是统一API格式(OpenAI兼容接口),切换成本主要是路由规则的配置和测试,通常1-2周。真正的成本不在技术上——在于团队需要接受「不存在一个最好的模型」这个认知转变。如果你已经在用LiteLLM或AI Gateway,迁移成本可以压缩到3-5个工作日。
Q5:怎么量化多模型路由的ROI?
最简单的公式:ROI = (切换前月API支出 - 切换后月API支出 - 路由层运维成本)/ 路由层一次性搭建成本。根据文中跨境电商SaaS团队的案例,月账单从涨42%变成降31%,净节省约73个百分点——考虑到他们的月API支出是六位数,这个ROI非常可观。关键是:你不需要一开始就做得很精细,先从「高精度走旗舰,其他走开源」的两级路由开始,已经能拿到80%的优化效果。
需要落地支持?优码云为B2B企业提供从模型选型评估到多模型路由架构的完整方案,涵盖企业AI应用开发外包成本拆解中的隐性成本评估。如果你正在做2026年下半年模型选型预算,联系我们获取针对你业务场景的模型组合建议,或查看我们的企业AI落地案例。
参考
- Vercel AI Gateway Production Index — July 2026(Amelia Charles, Harpreet Arora, 2026-07-13)
