对于每年在算力上支出百万级的企业技术负责人来说,真正的问题不是"哪家芯片更强",而是:当供应链从单极裂变成三极,我的成本模型和风险对冲策略是否需要推翻重来?
三极格局:从"只买 Nvidia"到"三家比价"
过去五年,企业 AI 算力采购几乎等同于"买 Nvidia"。H100/H200/B200 系列一卡难求的局面从 2023 年延续到 2025 年底。但 2026 年年中回头看,格局已经裂变——此前我们详细拆解过 AMD 50 亿美元押注头部模型企业 背后算力供应链的松动信号,而 Etched 的百亿估值则意味着第三极正在成型:
| 维度 | Nvidia (GPU 霸主) | AMD (挑战者) | ASIC 新锐 (Etched/Cerebras) |
|---|---|---|---|
| 算力密度 | B200 单卡 FP8 4.5 PFLOPS | Helios 单机架 2 吉瓦级 | ASIC 专有架构,推理能效比突出 |
| 生态成熟度 | CUDA 十年代码积累,工具链最全 | ROCm 快速追赶,头部模型企业已适配 | 自研编译器,生态早期 |
| 供应稳定性 | 交期 12-20 周,历史上多次短缺 | 2 吉瓦产能承诺,弹性更高 | 量产爬坡中,小批量交付 |
| 单卡/节点价格 | B200 ~$30K-$40K | Helios 未公开定价,预计对标同级别 | 推理 TCO 据称低 40-60% |
| 适用场景 | 训练+推理全场景 | 推理+中小训练,多模型路由 | 高频推理、特定架构优化 |
三极格局意味着企业第一次有了真正的谈判筹码。但更关键的是选型背后的三个结构性变量——它们在 2026 年才全面浮出水面,之前的任何采购决策都未将其纳入模型。
三个正在改写算力账本的新变量
出口管制从 GPU 延伸到模型
2026 年 7 月,美国财政部制裁中国 AI 企业月之暗面,open-weight 模型出口管制讨论同步升温。对出海 SaaS 和混合架构团队来说,算力选型不再只是"哪家芯片跑得快",而是"哪家芯片在 12 个月后还能合规买到"。供应链的地缘弹性已和算力密度并列选型第一维度。AMD Helios 作为非 Nvidia 阵营的新选项,AI 软件开发团队 GPU 采购多了第二个选项,其意义不仅是性能对标,更是供应链冗余。
推理需求超过训练,芯片采购逻辑逆转
Vercel 2026 年 7 月发布的 AI Gateway Production Index 数据显示:开源模型占 29% 的生产流量,但仅消耗 4% 的 API 支出。大量推理负载正从昂贵闭源 API 迁移到可自部署的开源模型——我们在 软件定制开发成本重估 中详细拆解过这一剪刀差如何改写外包报价。芯片选型的主战场正从"训练用哪家"转向"推理部署用什么"——推理功耗和每 token 成本成了比训练峰值算力更重要的决策变量。
数据中心电力瓶颈成为硬件问题
2026 年 7 月 25 日,TechCrunch 报道了一起事故:一根倒塌的电线杆导致 3.1 吉瓦电力在 30 秒内断开,AI 集群集体瘫痪。电力供应的物理约束正从"选址问题"升级为"硬件选型问题":同吞吐量下不同芯片架构功耗差异可达 40%。在电力紧张地区,能效比直接等于可用算力。
算一笔三年账:三种路径的真实成本
基于 2026 年 Q2 中国市场量级,我们为典型 AI 软件开发团队(日均推理 100 万次、年自训练 2-3 个小模型)测算。Etched 这类 ASIC 芯片的崛起意味着 非 GPU 推理芯片正在改写部署账本,将其纳入混合方案后:
| 情景 | 纯云 API | 混合(云训练+自建推理) | 自建全栈 |
|---|---|---|---|
| 硬件采购 | ¥0 | ¥80-120 万 | ¥250-400 万 |
| 云 API 年费 | ¥180-250 万 | ¥50-80 万 | ¥10-20 万 |
| 运维人力/年 | ¥0 | ¥30-50 万 | ¥60-100 万 |
| 三年 TCO | ¥540-750 万 | ¥320-490 万 | ¥330-560 万 |
| 隐性风险 | 供应商锁定、API 涨价 | 多芯片管理、供应链 | 换代折旧、电力容量 |
以上数字基于 Nvidia H200/B200、AMD MI300X 及国产方案 2026 Q2 市场价格参考,实际因团队规模和配置浮动。
关键发现:混合方案在三年尺度上首次与纯自建持平甚至更优——不是硬件变便宜了,而是推理占比上升后,"云 API 训练 + 自建推理集群"的组合比"全自建大集群"更灵活。
一个真实的单供应商锁定事故
2025 年初,华南某金融科技团队(80 人)全面采用某头部 GPU 供应商云实例,理由是 CUDA 生态最成熟。
到 2025 年底,GPU 云实例三次调价,单卡小时费累计涨 42%。年推理成本从预算的 ¥87 万飙到 ¥124 万。推理代码深度依赖 CUDA 专有库,切换成本预估 11 周。
2026 年 Q1,团队启动多供应商改造:推理链路迁至 AMD MI300X 集群,保留 Nvidia 仅用于训练。切换代价:6.2 周 + ¥23 万。首季度推理成本降 28%,同时获得与两家供应商分别议价的能力。
教训很直接:单供应商的"省心"在涨价周期中被迅速放大为"省不了"。多供应商架构是成本风险对冲的必选项,不是锦上添花。
CTO 五步采购核查清单
- 算力画像:统计过去 90 天训练 vs 推理 GPU 机时占比。通过标准:推理 > 60% → 优先评估混合方案。
- 供应商弹性:核心推理链路能否 2 周内迁移至第二供应商?通过标准:至少一条链路完成跨供应商 PoC,延迟涨幅 < 15%。
- TCO 建模:按三种情景建模三年现金流。通过标准:混合方案三年 TCO 较纯云低 20%+ 触发切换。
- 合规审查:选中芯片是否在出口管制清单中?通过标准:至少有一条"国产芯片+国产模型"全合规链路可用。
- 电力核验:自建集群电力配额覆盖未来 18 个月扩容?通过标准:可用电力 ≥ 峰值功耗 × 1.3,含 SLA 保障。
常见问题
50 人以下团队,芯片选型要关注这么多吗?
小团队更不该单供应商锁定——缺乏大厂的议价能力和冗余预算。建议:推理走多模型 API(至少 2 家供应商),训练按项目走按需 GPU 实例,不签年度框协议。
国产算力卡现在能替代 Nvidia 吗?
推理场景下,昇腾 910B 在主流开源模型上的性能已达 A100 的 80-90%,且不受出口管制影响。训练场景差距仍大,建议"国产推理 + 进口训练"混合架构。
从纯 Nvidia 切换到多供应商,工程代价多大?
取决于 CUDA 耦合度。PyTorch 2.0+ 且未用 CUDA 专有 API 的,迁移到 AMD ROCm 约 2-4 周;深度依赖 cuDNN/cuBLAS 的预估 6-10 周。先做 CUDA 依赖审计。
自建集群的电力问题真那么严重?
2026 年一线城市 IDC 机柜供电紧张已非个案。深圳某 IDC 当前排队等电力的 AI 集群超 30 个,平均等待 4-6 周。对延迟零容忍的项目务必在选址前确认电力配额。
三年尺度上哪种方案 ROI 最高?
年均推理超 500 万次时,混合方案三年 TCO 通常比纯云低 35-50%。前提是有 1 名专职运维且团队有 GPU 集群管理经验。小团队建议"多供应商 API 路由"起步。
参考
- TechCrunch: Etched defies skeptics, hits $10.3B valuation
- TechCrunch: AMD takes on Nvidia with its Helios AI rack-scale system
- TechCrunch: One fallen power line exposed a growing AI data center problem
优码云(umayun.com)为企业提供 AI 软件开发与算力架构咨询服务。如需针对业务场景的算力方案,欢迎联系。
]]>