Gartner 在 2025 年 6 月预测,到 2027 年底超过 40% 的 Agentic AI 项目会被取消,主因是成本失控、价值不清晰与风险管理不足。放到 2026 年的中国市场看,问题更具体:把 RPA 流程改名 Agent、把聊天机器人包装成多智能体平台的宣传并不少见。这篇文章给企业决策者一套可直接用于选型会议的 AI Agent 开发供应商评估清单,从失败原因、交付物定义、六维评估到合同条款逐项拆解。
本文要点
- Gartner 预测超 40% 的 Agentic AI 项目将被取消,多因范围蔓延与成本失控
- 选型前先定 POC 边界、成功指标、数据与权限清单
- 供应商六维评估:工程化、RAG、私有化、安全、运维、成本
- 合同盯住源码归属、验收标准、模型 API 费用三个条款
- 报价模式:人天、里程碑、订阅各有不同风险
一、2026 年企业 AI Agent 项目失败的三类主因
范围蔓延。POC 阶段只跑通一个 demo,需求方看到效果后不断追加场景,供应商也愿意接,项目从「一个客服智能体」膨胀成「全渠道智能中枢」。没有范围冻结机制,交付日期和预算一起失效。
评测指标缺失。多数项目立项时没有定义「什么算成功」。准确率、人工介入率、单任务耗时、错误率没有基线,验收只能靠演示效果和主观判断。上线后业务方不满意,双方各执一词,项目进入无限返工。
多智能体编排与工具调用成本失控。这是 2026 年最典型的新坑。多个智能体协作时 token 消耗按任务链成倍放大,工具调用失败重试、上下文无限增长、外部 API 计费都会在无人注意时把单次任务成本推高几十倍。Gartner 预计 2026 年全球 AI Agent 软件支出将达到 2065 亿美元,钱花在哪、怎么省,选型阶段就该算清楚。
二、选型前先定义交付物:POC 边界、成功指标、数据与权限清单
见供应商之前,先回答三个问题。回答不清楚,谈判和验收都会被动。
- POC 边界:限定 1-2 个真实业务场景,白纸黑字写明「不做什么」。范围冻结是项目存活的前提。
- 成功指标:每个场景给出可量化指标,例如首响解决率、人工介入率、平均处理时长,并约定上线前先测当前基线,没有基线就没有验收依据。
- 数据与权限清单:哪些数据可用于训练或微调、哪些字段必须脱敏、系统对接需要开放哪些接口与权限,逐项列成清单交给供应商评估可行性。
实施路径怎么拆、预算怎么压,可以参考站内这篇《AI Agent 开发实施服务:从万亿市场押注拆解企业落地选型》,把它当成选型会议的对照材料。
三、供应商评估 6 维清单
下面六维建议做成打分表,每维 1-5 分,选型会上逐项过,低于 3 分的维度必须给出解释。
- Agent 工程化能力:编排、记忆、工具调用是三个核心考察点。让工程师现场画架构图,问清多智能体如何通信、任务如何路由、记忆是短期还是长期、工具调用失败如何降级。讲不清架构的供应商直接排除。多智能体编排的实战写法可以参考这篇《用 LangGraph 编排 3 类 Agent 协同工作》,对照检查供应商方案的技术深度。
- RAG 与多模态落地经验:企业场景大量是私有文档问答和图文、音视频处理。要求提供已交付项目的检索方案,问清切分策略、召回率、引用溯源怎么做;多模态要看是否处理过真实业务数据,而不是只会调用公开 API。
- 私有化与信创适配:金融、政务、能源行业的项目往往要求私有化部署,甚至信创环境。这一维要落到合同:支持哪些国产化芯片与数据库、交付物是否含源码级适配,而不是口头承诺「可以谈」。
- 安全合规:重点关注数据出境、权限审计、操作留痕。涉及跨境业务要确认模型和数据链路是否出境;多智能体系统里每个 Agent 的权限边界要能审计,出了问题要能定位到具体环节。
- 交付与运维:SLA 写进合同:可用性、响应时间、故障恢复时长。要求提供监控面板与可观测性方案——Agent 执行链路要能追踪,否则线上出问题只能抓瞎。
- 长期成本模型:不要只看首期报价。把模型 API 费用、算力、运维人力、升级迭代费用拉成 3 年 TCO 再比较。供应商是否提供成本监控与优化机制(模型路由、缓存、错峰调度),直接决定长期账单。算力与部署成本可以参考《AI Agent 开发基础设施选型:百亿算力租赁战背后的企业部署启示》。
四、报价模式对比与合同避坑点
三种报价模式各有适用场景,风险点完全不同:
| 报价模式 | 计费方式 | 适合场景 | 主要风险 |
|---|---|---|---|
| 人天 | 按工程师工时 | 需求模糊、探索型项目 | 范围蔓延时成本无上限 |
| 里程碑 | 按交付节点付款 | 需求相对清晰 | 节点定义含糊会扯皮 |
| 订阅 | 按年或按用量 | 长期运营、持续迭代 | 绑定供应商,迁移成本高 |
合同阶段盯住三个条款:源码归属——定制代码版权归谁、是否包含模型配置与 prompt 资产,写清楚;验收标准——把成功指标量化写进合同,约定未达标如何处理;模型 API 费用——谁承担、按什么口径计费、是否有代付与账单明细,全部书面化,避免上线后才发现 API 账单比开发费还高。
五、落地后如何验收
上线不等于结束。建议按四周节奏验收:第一周验证功能是否按验收标准跑通;第二周对比基线指标,看准确率与人工介入率是否达标;第三、四周观察线上异常、失败重试与工具调用成本曲线。从 Demo 到生产的工程关卡,可以延伸阅读《AI Agent 平台搭建:企业级智能体从 Demo 到生产的五道工程关卡》,把验收标准与工程关卡逐条对齐。
如果团队内部没有足够经验做这份评估,也可以把选型需求交给第三方视角:优码云提供 AI Agent 与多智能体系统的定制开发与架构咨询,过往交付记录在 案例页 可以查阅;需要直接讨论评估清单的,走 联系我们。
常见问题
AI Agent 开发公司和传统软件外包有什么区别?
传统外包按需求文档交付确定功能;AI Agent 开发要处理模型不确定性、上下文管理、工具调用失败等工程问题,交付物往往是「模型 + 工程 + 数据管道」的组合,对供应商的算法与工程复合能力要求高得多,选型时不能沿用过去外包的比价逻辑。
如何判断供应商有没有真实的多智能体编排能力?
让工程师现场画架构图,问三个问题:多智能体之间如何通信、任务如何路由、某个 Agent 失败后如何降级。再要求看已上线项目的监控截图,而不是 PPT 架构图。答不上来或只有概念图的多半是包装。
私有化部署的 AI Agent 大概什么成本量级?
没有标准答案,取决于场景复杂度、并发量和是否信创。建议让供应商给出 3 年 TCO 模型,至少包含算力、模型 API、运维、升级迭代四项,再横向对比两三家,比单看首期报价可靠。
模型 API 费用应该由谁承担?
两种模式都常见:供应商代付(报价含用量)或客户直接开通账号按量自付。关键是合同写清计费口径、账单明细和超支审批机制,防止上线后 API 账单成为无底洞。
