AI 质检系统定制开发的核心不是选多大模型,而是先分清检测对象与错误成本:制造业视觉缺陷检测用 YOLOv8+ONNX Runtime 的专用小模型,游戏与软件质检用 Playwright+LLM 断言,两条技术栈的成本结构和落地路径完全不同。
本文要点
- 游戏行业头部厂商艺电(EA)公开披露其质检流程约 85% 已由 AI 自动化,场景集中在 UI 自动化测试、资源合规检查、性能异常检测。
- 制造业缺陷检测与游戏质检是两套技术栈:前者吃图像数据、强调漏检率,后者吃 DOM/日志、强调断言稳定性。
- 优码云某制造企业客户项目实测:定制视觉质检系统后,缺陷漏检率从 3.2% 降至 0.4%(内部交付数据,见下文案例)。
- 通用大模型直接做工业质检精度不够,落地形态是专用小模型 + 规则引擎混合方案。
- 成本主体分四块:模型训练、标注人力、推理硬件、持续迭代,后两块往往被低估。
一、游戏行业 85% 自动化:AI 质检不是新概念
艺电(EA)公开披露其质检流程约 85% 已由 AI 自动化完成,这是游戏行业把质检做成流水线的一个标志性数字。游戏质检的典型场景有三类:
- UI 自动化测试:用脚本或 AI Agent 驱动界面操作,验证按钮、弹窗、流程跳转是否符合预期。
- 资源合规检查:检查美术资源命名、尺寸、格式、权限引用是否合规,属于规则密集型任务。
- 性能异常检测:从帧率、内存、加载时长等时序数据里识别异常波动,常配合传感器时序分析。
这三类场景的共同点是:错误可以被低成本重跑,漏检一次最多影响一次发布。制造业缺陷检测则完全不同——漏检意味着不良品流向客户,错误成本高出一个数量级。这决定了后者的技术选型不能照搬。完整的工程化落地环节可参考2026 企业 AI 软件开发流程指南:7 个工程化落地环节。
二、视觉质检 vs 游戏质检:两套技术栈
| 维度 | 制造业视觉质检 | 游戏/软件质检 |
|---|---|---|
| 检测对象 | 产品表面缺陷:划痕、污渍、焊点、装配偏移 | UI 元素、文本、资源合规、性能指标 |
| 核心技术栈 | YOLOv8 + ONNX Runtime,专用小模型 | Playwright 驱动 + LLM 断言 |
| 数据形态 | 工业相机图像 / 视频帧 | DOM 快照、截图、执行日志 |
| 输出形式 | 缺陷坐标、类别、置信度 | 用例通过/失败、合规报告 |
| 主要挑战 | 光照变化、遮挡、缺陷样本不平衡 | 断言漂移、页面结构频繁变化 |
| 漏检代价 | 不良品流向客户,代价极高 | 回归可重跑,代价相对可控 |
选型判断可以简化为一句:图像缺陷看漏检率,界面与流程看断言稳定性。混用两条技术栈(比如拿 LLM 做视觉缺陷分类)是项目最常见的返工来源。
三、制造业缺陷检测怎么落地:某制造企业案例
优码云曾为一家制造企业定制 AI 质检系统,核心目标是提升产线表面缺陷检出能力。项目实测数据:缺陷漏检率从 3.2% 降至 0.4%,降幅约 87%。该数据来自优码云该制造行业客户项目交付记录,非公开行业统计,引用时请注明项目实测口径。
落地路径分四步:
- 现场采集与标注:在真实产线光照下采集缺陷样本,覆盖划痕、污渍、异色等主要缺陷类别,并保留少量正常样本做负样本。
- 专用小模型训练:基于 YOLOv8 训练缺陷检测模型,导出 ONNX 格式,经 ONNX Runtime 部署,保证产线推理延迟可控。
- 规则引擎兜底:对模型置信度低的样本走规则引擎二次判断,处理模型边界情况,降低误报与漏报。
- 灰度上线与迭代:先跑一条产线验证,按周回传误报/漏报样本,持续增量训练。
这套"专用小模型 + 规则引擎"混合方案,是当前制造业视觉质检落地中最稳的形态。项目完整周期与报价取决于缺陷种类数、产线节拍和现有数据基础,建议先做小范围试点验证。交付阶段如何验收 AI 项目可参考软件定制开发验收标准:AIcoding 时代外包项目的六步收尾清单。
四、通用大模型为什么不能直接做质检
我们接触过的一个反面案例:客户一开始想直接用通用大模型做缺陷分类,省掉模型训练环节。实测结果是精度不够、延迟不可控、单张推理成本远高于专用小模型,最终回到 YOLOv8 专用模型 + 规则引擎的路线。
原因并不复杂:通用大模型擅长语义理解,不擅长对高频、低纹理差异的图像做像素级判断;而质检恰恰是低延迟、高吞吐、可重复的确定性任务。通用大模型的正确位置在游戏质检的 LLM 断言环节——判断"这个界面文案是否符合规范"这类语义问题,而不是产线上分辨划痕与灰尘。
五、AI 质检系统的成本结构
AI 质检系统定制开发的成本主体分四块,项目预算容易被标注人力与持续迭代两项低估:
| 成本项 | 内容 | 常见低估点 |
|---|---|---|
| 模型训练 | 数据采集、模型训练与调优、验证 | 缺陷样本采集周期比预期长 |
| 标注人力 | 缺陷样本标注、复核、质量抽检 | 标注标准不一致导致返工 |
| 推理硬件 | 产线侧 GPU/边缘设备、相机与工控机 | 产线节拍要求的并发被低估 |
| 持续迭代 | 误报样本回传、增量训练、版本更新 | 误把一次性交付当终点 |
预算沟通时,务必把"持续迭代"写进合同与服务范围——质检模型上线只是开始,漏检样本会随着新缺陷类别不断出现。相关的企业级 AI 项目预算结构可参考企业 AI Agent 开发成本真相一文。
常见问题
AI 质检系统定制开发一般多少钱?
没有统一报价,费用取决于检测对象、缺陷种类数量、产线节拍与数据基础。成本主体是模型训练、标注人力、推理硬件与持续迭代四块,其中标注与迭代往往是长期投入。建议先做小范围试点,用真实缺陷样本验证可行性后再定整体预算。
AI 质检系统开发周期多长?
周期取决于数据可得性与场景复杂度。标准路径是:现场采集与标注 → 专用小模型训练 → 规则引擎兜底 → 产线灰度上线。缺陷种类越少、产线光照越稳定,周期越短;需要多产线、多机台并行部署时,集成调试会显著拉长工期。
制造业视觉质检和游戏质检的技术路线有什么区别?
制造业视觉质检以图像为主,用 YOLOv8+ONNX Runtime 专用小模型,强调漏检率与推理延迟;游戏与软件质检以 DOM、截图、日志为主,用 Playwright+LLM 断言,强调断言稳定性与回归可重跑。两者不要混用。
通用大模型能不能直接用于工业质检?
不能。通用大模型擅长语义判断,不擅长像素级缺陷分类,直接用于质检会面临精度不足、延迟不可控、单张推理成本高等问题。正确形态是专用小模型 + 规则引擎混合方案,通用大模型只放在语义断言类环节。
质检模型上线后还需要持续投入吗?
需要。新缺陷类别会不断出现,误报/漏报样本要定期回传并做增量训练。持续迭代是质检项目的常态成本,预算与合同里应明确包含这部分服务。
