第 37 问

AI 项目怎样验收端到端效果和生产稳定性?

第 37 / 100 问试点、评测、验收与失败退出

模型生成一段内容只用十秒,整项业务仍可能需要两天。时间花在等数据、等审批、改格式、人工复核和异常返工上。

只验收模型环节,企业会得到一个局部优秀、整体无效的系统。

AI 项目要从任务触发验收到最终业务结果,同时证明正常、异常、峰值和持续运行下都能稳定交付。

先画出完整任务链

把准备输入、等待、生成、检查、修改、审批、写回、通知和后续处理全部列出来。试点前记录当前基线,试点后比较端到端周期、实际完成量、返工、单位成本和客户结果。

某一步快了多少,只能解释局部变化。若审核队列更拥堵,模型提速可能完全没有转化为交付提速。

用一张表完成端到端验收

层面 验收内容 典型证据

任务质量 结果是否正确、完整、可用 分类型评测、人工修改、严重错误

流程结果 上下游是否一起改善 端到端时长、返工、积压、一次完成

系统稳定 工具和依赖能否持续工作 超时、失败、并发、恢复时间

人工运行 复核与接管是否可承受 复核量、处理时长、接管原因

业务价值 最终经营或客户结果 单位成本、交付、采用、投诉或风险

变化

风险治理 异常能否控制 越权、重复动作、暂停、回滚和追溯

六层中有一层明显失效,推广范围就要受到限制。

稳定性要主动制造坏情况

测试输入变化、并发高峰、工具超时、数据缺失、权限变化、知识冲突、模型波动和外部系统失败。观察系统能否限流、避免重复操作、转人工、暂停和恢复。

连续运行一段时间的真实记录,比一次精心准备的演示更接近生产事实。试点期由专家随时修复可以帮助学习,但复核量、修改量和恢复时间都要计入成本。

验收必须触发决定

通过验收也可以只进入下一层:继续影子运行、限定用户开放、只允许建议、开放部分自动动作,或扩大范围。没有达到门槛,就选择抢救、缩小、暂停或关闭。

本篇负责第一次试点的端到端验收。系统上线后的模型、知识和工具发生变化时怎样重新验证,由第 38 问接着回答。

企业真正购买的是一条业务链长期可靠地完成结果,一次漂亮输出远远不够。

本问行动:把当前验收表从模型指标向前后各展开一步,看看输入准备和最终业务结果有没有被遗漏。