第 39 问

为什么单次成功率很高,仍可能无法支撑长流程连续自动运行?

第 39 / 100 问试点、评测、验收与失败退出

一个步骤的成功率看起来很高,连续串联多个步骤以后,整条流程却经常失败。团队很容易认为,再把每一步优化一点就够了。

长流程可靠性会被每个步骤持续消耗,还受到错误传播、依赖故障和恢复能力影响。单步平均成功率无法代表端到端完成率。

一个简单算例看出差距

假设一条流程有十个必须连续成功的步骤,每一步独立成功率都是 95%。在简化假设下,整条流程一次完成的概率大约是 0.95 的十次方,结果约为 60%。

这个数字只用于解释数学直觉,不代表任何企业的实测结果。真实系统中的步骤并不完全独立,重试、补偿、人工接管和共同故障都会改变结果。

前面的小错误会污染后面所有正确动作

第一步抽错客户编号,后面的查询、计算、生成与提交即使逻辑正确,也全部服务了错误对象。系统越流畅,错误传播越快。

所以要在对象、金额、权限、外部发送和数据写入等关键节点验证中间状态,不能只在末尾看一段“任务完成”。

长流程必须有状态机和检查点

系统要记录当前步骤、已执行动作、工具真实返回、可重试条件、幂等要求和补偿路径。连续失败、成本超限、证据冲突和结果未知时进入停止或人工接管。

自由生成一长串计划,再从头执行到尾,在网络、权限和业务状态变化时很容易失控。

分层看任务,别只看平均

简单样本成功很多次,无法抵消少量高风险任务失败。按任务类型、复杂度、数据质量和风险分别观察连续完成率,还要覆盖并发、长时间运行和外部工具波动。

最终验收回到真实业务状态:订单、工单、资金、库存或设备是否正确变化,客户是否得到结果。AI 说“已完成”只是一条输出。

长流程可靠性的敌人,是每一个看起来可以忽略的小概率错误。

本问行动:把端到端流程的每个必经步骤列出来,先计算简化连续成功率,再标出真正需要检查点的位置。