第 58 问

AI 智能体的重试、循环、工具调用和多智能体并行,怎样防止预算失控?

第 58 / 100 问生产级架构、运行控制与成本模型

传统软件一次请求通常对应相对稳定的计算。AI 智能体会规划、搜索、调用工具、失败重试,多智能体还可能并行讨论。

一项看似简单的任务,成本可以在后台悄悄放大。

预算控制要同时落到任务、步骤、工具和人工四层。达到上限后由系统停止、降级或转人工,不能让智能体自行决定继续花钱。

先算正确完成一项任务的成本

模型输入输出、检索、第三方接口、数据库、工具执行、重试、人工复核和失败恢复都要记录。多智能体还会增加共享上下文与互相验证。

模型单价低,只能说明其中一个环节便宜。如果任务需要多次重试和大量人工修改,整体仍然很贵。

四层预算分别拦什么

预算层 典型上限 触发后的动作

任务 总金额、总时长、总调用量 停止并交付已有结果

步骤 最大规划步数、重试次数 结束循环或降级方案

工具 单次对象数、并发、写入额度 限流、拒绝或等待批准

人工 复核量、队列长度、处理时长 收缩自动化范围或暂停

高风险任务还要把资金金额、客户数量和业务影响放进动作额度,不能只限制模型 Token。

没有新信息,就不要重复

同一工具持续返回相同错误、计划反复改写、多个智能体输出高度重复,都是预算泄漏信号。

重试前先判断失败类型,查询业务系统真实状态,并确认下一次尝试是否获得了新参数、新证据或新的执行条件。什么都没变,再试一次通常只会多花钱。

低成本能力也要服从质量底线

简单分类、格式转换和规则判断可以使用更低成本方式;复杂推理与高价值任务再升级模型。稳定结果可以缓存,重复上下文可以压缩。

路由策略要用真实任务验证。为了省调用费把高风险任务错分给不合适的能力,后续人工与事故成本会更高。

AI 预算失控很少来自某一次调用太贵,更多来自系统不知道什么时候该停。

本问行动:给一个智能体任务补齐四层上限,并现场触发一次预算超限,看看系统会停止、降级,还是偷偷继续运行。