第 40 问
AI 评测为什么既要测试“应该行动”,也要测试拒答、等待确认和“不应该行动”?
第 40 / 100 问试点、评测、验收与失败退出
企业评测 AI 时,通常给它一批任务,看完成了多少。系统越主动、回答越完整、自动化率越高,似乎越优秀。
生产事故却经常来自 AI 在不该行动时采取了行动。
可靠 AI 既要证明自己会完成任务,也要证明在证据不足、权限不足、风险过高和状态未知时能够停止。拒答与转人工本身也要验收。
六类样本的正确答案就是停下来
样本类型 正确行为
身份无法确认 不读取敏感信息,不执行动作
关键参数缺失 说明缺项并补问
来源冲突 展示冲突,等待责任人裁决
超出权限或范围 拒绝并说明可用边界
工具结果未知 查询状态,不能直接重复执行
高风险或不可逆动作 等待授权、转人工或进入安全联锁
这些样本要和正常任务一样进入评测集,不能只在制度里写一句“必要时转人工”。
拒答也有质量差异
好的拒答说明缺少什么、怎样补齐、应该交给谁,并保留已经完成的有效工作。糟糕的拒答只说“无法处理”,把任务从头推回用户。
评测要看拒答是否准确、是否过度保守、有没有泄露敏感信息,以及交接后任务能否继续。
自动化率不能绑架安全行为
团队只考核自动完成比例,系统会倾向少转人工,员工也会把停止看成失败。指标中应加入严重错误、合理拒答、异常发现和接管成功。
用户还可能要求 AI 忽略规则、冒充身份或绕过审批。权限必须来自可信系统,工具调用前由程序校验,安全边界不能依赖模型“自觉”。
智能上限体现在它能完成多少事,可靠底线体现在它知道哪些事绝不能做。
本问行动:给评测集加入六类停止样本,检查系统会不会为了完成率强行行动。