第 49 问
企业知识怎样检索才可靠?为什么检索、答案、问数和生成 SQL 不能混成一个指标?
知识问答出错时,团队常直接归因于“大模型幻觉”。故障也可能发生在更前面:没有找到资料,找到了旧版本,用户无权查看,或者把实时数据当成静态知识回答。
检索、证据排序、答案生成、找表问数和任务完成要分层评测。用一个“准确率”包住全链路,团队根本不知道该修哪一层。
五层指标回答五个问题
层级 要回答的问题 典型指标
来源与权限 找的地方对不对,用户能不能看 权威来源覆盖、越权拦截
检索与排序 正确证据有没有被找到并排在前面 召回、相关性、版本命中
答案生成 有没有忠实使用证据 事实一致、引用对应、完整与拒答
数据查询 表、字段、口径和计算是否正确 找表、条件、聚合、查询执行
任务结果 回答有没有帮助业务完成工作 采纳、修改、任务完成和业务结果
一层通过,无法自动证明下一层通过。证据找对了,模型仍可能遗漏条件;答案写得流畅,也可能引用了错误版本。
检索先解决证据在哪里
企业材料包含术语、缩写、编号和精确名称。语义检索适合理解近义问法,关键词检索擅长精确字段,两者可以组合,再通过重排选择证据。
具体方案必须用企业自己的文档、权限和真实问法测试。厂商演示很难代替内部业务分布。
找知识、查数据和执行动作要分开
“本季度的退货政策是什么”可以从有效制度中找答案。“本季度已退款客户数是多少”需要定位正确数据集、字段、时间范围、过滤条件和业务口径。
生成一段语法正确的查询语句,只证明代码能运行。它可能查错表、重复统计、漏掉过滤条件或绕过权限。执行前要做权限和查询限制,执行后还要检查结果范围与异常。
第 51 问会进一步讲静态知识、动态数据和企业工具怎样协作。本篇只负责建立分层评测,先把“找、答、查、做”拆开。
出错时沿链路定位
先看来源与权限,再看召回和排序,然后检查生成是否忠实,接着核对数据查询,最后确认业务任务有没有完成。修复发生在哪一层,回归测试也要覆盖那一层。
知识系统最大的管理误区,是用一个漂亮分数掩盖五种完全不同的失败。
本问行动:拿十条失败记录逐层归因,看看真正的问题集中在没找对、没读懂、查错数,还是任务根本没有完成。