第 43 问

企业 AI 的数据问题究竟是什么?系统口径冲突时 AI 应该听谁的?

第 43 / 100 问数据、知识库与企业事实基础

AI 项目效果不好,最常见的解释是“数据质量不行”。这句话太宽,几乎无法指导任何行动。

数据可能不准、不全、过时、不代表当前业务,也可能根本不允许用于这个目的。不同系统还会对同一个经营状态给出不同答案。

企业要把数据问题拆开诊断。系统口径冲突时,AI 可以展示差异,裁决权必须留给被授权的数据责任人。

七类问题,对应七种处理方式

问题 诊断问题 主要处理动作

来源 这条数据从哪里来,能否追溯 建立来源与采集记录

口径 同一指标在不同系统是否同义 定义业务口径与权威系统

完整性 关键字段和业务阶段是否缺失 补采、拒绝或转人工

代表性 样本是否覆盖真实用户、异常和变化 重采样并补难例

时效 多久更新,旧版本何时失效 设置刷新与失效规则

授权 能否用于训练、检索、评测或决策 限定目的、身份和权限

反馈 线上错误和人工修改能否回流 建立纠错与版本更新闭环

这七类问题需要不同负责人。用“再清洗一遍”同时处理它们,往往只能改善表面格式。

三个系统给出三个答案,可能都没错

销售系统说客户已经成交,财务系统说款项未到,项目系统说尚未交付。它们描述的是销售、回款和交付三个阶段,不能被 AI 压成一个模糊的“客户状态”。

企业要为关键实体和指标写清业务含义、权威来源、更新时间、适用场景和责任人。回答时展示口径与时间;来源冲突且无法自动裁决,就并列差异并转给责任人。

第 47 问会讨论企业知识由谁确认和更新。本篇聚焦的是数据事实及指标口径,尤其是系统之间的冲突如何处理。

数据准确,也可能不适用

历史数据可以准确记录过去,却不代表今天的客户、政策和流程。允许用于内部检索,也不等于允许拿去训练、对外展示或自动决策。

所以数据质量不能脱离用途评价。同一批数据面对内部摘要和资金审批,会有完全不同的门槛。

从业务决定反推最小数据

先问 AI 要支持什么决定、需要哪些事实、错误会带来什么后果,再确定最小数据范围和质量要求。这样团队能知道当前项目具体缺什么,也能避免用全量数据治理掩盖责任问题。

企业 AI 的数据基础,最终要让每一个关键判断都说得清依据来自哪里、什么时候有效、由谁负责。

本问行动:拿一个最常争议的经营数字,补齐它的口径、权威系统、更新时间和裁决人。