第 45 问
企业 AI 的数据血缘和知识引用,应该追溯到什么程度?
第 45 / 100 问数据、知识库与企业事实基础
有人希望 AI 每句话都附来源,也有人认为记录太多会拖慢系统。结果需要解释,追溯本身也有成本和敏感信息风险。
追溯深度要根据结果风险、纠错需求和责任要求分层。关键事实必须回到原始来源与版本,普通低风险生成可以保留较轻证据。
三种风险使用三种粒度
风险 典型任务 最低追溯要求
低 内部创意、格式调整、临时草稿 使用的资料集合、应用与生成时间
中 制度问答、产品说明、经营分析 原文位置、版本、适用范围、查询口
径和人工修改
高 资金、合同、客户权益、医疗、安全 原始数据、加工链、规则、身份、批
和设备动作 准、工具调用和最终状态
同一应用可以按任务分层,不需要把所有输出都提升到最高记录标准。
血缘要覆盖数据怎样变化
知道原始文件名还不够。数据可能经过清洗、字段映射、聚合、人工修改和模型抽取。企业要能解释最终字段从哪里来,使用什么规则,在哪一步发生变化。
自动执行还要连接业务工具和系统返回。AI 说“已经提交”,不能替代订单、工单或设备的真实状态。
有引用也可能答错
引用只证明系统找到了某段材料,无法证明它权威、最新或适用于当前用户。知识所有者、有效期、权限和冲突处理仍然必须存在。
来源互相矛盾时,AI 应展示差异并升级裁决,不能挑一条最像答案的内容。
追溯数据本身需要治理
日志和版本可能含有客户信息、商业秘密和员工行为。企业要限制访问、设置保存与删除规则,并避免为了追溯无限记录无关内容。
可追溯的目标,是让关键结论经得起四个追问:依据是什么、当时有效吗、谁确认、怎样影响了动作。
本问行动:给三类真实任务各定一档追溯粒度,别让所有场景使用同一套日志要求。