第 83 问
哪些数据可以进入公有模型?哪些必须脱敏、本地化或禁止使用?
“公司数据一律不能上公有模型”过于粗糙,“签了企业合同就都能用”同样危险。真实判断同时取决于数据、用途、供应商处理方式、人员权限和行业要求。
企业要先识别数据与用途,再选择禁止、脱敏、受控公有服务或本地处理。模型部署位置无法代替完整数据治理。
一份文件沿五步判断
第一步,文件里包含什么:公开信息、内部一般数据、商业秘密、个人信息、敏感个人信息、重要数据或受行业特别约束的数据可能混在一起。
第二步,准备做什么:临时生成、检索、评测、微调和训练,对数据的处理深度与保存方式不同。
第三步,谁在处理:具体供应商、部署环境、分包方和人员分别能接触什么,服务是否用于模型改进。
第四步,怎样控制:身份、权限、加密、日志、保存期限、删除和事件处理是否满足当前风险。
第五步,任务是否可以降级:去掉敏感字段、使用模拟数据、只在本地处理,或干脆禁止使用,是否仍能完成目的。
脱敏不是只删姓名
职位、时间、地点、金额和业务细节组合以后,仍可能识别个人或客户。企业既要评估重新识别风险,也要确认脱敏后的材料还有没有任务价值。
本地部署也要继续治理
数据敏感、低延迟、稳定大规模用量或需要深度控制时,可以评估本地处理。权限、日志、模型安全、运维和内部滥用仍然存在。
本地化只能改变部分处理边界,无法自动让数据来源合法、内容准确或使用目的合理。
员工需要能执行的规则
政策应提供常见正反例、获批工具、脱敏方式和报备入口,系统侧再配合敏感数据识别、权限和阻断。只发一张“禁止输入公司数据”的海报,员工遇到真实文件仍然不会判断。
具体结论需要结合现行法律、行业规则、合同和真实数据,由专业人员确认。正式发布前只对涉及的官方规则作定点核查,不用二手材料替代原文。
数据能不能进入模型,要回答谁的数据、为了什么、由谁处理、保存多久,以及失败后谁负责。
本问行动:拿一份员工最常输入的真实文件,沿五步路径走完一次,看看现有规则能否给出明确动作。