名词解释 / 07

半监督学习

第 81 / 127 个名词进一步了解 AI 原理

英文名称:Semi-Supervised Learning 常见别名:半监督训练;SSL 所属分类:进一步了解 AI 原理

一句话解释

介于“全部靠人工标注答案”和“完全不标注”之间的一种训练方法:只用少量已经标好答案的样本打底,再喂入大量没有标答案的历史数据,让 AI 从数据自身的结构里把规律补全,最终学会判断新数据。可以理解成“师傅带几个徒弟入入门,剩下靠他们大量见题自己悟”。

工作中什么时候会遇到

普通员工很少直接操作它,更多是在公司上 AI 项目时间接遇到。当对方说“不用标几万条,标几百条就能起步”,或者“你们仓库里存了很多年、从没标过类的数据,我们能直接用起来”,背后往往就是半监督学习。给客服记录分类、给设备报修判断故障类型、给供应商或订单做风险评估这类场景很典型:真正标好答案的样本金贵,没标过的历史数据却堆了一大堆。

判断方法很简单:方案里同时提到“少量已标注样本”和“大量未标注数据”,用的多半就是这项技术。

能解决什么问题

  • 大幅减少人工标注量:过去要业务专家逐条标几千、上万条数据,现在标几百条有代表性的就能起步。
  • 盘活沉睡的存量数据:工单、聊天记录、设备日志、历史报价单大多没标过类,过去基本派不上用场,现在能用来训练。
  • 应对新系统冷启动:系统刚上线还没有答案积累,少量样本就能先跑起来,再随使用逐步变准。
  • 处理“异常本来就少”的问题:设备故障、质量缺陷、异常订单这类多数正常、少数异常的情况,正好适合。
  • 降低立项门槛:一些过去因为标注成本太高而搁置的 AI 应用,变得值得做。

举个例子

一家工厂想把多年积累的报修记录自动归为“机械故障、电气故障、操作不当、耗材更换”几类,好按设备和产线统计哪类问题最花钱。系统里有几万条报修记录,但从没归过类,按老办法让老师傅逐条读,成本太高,一直拖着没做。

改用半监督学习后:设备主管带两三位老维修工,先按统一口径手工标出约 400 条,尽量覆盖常见故障和容易混淆的边界情况。系统先拿这 400 条学习规律,再去比对剩下几万条没标过的记录:与已标记录高度相似的,自动归入对应类型;拿不准的单独挑出来生成“待确认清单”,交回给人判断。人处理完清单、纠正明显归错的,系统再学一轮,准确率明显更稳。

这里有一个关键的人工确认点:系统对自己很有把握的自动归类,会被当成“正确答案”继续教自己。如果这类样本里混着归错的,错误会被放大,所以清单需要抽查,不能全信。

怎么使用

普通员工主要做三件事。一是认真完成那少量标注:这批样本是整个系统的地基,标偏了全盘偏。二是定期抽查系统新学进去的样本,发现归错及时纠正。三是遇到实在拿不准的,标“存疑”,不要硬猜混进标准答案。

模型训练、阈值设定通常由算法工程师或提供 AI 系统的服务商配置,普通员工不需要懂技术细节。不同产品里“标注”“抽检”“确认清单”的入口和叫法不一样,以当前版本和官方说明为准。

使用时要注意什么

最大的误区是把“省标注”理解成“标注不重要”。恰恰相反,半监督学习里那少量标注是唯一的确定性来源,一旦标歪,AI 会把错误规律扩散到几万条数据上,出错是成片出错。所以动手前要先统一标注口径,关键类别最好双人核对。

另一个风险是错误自我放大:模型把自己判断错但很自信的样本当成新教材,越学越偏。因此系统上线后仍要保留人工抽检,尤其盯住它新学的内容,不能因为前期表现好就长期不管。也要有合理预期:在类别多、边界模糊的任务上,省标注是有代价的,效果未必追得上足量优质标注。听到“只要少量标注就能达到很高准确率”的说法,要追问是在你们自己的数据上验证过,还是拿通用演示数字来说事。

容易混淆的词

监督学习:每条训练数据都要人工先标好答案,结果可靠但成本高;半监督学习只标一小部分,靠大量未标数据补位。 无监督学习:完全不用标注,纯靠数据自己找相似和差异,但它分出来的“类”未必是你业务上关心的类;半监督学习用那少量标注把方向定住。 自监督学习:让 AI 自己从数据里造“临时考题”来学(比如遮住一句话猜被遮住的词),不需要人工标注;原理和半监督学习不同,却常被混为一谈。 主动学习:反过来由模型“提问”,专门挑它最拿不准的样本请人来标注,常和半监督学习搭配使用,但侧重解决的问题不一样。

相关名词

机器学习 · 监督学习 · 无监督学习 · 数据标注 · 训练数据 · 深度学习

参考来源