名词解释 / 07

非监督学习

第 85 / 127 个名词进一步了解 AI 原理

英文名称:Unsupervised Learning 常见别名:无监督学习、无监督式机器学习 所属分类:进一步了解 AI 原理

一句话解释

非监督学习是让 AI 在没有"正确答案标注"的数据里自己找规律的方法。没有人事先告诉它哪条记录对应什么问题,它只按数据本身的相似程度自动分组,或把少数明显偏离常规的记录挑出来,回答的是"这一堆数据里藏着什么结构"这类问题。

工作中什么时候会遇到

当你在软件里看到"智能分组""异常提醒""客户分群"这类功能时,背后往往就是非监督学习。比如把几千条没有分类的客户反馈自动归成几堆、把报销记录里金额明显异常的挑出来、把一批产品检测数据按相似性分组——这些数据事先没有人逐条标注过"这是哪类问题",只能靠算法自己找规律。普通员工一般不会直接看到"非监督学习"这个名称,只会看到它产出的分组、画像或告警。

这类分析能力正在逐步内置到办公和业务软件中,例如 WorkBuddy、千问办公等产品提供的智能分析功能;是否支持、支持到什么程度,以当前版本和官方说明为准。

能解决什么问题

  • 把从没分类过的数据自动分群,省去大量人工逐条整理的时间。
  • 提前暴露少数异常:设备运行、费用报销、销售数据里偏离常规的记录会被先标出来,供人进一步排查。
  • 帮助发现事先没注意到的结构或关联,比如某类客诉集中在特定区域或时间段。
  • 降低整理和起步成本:机器先粗分,人只负责核对、命名和决定下一步,不必一开始就准备大量人工标注的数据。
  • 为进一步的学习打基础:先靠它摸清数据结构,再挑少量有代表性的记录做标注,供其他方法使用。

举个例子

某公司的售后系统里存着几千条没有分类标签的客户反馈,人工逐条整理成本太高。数据分析人员把这些反馈文本送入非监督聚类,AI 不参考任何"这是质量投诉还是物流投诉"的示例,只按描述像不像自动把它们分成若干组。输出是几堆反馈,每堆附上高频词:一堆总出现"包装破损",另一堆总出现"响应慢"。此时出现人工确认点:售后主管抽查每堆的原始记录,确认它确实对应一个真实问题,再给它命名、定处理优先级;对分得太粗或太碎的组,调整参数后重新分一次。

怎么使用

普通员工不需要自己搭建算法。多数情况下,直接用软件里现成的"智能分组""异常提醒"功能,把数据交给它,把精力放在检查结果是否合理、给分组命名、决定下一步动作上。是否提供这类功能,以当前版本和官方说明为准。

由于非监督学习的结果没有标准答案可以自动验证,通常需要懂数据的人来配置:由数据分析人员或产品供应商的实施工程师选择算法、设定分组数量、调整异常判定阈值,再和业务人员反复确认分组是否有实际意义。业务人员的任务是提供真实数据、解释结果的业务含义,判断"这一组对应的是不是真问题"。

使用时要注意什么

非监督学习只负责"像不像",不负责"对不对"。它从没见过任何标准答案,几乎任何数据它都能强行分成几组,所以分出来的组未必对应真实问题,必须由人来判断含义、命名并决定处理方式,不能照单全收。分几类、多敏感算异常,这些参数都是人设定的,参数不同结果可能差别很大。

还要留意三点:原始数据口径不一致时(比如同一家供应商在不同月份记录名称不同),机器可能把这种记录差异当成"规律";算法标出异常只是提示线索,不等于查明原因,仍需逐条核实;对"无需标注、全自动、零人工"这类宣传要保持警惕,实际落地都离不开人工设定参数和验收结果。

容易混淆的词

  • 监督学习:喂给 AI 的数据带"正确答案"标注(比如一批已标好"合格/不合格"的样品),算法学习从输入推断出结果;非监督学习没有标注,自己找结构。
  • 半监督学习:少量数据带标注、大量数据不带,用少数标签辅助整体分组,介于监督和非监督之间,不是完全没有对错信息。
  • 聚类:把相似的数据自动归组,是非监督学习里最常见的一类任务;但非监督学习不止聚类,还包括异常检测、降维等。
  • 异常检测:专门找出"少数明显不对劲的数据"的任务,常和非监督学习同时出现;它是具体用途,不是非监督学习的全部。

相关名词

机器学习 监督学习 半监督学习 聚类 异常检测

参考来源