名词解释 / 06
对抗性攻击
英文名称:Adversarial Attack
常见别名:对抗攻击、对抗样本攻击
所属分类:判断 AI 结果是否可靠
一句话解释
对抗性攻击是指有人故意给 AI 输入经过细微改动的内容,诱导 AI 做出错误判断的做法。这些改动常常小到人眼几乎看不出区别,却足以让 AI 把“对”看成“错”、把“错”看成“对”。它提醒我们:AI 的判断没有看起来那么稳,越是重要的结论,越需要人来把关。
工作中什么时候会遇到
对普通办公员工来说,对抗性攻击更多是“听过”而不是“天天遇到”。它最可能出现在公司把 AI 用于有利益冲突、有人想钻空子的环节,比如 AI 审核报销和补偿申请、AI 筛查可疑付款、AI 识别上传的凭证照片、AI 对投标或招聘材料做初筛。在这些地方,提交材料的一方有动机让 AI 误判。
另一个接触场景是行业新闻和安全通报:AI 被用于反欺诈、图像识别、风控等环节后,模型本身会变成攻击目标。即便你的日常工作不直接涉及,理解这个概念也有助于正确看待“AI 的结果为什么有时会错”。
能解决什么问题
- 解释一类“AI 为什么会错得理直气壮”的原因,避免把 AI 结论当成绝对可靠
- 帮助判断哪些业务环节不能全自动交给 AI 决定,哪些必须保留人工确认点
- 提醒你在核对单据、合同、金额等关键内容时,即使 AI 说“没问题”也值得抽查
- 帮助理解厂商和安全团队为什么要投入模型加固、鲁棒性测试,而不是小题大做
举个例子
一家电商公司的售后部门用 AI 初审客户的补偿申请:AI 读取客户上传的物流面单和商品照片,判断是否符合补偿条件并给出建议金额。有人提交了一套看起来完全正常的图片,但图片被用专门工具叠加了一层人眼几乎察觉不到的干扰,AI 识别后被引导到错误结论,认为“商品破损属实,应补偿 500 元”。
系统预设的确认点是:单笔超过 300 元的补偿必须由客服主管人工复核。主管在对照订单记录和面单信息时,发现收货地址与订单不符,追查后拦下了这笔。这里 AI 负责初筛、人负责关键节点复核,正是对抗性攻击场景下的常见防线。需要说明的是,这类改动需要专门技术刻意构造,并非普通用户随手能做,日常工作中绝大多数 AI 出错并不是对抗性攻击。
怎么使用
普通员工要做的不是去识别或拦截对抗性攻击——这需要专业技术,也无法靠肉眼完成。你能做的是:把 AI 当“助手”而不是“裁判”,在涉及金额、合同、审批等关键环节保留自己的核对动作,对明显反常的 AI 结论多问一句“它凭什么这么判断”。
真正负责防御的一方是 AI 产品厂商和公司的 IT、安全部门。厂商会在模型侧做对抗训练和鲁棒性测试,企业则把高价值场景设置成“AI 初筛 + 人工复核”,并定期评估模型表现。办公 AI 产品(如 WorkBuddy、千问办公等)是否带有相关安全能力,以当前版本和官方说明为准。
使用时要注意什么
要避免两个极端。一是不要把 AI 犯的普通错误都归为对抗性攻击——幻觉、数据偏差、样本不足才是大多数出错的原因,对抗性攻击是其中少见且刻意为之的一种。二是不要因为“改动人眼看不见”就觉得防不住、干脆不设防——人工核对和业务规则仍然能拦住大部分实际风险,设置确认点依然有效。
另一个边界是:对抗性攻击需要攻击者具备一定技术能力并刻意构造,同事之间的日常使用几乎不会触发。理解这个词的价值在于知道 AI 判断存在被欺骗的可能,而不是对每个 AI 结果都草木皆兵。
容易混淆的词
- 提示注入:用一段精心设计的文字指令诱导 AI 做出越权或错误的事,改的是“指令”;对抗性攻击改的是输入内容本身,而且改动往往让人看不出差别。
- 数据投毒:在 AI 训练之前污染训练数据,让模型“学坏”;对抗性攻击发生在模型已训练好并投入使用之后,属于临时诱导。
- AI 幻觉:没有人骗它,模型自己一本正经地编造不存在的依据;对抗性攻击则是有人故意构造输入来误导它。
- 深度伪造:目标是制造以假乱真的图片、音频或视频内容本身;对抗性攻击的目标是让 AI 对某个输入做出错误判断。