名词解释 / 07

Transformer

第 125 / 127 个名词进一步了解 AI 原理

英文名称:Transformer 常见别名:Transformer 架构、注意力模型架构(日常讨论中有时被笼统称作“大模型的技术底座”) 所属分类:进一步了解 AI 原理

一句话解释

Transformer 是 2017 年提出的一种 AI 模型结构,如今绝大多数对话、写作、总结、翻译类 AI 都以它为底座。它的核心思路叫“注意力机制”:处理一段内容时不按顺序逐字硬记,而是把整段内容同时纳入考量,自己判断哪些部分彼此关联最紧、哪些信息更重要,再据此生成回答。

工作中什么时候会遇到

你在 WorkBuddy、千问办公里让 AI 总结会议纪要、从几十页合同里挑条款、把一周的客户反馈整理成报告时,背后干活的模型基本都是 Transformer 架构。你通常不会在界面上看到这个词,但它决定了 AI 能做到“看完整篇再回答”,而不是像更早的模型那样必须一句句顺着读。

如果公司 IT 或产品供应商提到“接入了大模型”“换了新架构”,指的通常也是这一类。这个词更多出现在产品说明、技术培训和对外介绍里,日常操作中基本接触不到。

能解决什么问题

  • 让 AI 同时看到较长的一段内容,理解前后文,而不是只盯着相邻几句话。
  • 找出相隔很远的信息之间的关系,例如合同开头的定义和后面某页的条款其实是同一件事。
  • 因为可以大规模并行训练,模型才有条件“读”海量资料,这是今天 AI 知识面广的基础。
  • 帮模型在大段内容里分出轻重:哪些是关键信息,哪些是客套话或无关内容。
  • 同一结构经过专门改造,也能处理文字以外的数据,例如把设备振动信号用于故障诊断研究(机械行业已有相关应用)。对普通使用者来说,这意味着 AI 不只是文字工具。

举个例子

采购或行政同事把一份几十页的框架合同发给 AI,问:“把付款节点、质保期和违约条款整理成一张对照表。”Transformer 架构的模型不是一页页搜索关键词,而是通读全文,把分散在不同章节、说法也不一致的条款对应起来再输出表格。需要人工确认的点:它可能漏掉用了不常见说法的条款,也可能把含义相近但并非同一件事的内容误并到一起,最终表格要对着原文核一遍再使用。

怎么使用

普通员工不需要配置任何东西,也不用理解技术细节。模型由产品方部署和维护,你只需要把资料给完整、把问题问清楚即可。具体能处理多长的文档、支持哪些格式,以当前版本和官方说明为准。

如果企业想拿自己的数据单独训练或微调一个专用模型(比如针对自家设备的诊断模型),那是算法工程师或供应商的工作,普通员工通常只负责提供业务判断和数据范围。这类自建模型在日常办公产品中并不常见,遇到时由企业技术方主导。

使用时要注意什么

Transformer 是 AI 的骨架之一,不等于智能本身。它擅长从已有资料里找规律和相关性,但不理解因果关系,对资料里没有的信息也可能一本正经地编造,重要结论必须核对原始依据。模型单次能处理的内容有长度上限,几十页以上的材料往往需要分段提问,不是贴得越多越好。

另外要留意媒体表述的夸张。例如网上流传的“Transformer 亲爹”其实是八位共同作者中的一位;“当前路线陷入死胡同”“微调纯属浪费时间”是他个人的前沿观点,不是定论,说“AI 已到尽头”更是不准确的引申。研究者对“Transformer 是否会被新架构取代”确有争论,但这属于前沿讨论,对普通使用者影响很小。判断一个 AI 工具好不好用,看实际输出即可,不必追逐架构概念。

容易混淆的词

  • 大语言模型(LLM):Transformer 是模型的结构图纸,大语言模型是“用海量文本训练出来、能对话写作的成品”。绝大多数大语言模型基于 Transformer,但不能直接划等号,类似发动机图纸和整车的关系。
  • 千问、WorkBuddy、ChatGPT 等产品:这些是用户直接使用的软件和品牌,Transformer 只是它们背后多种技术中的一种。你在用的是产品,不是直接“用 Transformer”。
  • 注意力机制:它是 Transformer 内部最关键的部件,让模型懂得“该关注什么”,但整个架构还有其他组成部分,两者不是一回事。
  • 深度学习、神经网络:Transformer 是神经网络大家族里的一种具体结构,范围上神经网络更大、Transformer 更具体。

相关名词

人工智能机器学习深度学习神经网络大语言模型

参考来源