名词解释 / 07
量化
英文名称:Quantization 常见别名:模型量化、量化压缩;本地下载开源模型时常见的“4 位模型”“Q4 版本”“Q4_K_M”等名字,指的就是量化 所属分类:进一步了解 AI 原理
一句话解释
量化是对已经训练好的 AI 模型做“瘦身”:模型里存放着海量用于判断的高精度数字(参数),量化把这些数字换成位数更少的存法,让模型文件更小、占内存更少、跑得更快。它不需要重新训练,只是把学好的内容换个更省空间的记法,代价是一点点精度损失——就像把圆周率记成 3.14,买菜算账完全够用,只有算火箭轨道才需要更精确的数字。
工作中什么时候会遇到
大多数时候你感知不到量化,它发生在后台。使用千问办公这类云端办公 AI 时,模型版本和压缩方案已经由厂商处理好,你不需要关心。比较可能在两个地方遇到:
一是公司出于数据合规考虑,把 AI 部署在内网或本地电脑上,要求数据不出公司。由于普通电脑的内存和显卡远不如云端机房,负责部署的同事通常会选量化过的较小版本,才能跑得动。这时你可能会发现,公司内网的 AI 写周报、做摘要没问题,但复杂分析能力不如云端版本。二是用 WorkBuddy 等工具在本地运行开源模型时,下载页面会出现同一个模型的多个版本,体积从十几 GB 到几 GB 不等,那通常就是量化程度不同的结果,标识常见为 Q4_K_M 之类。
能解决什么问题
- 让模型装得进内存有限的普通电脑或公司服务器,不必为跑 AI 专门购买昂贵的高配显卡或专用设备。
- 显著缩小模型文件和运行时的内存占用,量化到 4 位左右,体积大约能压到原来的四分之一。
- 每次运算要读取的数据变少,出结果更快;公司大规模使用时,对应的算力和电费成本也更低。
- 让公司能用内网部署的方式使用 AI,数据不出公司,满足保密和合规要求。
- 对写、改、翻译、总结等多数日常办公任务,压缩前后的差别几乎感知不到,等于用很小的代价换来“跑得起来”。
举个例子
一家企业的客服部门想用 AI 分析过去一年的客户投诉记录,但公司规定这些数据不能上传到云端。IT 同事在一台内存 8–16 GB 的普通办公电脑上部署本地模型,并选择了 4 位量化版本,模型文件从十几 GB 缩小到约 3–4 GB,这台电脑才带得动(具体体积随模型版本变化,以当前版本和官方说明为准)。
实际使用时,把整理好的投诉记录表格输入模型,让它按问题类型归类、起草初步回复、生成每周小结,输出和云端版本差别不大。但当员工追问“三季度哪几类问题投诉集中上升、和哪家供应商有关”这类需要跨多张表关联推理的复杂问题时,回答开始出现遗漏或牵强。员工于是约定:日常分类和摘要交给本地模型,深挖原因的复杂分析先把数据脱敏再交给云端复核,涉及对外的结论必须由人确认后才能发布。
怎么使用
对普通员工来说,量化基本不需要主动操作。用云端办公 AI 时,界面里“选择模型版本”背后可能就有量化的影响,但厂商已经把细节处理好,你正常使用即可。真正需要知道的是:当公司内网的 AI 偶尔显得“不够聪明”时,多半是本地部署方案的取舍,而不是你操作错了,不必反复重试或怀疑输入格式。
量化版本通常由 IT 或负责部署的人挑选:根据服务器或电脑的内存、显卡情况,在“跑得动”和“效果够好”之间选择合适的精度。如果你自己用 WorkBuddy 等本地工具下载开源模型,可以优先选标有 4 位量化(常见标识如 Q4_K_M)的版本,它通常是体积与效果的均衡选择;不同工具的命名方式不同,以当前版本和官方说明为准。
使用时要注意什么
量化是用精度换体积和速度,不是免费的:压缩越狠,复杂的数学推理和长链条逻辑判断退化越明显,所以“压得越低越好”是误区。反过来也不必担心它把模型“压傻”,对写作、翻译、摘要这类日常任务,多数量化版本与原始版本的差别很小。选择到什么程度,本质是“设备能不能跑动”和“任务够不够聪明”之间的取舍,不是量化本身好不好。
还要注意,量化只改变模型的体积和运行速度,不扩大它的知识范围,不解决幻觉(一本正经地编造内容)问题,更不决定数据是否安全。数据是否合规,取决于它存放在哪里、谁有权限访问,与是否量化无关。另外,不要拿某个量化版本的表现去评价模型的真实水平,不同厂商、不同版本之间的差距,常常比量化带来的差别更大。
容易混淆的词
- 参数:参数是模型内部数量庞大的数值,决定模型的能力上限。量化只是改变这些数值的存储精度,参数数量并没有变化。
- 蒸馏:蒸馏是让一个小模型去模仿大模型的行为,相当于重新训练出一个结构不同的新模型;量化不做任何训练,只是把同一个模型换成更省空间的存法。两者都能让模型变小,原理不同。
- 文件压缩(ZIP 等):压缩文档、图片追求尽量无损地还原内容;量化是有损的,损失一定精度是被接受的代价,用来换取更大的小型化和更快的速度。
- 模型压缩:这是一个更大的总称,量化只是其中的一种手段,蒸馏、剪枝等也算模型压缩。看到“模型压缩”时,要区分具体用的是哪种方法。