名词解释 / 06

Benchmark(基准测试)

第 78 / 127 个名词判断 AI 结果是否可靠

英文名称:Benchmark 常见别名:基准、基准评测、跑分、模型榜单测试 所属分类:判断 AI 结果是否可靠

一句话解释

固定一批「标准答案已知」的题目和验收标准,用同一套题去反复考不同的 AI 工具、提示词或配置,用得分来判断谁更可靠。就像同一张试卷发给不同考生,成绩才有可比性。

工作中什么时候会遇到

多数人第一次遇到它,是在要选 AI 产品的时候。厂商说自家模型「排行榜第一」「准确率 99%」,同事推荐用 WorkBuddy 而不是现在用的千问办公——这些说法靠不靠谱,就需要一套题来验证。

另一些时候是公司准备把重复性事务交给 AI。比如要上一个数字员工(AI 智能体)来处理报销审核或客户投诉回复,正式放开前通常会先拿一批旧任务摸底,看它到底能做对几成。这套摸底用的「固定考题」,就是 Benchmark。

能解决什么问题

  • 在同类 AI 产品、或同一产品的不同配置之间做横向对比,选型有依据,不靠感觉和宣传。
  • 识别夸大宣传:口头说得多好都不算,同一套题跑一遍,得分见分晓。
  • 上线前摸清 AI 的真实水平,避免一个错误被批量复制到成百上千份文件里。
  • 改完提示词或换了模型后,判断效果是真变好还是「感觉变好」,用前后得分说话。
  • 留下一套可以复现的测试记录,以后换人、换版本、供应商更新,都能再考一遍对比。

举个例子

售后客服主管小林想挑一个 AI 帮忙起草客户投诉的回复草稿。供应商 A 宣称自己「行业第一」,但她没有直接信。

她把过去三个月 30 条真实的投诉工单收起来,连同对应的标准回复一起作为考题——标准答案已知,同时定好验收尺子:赔偿金额、退换货时限这类事实,必须和订单、物流记录一致,查不到来源不许写。然后让供应商 A 的产品和公司正在用的千问办公各写一遍,题目完全相同。

结果:A 在赔偿金额和时限上错了 5 条,千问办公错了 2 条。小林又抽查了 AI 标注为「正确」的几条,确认判分没问题。最终她没有选 A,并把 30 道题和判分结果存档,作为这次选型的依据。这一整套动作就是一个简单的 Benchmark。

怎么使用

普通员工完全做得了轻量版:从自己真实工作里收集 10–20 个「有标准答案」的样本,比如历史工单配标准回复、核对过数字的旧报表,再写清楚每条怎么算对,让不同工具各做一遍,按「通过/需修改/出错」逐条记录、对比。难点不在技术,而在贡献真实题目和把关「什么叫对」,这两件事只有懂业务的人能做。

如果公司要正式测评后上线 AI,标准考题集和评分口径通常由信息部门或懂技术的人搭建,属于公司级配置。产品能力变化较快,具体功能和效果以当前版本和官方说明为准。

使用时要注意什么

Benchmark 只考卷面上有的题:题库覆盖不到的业务场景,它考不出差距,所以分高不等于到了你的场景里一定可靠。公开的模型排行榜用的是别人出的题,和你实际干的工作不是一回事,而且这些题有可能被提前「刷」过——业内就出现过题目有漏洞、让「什么都不做」的 AI 也能拿高分的基准,说明卷子本身也需要被怀疑。此外,考题集要定期更新并注意保密,避免答案早已混进 AI 的训练数据;每次测试结果要留痕,才能复盘。

容易混淆的词

  • Eval(评估):拿验收尺子去查某一次的具体输出「合不合格」;Benchmark 则是把同一套题反复考不同对象来横向比较。前者查一次作业,后者组织一场统考。
  • 完成标准(Completion Criteria):提前定好的「怎么算对」的尺子本身,是出题的依据;Benchmark 是「固定题目+固定尺子」这套完整考试制度。
  • 模型排行榜:排行榜是别人用公开 Benchmark 跑完的分数汇总,可直接看,但题目未必贴合你的工作;自己搭的 Benchmark 才针对你的真实场景。
  • 验收(Acceptance):确认某个 AI 交付的结果是否满足你这一次任务的要求,是对单个交付物的把关;Benchmark 是长期、重复、可对比的测评,用来支持验收标准的制定。

相关名词

AI 幻觉(Hallucination) 完成标准(Completion Criteria) Trace(过程追踪) AI 智能体(Agent)

参考来源