名词解释 / 07
语音识别
英文名称:Speech Recognition(自动语音识别,Automatic Speech Recognition,缩写 ASR) 常见别名:语音转文字、语音转写、Speech-to-Text 所属分类:进一步了解 AI 原理
一句话解释
语音识别是让计算机把人说的话转成文字的技术。你对着手机说一句,屏幕上就出那句话的字。它只负责"听写",不负责"听懂"——字写对了,不代表机器明白了意思。
工作中什么时候会遇到
最常见的是在线会议:飞书、钉钉、腾讯会议里的"实时转写""字幕""会议纪要"功能,就是把大家说的话变成文字。此外,语音输入法、录音笔的转写、客服电话录音的质检分析,以及能听懂指令的语音助手,背后都用到了它。
这些能力通常已经被封装进办公产品里。你不需要知道技术叫什么,开会时点开"转写"或"字幕",有现成录音就点"录音转文字",就能用上。
能解决什么问题
- 把"听"变成"读":会议、培训、电话结束后马上有一份文字稿,方便搜索、引用和归档,不用靠人脑记。
- 录入比打字快:巡检说明、客户反馈、工作纪要这类内容,口述比敲键盘省时间,也适合双手不空或打字慢的人。
- 留下可回溯的完整记录:口头沟通自动落成文字,事后对得上"当时怎么定的、谁说的什么"。
- 给后续 AI 处理铺路:计算机直接处理声音不方便,通常先转成文字,再由大语言模型或 AI 智能体去总结要点、提取待办、分类客户诉求。
- 让语音内容能被检索和统计:客服录音、销售通话转成文字后,才能按关键词抽查、汇总共性问题,而不是只能一条条重听。
举个例子
一家工业品企业的客服主管,每周要复核一批客户来电录音。以前是挨条回放,手记客户反馈的问题类型,很花时间。现在把录音交给办公软件里的"录音转文字",几分钟拿到一份文字稿,再由智能体按"售后维修、报价咨询、投诉"自动分类,把每通电话的诉求和答复整理成清单。
但客户报的设备型号、批次号这类词,语音识别容易写错。主管对标注为投诉或涉及金额的电话,会回放录音逐条核对型号和数字,确认无误后才转发给技术部门。这一步人工确认不能省。
怎么使用
普通员工基本不需要配置。开会时点"实时转写"或"字幕",文字会边讲边出;有现成录音,就拖进"录音转文字"功能等一会儿拿整篇稿子。手机输入法和办公 App 的语音输入,可以直接"说代替打"。是否让大语言模型接着做总结、提取待办,取决于具体产品有没有这个按钮,那不是语音识别自身的能力。具体功能以当前版本和官方说明为准。
想让公司名、产品型号、行业术语被认得更准,一般要由公司的信息化部门或服务商在后台配置自定义词库、挑选更合适的识别模型,敏感场合还可以做本地部署。普通员工发现某类词总被认错时,反馈给管理员比自己反复改更有效。
使用时要注意什么
识别不是百分之百准。环境嘈杂、语速快、方言口音重,数字、人名、型号、生僻词都容易出错;有的专业词还会被稳定地反复认错,所以涉及金额、交期、规格的关键内容,务必人工核对。另一个容易忽略的风险是二次处理:有些产品会再让大语言模型对文字稿纠错和润色,这一步有可能把原本正确的词也改掉,结果看着通顺其实不准,重要稿子仍要人把关。
录音和会议内容往往涉及业务机密或个人隐私。云端转写服务会把音频上传到服务方处理,使用前要留意公司保密要求和产品说明;敏感场合慎用,或确认有没有本地化方案。
容易混淆的词
- 语音合成(文字转语音):方向相反。语音识别是"人说的话 → 文字",语音合成是"文字 → 机器开口说话",就是导航和智能客服里那个朗读的声音。
- 自然语言理解:识别负责把声音写成字,理解负责明白字里的意思。语音产品往往是识别+理解+回应串在一起工作,容易让人误以为识别出来就等于听懂了。
- 声纹识别:认的是"谁在说话",用来确认说话人身份,而不是"说了什么"。
- 实时翻译(同声传译):在语音识别之上还要把文字翻成另一种语言。会议软件里的"翻译"开关,其实是识别+翻译两段拼出来的。