01 它是干嘛的
Whisper 是一个语音转文字(识别)模型:把音频变成带标点的文字。它的特别之处是训练数据极其庞大、覆盖多种语言,并且把模型权重开放出来,谁都能下载自己部署,不必联网调用、不必按分钟付费。
02 为什么会有它
把录音变成文字,过去要花钱请人一句句听
在语音识别够用之前,处理录音只有两条路:要么请人一句句听、一句句敲,一场两小时的会议笔录要花大半天;要么用老式语音识别软件,但它像耳朵不太灵光的人,口音重、语速快、背景有杂音就错得离谱,说完还得逐字校对,等于没省多少事。
传统语音识别的做法是「分而治之」:先处理噪音,再切音、认音素、拼词、纠错,每一步都是单独调的模块,任何一步出错后面全塌,而且每加一种语言都要重新做一遍。
Whisper 换了个思路:用海量「音频 + 对应文字」的数据训练一个统一的大模型,直接端到端地把音频转成文字。因为见过几十种语言和大量嘈杂录音,它在口音、背景音、专业词汇上明显更稳,还能顺手断句加标点,甚至做翻译。更关键的是它开源,谁都可以下载、离线使用、按自己需求改造。
03 它怎么工作
声音本质上是一串随时间变化的波形,模型把它切成很多小段,一帧帧转成文字,再结合上下文把结果连成通顺的句子。
一段录音是怎么变成带标点文字的
- 1① 重采样
不管原始音频是什么格式、什么采样率,先统一转成模型要求的规格。
- 2② 切成小窗
把长长的音频切成一段段固定长度的小片段,逐段处理。
- 3③ 声学特征提取
把每段声音转换成一串「声音特征」,相当于把波形翻译成模型能理解的形式。
- 4④ 逐段转文字
模型根据声学特征预测出对应的文字内容,同时参考前面已识别的上下文,避免前后矛盾。
- 5⑤ 拼接并加标点
把各段结果连起来,补上标点、处理断句、识别语言,输出一段可读的文字。
04 谁在用它
把录音转成文字底稿,再让人整理,比全程听音快得多。
给视频生成字幕初稿,省去逐句打字、校对的大部分工作。
把长篇音频整理成可搜索、可阅读的文字稿。
用同一套模型处理不同语言的录音,做跨语言的内容整理。
自己部署在本地机器上,录音不出内网,适合医疗、法务等场景。
05 怎么用
会一点命令行就能用;不想折腾的可以直接用平台提供的语音转文字接口,开源版还能完全离线运行。
- 01先选择方式:想省事就用平台 API,想离线免费就用开源版本。
- 02开源版先安装运行环境与依赖库(官方仓库有详细说明)。
- 03根据机器性能选模型大小,越大越准也越慢、越吃内存。
- 04执行识别命令,指定音频文件路径和语言。
- 05检查输出文字:人名、专业词、数字常会有偏差,重点核对这几类。
# 安装官方实现(需要 Python 环境)
pip install -U openai-whisper
# 把录音转成文字,指定语言为中文
whisper meeting.mp3 --model medium --language Chinese
# 顺带生成字幕文件(srt),方便直接挂到视频上
whisper lecture.wav --model medium --language Chinese --output_format srt避坑提示
- !模型越大越准但越慢、越吃内存,从 medium 起步通常就够用。
- !音质决定上限:嘈杂录音再强的模型也吃力,录音时尽量安静、话筒靠近。
- !人名、机构名、专业术语、数字最容易出错,转完重点核对这几处。
- !长时间音频会占用较多内存和时间,长录音可以切成小段分批处理。
06 关键概念
- 语音识别(ASR)
- 把说的话自动转成文字的技术。
- 声学特征
- 从声音波形里提取出的一串数字,是模型认识声音的原料。
- 开源模型
- 模型参数公开可下载,任何人都能自己部署使用,不必联网付费。
- 端到端
- 不再把识别拆成一堆小步骤,而是一个模型直接从音频出文字。