Whisper 语音模型

Whisper

把说的话变成文字,中文、英文各种语言都行,还开了源可以自己用。

人工智能与模型出现时间 · 2022开源版免费自部署;平台语音接口则按音频时长计费。语音识别语音转文字多语言开源模型
看官方文档

01 它是干嘛的

Whisper 是一个语音转文字(识别)模型:把音频变成带标点的文字。它的特别之处是训练数据极其庞大、覆盖多种语言,并且把模型权重开放出来,谁都能下载自己部署,不必联网调用、不必按分钟付费。

02 为什么会有它

把录音变成文字,过去要花钱请人一句句听

在语音识别够用之前,处理录音只有两条路:要么请人一句句听、一句句敲,一场两小时的会议笔录要花大半天;要么用老式语音识别软件,但它像耳朵不太灵光的人,口音重、语速快、背景有杂音就错得离谱,说完还得逐字校对,等于没省多少事。

传统语音识别的做法是「分而治之」:先处理噪音,再切音、认音素、拼词、纠错,每一步都是单独调的模块,任何一步出错后面全塌,而且每加一种语言都要重新做一遍。

Whisper 换了个思路:用海量「音频 + 对应文字」的数据训练一个统一的大模型,直接端到端地把音频转成文字。因为见过几十种语言和大量嘈杂录音,它在口音、背景音、专业词汇上明显更稳,还能顺手断句加标点,甚至做翻译。更关键的是它开源,谁都可以下载、离线使用、按自己需求改造。

03 它怎么工作

声音本质上是一串随时间变化的波形,模型把它切成很多小段,一帧帧转成文字,再结合上下文把结果连成通顺的句子。

语音助手:从「你说话」到「它说话」的五段流水线只把唤醒后的片段送上去结果交给合成麦克风持续收音唤醒词检测在本机完成,不上传语音转文字把声音变成文本意图理解「开灯」= 执行设备指令执行动作调用设备或服务语音合成把回复文字说成话扬声器你听到的回应唤醒词检测必须跑在本地:否则麦克风听到的一切都要上传,既费电又没有隐私可言。识别核心本地 / 设备动作
顺着「音频 → 切段 → 特征 → 文字 → 拼接标点」看下来,注意上下文是贯穿各段的:模型不是孤立地认每一段,而是带着前面说过的话去判断这一段,所以长句和专有名词更准。

一段录音是怎么变成带标点文字的

  1. 1
    ① 重采样

    不管原始音频是什么格式、什么采样率,先统一转成模型要求的规格。

  2. 2
    ② 切成小窗

    把长长的音频切成一段段固定长度的小片段,逐段处理。

  3. 3
    ③ 声学特征提取

    把每段声音转换成一串「声音特征」,相当于把波形翻译成模型能理解的形式。

  4. 4
    ④ 逐段转文字

    模型根据声学特征预测出对应的文字内容,同时参考前面已识别的上下文,避免前后矛盾。

  5. 5
    ⑤ 拼接并加标点

    把各段结果连起来,补上标点、处理断句、识别语言,输出一段可读的文字。

04 谁在用它

会议与访谈纪要

把录音转成文字底稿,再让人整理,比全程听音快得多。

字幕制作

给视频生成字幕初稿,省去逐句打字、校对的大部分工作。

播客与课程转文字

把长篇音频整理成可搜索、可阅读的文字稿。

多语言场景

用同一套模型处理不同语言的录音,做跨语言的内容整理。

离线与隐私敏感场景

自己部署在本地机器上,录音不出内网,适合医疗、法务等场景。

05 怎么用

会一点命令行就能用;不想折腾的可以直接用平台提供的语音转文字接口,开源版还能完全离线运行。

  1. 01先选择方式:想省事就用平台 API,想离线免费就用开源版本。
  2. 02开源版先安装运行环境与依赖库(官方仓库有详细说明)。
  3. 03根据机器性能选模型大小,越大越准也越慢、越吃内存。
  4. 04执行识别命令,指定音频文件路径和语言。
  5. 05检查输出文字:人名、专业词、数字常会有偏差,重点核对这几类。
用开源 Whisper 转写一段录音bash
# 安装官方实现(需要 Python 环境)
pip install -U openai-whisper

# 把录音转成文字,指定语言为中文
whisper meeting.mp3 --model medium --language Chinese

# 顺带生成字幕文件(srt),方便直接挂到视频上
whisper lecture.wav --model medium --language Chinese --output_format srt

避坑提示

  • !模型越大越准但越慢、越吃内存,从 medium 起步通常就够用。
  • !音质决定上限:嘈杂录音再强的模型也吃力,录音时尽量安静、话筒靠近。
  • !人名、机构名、专业术语、数字最容易出错,转完重点核对这几处。
  • !长时间音频会占用较多内存和时间,长录音可以切成小段分批处理。

06 关键概念

语音识别(ASR)
把说的话自动转成文字的技术。
声学特征
从声音波形里提取出的一串数字,是模型认识声音的原料。
开源模型
模型参数公开可下载,任何人都能自己部署使用,不必联网付费。
端到端
不再把识别拆成一堆小步骤,而是一个模型直接从音频出文字。

07 容易混淆的对比

商业云语音识别服务开箱即用、稳定性强,但按分钟计费、数据要上传云端。
其他开源语音模型有的主打实时流式识别、有的主打低功耗设备,选型要看具体场景。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态