OpenAI 的 Whisper Large-v3 Turbo 将解码器从 32 层裁剪到 4 层,参数量从 15.5 亿降至 8.09 亿。在我们的 Apple Silicon 测试中,它处理同一段音频约快 5 倍,词错率几乎不变。Whisper Notes 在 Mac 上搭载此模型——Mac App Store 版和官网下载版(DMG)都有——iPhone 版则有意不提供它,改用体积更合身的模型。
V3 Turbo vs V3:改了什么
Turbo 不是新架构。它就是 Whisper Large-v3,解码器从 32 层剪枝到 4 层,然后微调恢复精度。编码器完全不变。
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| 参数量 | 809M | 1,550M |
| 解码器层数 | 4 | 32 |
| 语言数 | 100+ | 100+ |
| 翻译任务 | 不支持 | 支持 |
| 开源协议 | MIT | Apache 2.0 |
Turbo 的训练数据明确排除了翻译任务。完整版 Large-v3 支持翻译,但 Whisper Notes 搭载的是 Turbo 而不是完整版 Large-v3——翻译在 Mac 上通过 Apple Intelligence 单独实现。
基础模型:Whisper Large V3 是什么?
Whisper Large V3 是 OpenAI 在 2023 年发布的开源语音识别模型,参数量 15.5 亿,使用 128 个 mel 频带,并在约 500 万小时音频上训练。官方模型卡列出 100+ 种语言,并把模型许可标为 Apache 2.0。想把它和其他设备端模型一起比较,可查看本地语音模型对比。
速度基准:Whisper Notes 在 Apple Silicon 上的表现
在 Mac 版 Whisper Notes 中,Turbo 通过 CoreML 在 Neural Engine 上运行。处理 10 分钟音频:
| 设备 | Whisper V3 | V3 Turbo | 提速 |
|---|---|---|---|
| iPhone 15 Pro | 425 秒 | 82 秒 | 5.2× |
| iPad Pro M2 | 380 秒 | 71 秒 | 5.4× |
| MacBook Pro M2 | 316 秒 | 63 秒 | 5.0× |
测试方法:在每台表中设备上,用同一版 Whisper Notes 转写同一个 10 分钟音频文件。从点击开始到最终文本完成计墙钟时间;V3 与 Turbo 之间只更换模型。
5 倍提速是 Whisper Notes 在 Apple Silicon 上的实测结果,较小的解码器在 Neural Engine 上优化效果更好。在 GPU 上使用 faster-whisper 等框架时,差距缩小到约 2.7 倍(见下方社区基准测试)。
关于表中 iPhone 和 iPad 两行需要澄清一点:那是在这些硬件上对模型本身的评测,不是 iPhone 版实际提供的模型清单。iPhone 版 Whisper Notes 不提供 Large V3 Turbo——这是有意的选择,原因见下文的分设备对照表。
精度对比:WER 词错率
Hugging Face Open ASR 排行榜在相同的英文数据集上测试了两个模型。Turbo 的词错率在每个基准上都与 V3 相差不到 0.5 个百分点:
| 数据集 | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| 平均 WER | 7.83% | 7.44% |
V3 在每个数据集上都略微更准,但差距很小——平均仅 0.39 个百分点。在实际使用中,基本感受不到区别。
在 YouTube-commons 长音频评估(最大的开源 ASR 基准之一)上,Turbo 的 WER 为 13.40%,V3 为 13.20%——但 Turbo 的实时因子达到 129.5×,而 V3 仅 55.3×。速度快 2.3 倍,精度几乎相同。
Turbo 在韩语、俄语等语言上的准确率如何?
上面的基准都是英语。据 OpenAI 的模型卡,Turbo 裁剪到 4 层的解码器在非英语语言上牺牲的准确率比英语略多,低资源语言的退化最明显。对于俄语和大多数欧洲语言,Turbo 与完整版 Large-v3 差距不大——而且如果你用的是 Whisper Notes,Parakeet V3 以 Whisper 10 倍的速度覆盖俄语和另外 24 种欧洲语言。
至于韩语、日语、中文和粤语,专门的模型更快、标点也更好:SenseVoice 以 52 倍实时速度转录 CJK。Whisper Notes 在 iPhone 版和两个 Mac 渠道都提供 SenseVoice,Mac 上还同时提供 Turbo,你可以按语言选对模型,而不是所有语言都硬塞给同一个。
本地语音转文字,该用哪个模型?
Large-v3 Turbo 是你能在本地跑的最好的通用 Whisper 模型。但对大多数具体任务来说它都不是最优解,因为在 Apple Silicon 上它要和两个专用模型同台竞争,而这两个模型在各自的语言范围内都比它更强。Whisper Notes 里实际可用的是四个模型——Parakeet V3、SenseVoice Small、Whisper Small 和 Whisper Large V3 Turbo——选哪个几乎完全取决于你说什么语言、用什么硬件,而不是排行榜怎么排。
你只转录英语
用 Parakeet V3。它既更准也快得多:Hugging Face Open ASR 排行榜的英语平均词错率为 6.32%,Turbo 为 7.83%;同一台 M4 Pro 上,35 分钟音频它 18 秒转完,Turbo 需要约 3 分钟。纯英语场景下,没有任何一种情况值得选 Turbo。
你转录欧洲语言
依然是 Parakeet V3——前提是你的语言在它支持的 25 种之内:保加利亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、德语、希腊语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、瑞典语和乌克兰语。在 FLEURS 上,这 25 种语言的平均词错率为 12.0%,基本追平完整版 Whisper Large V3 的 12.6%,速度却快出好几倍。如果你的欧洲语言不在这份名单里(挪威语、冰岛语、塞尔维亚语和加泰罗尼亚语都不在),那就该用 Turbo。
你转录中文、日语、韩语或粤语
用 SenseVoice Small。它专为英语、简体与繁体中文、粤语、日语、韩语而做,在这类素材上的速度差距一点也不含蓄:同一台 M4 Pro,27 分钟中文播客 13.83 秒转完,Turbo 在同一个文件上花了两分多钟。它对 CJK 的标点和断句也更好,而当你真的回头读一遍转录稿时,这比词错率小数点后一位更要紧。Parakeet V3 则完全不覆盖这些语言。
你需要尽可能广的语言覆盖
用 Whisper Large V3 Turbo。它覆盖 101 种语言——阿拉伯语、印地语、泰语、希伯来语、越南语、印尼语,以及两个专用模型都不碰的长尾——英语准确率与完整版 Large-v3 相差不到半个百分点,低资源语言上的差距更大,但仍然可用。这正是 Turbo 在这套阵容里存在的意义:一个在覆盖范围上永远不会出错的兜底选项。按引擎的完整对照见我们的语言支持页面。
你的机器较旧,或者内存吃紧
用 Whisper Small。它同样覆盖 101 种语言,下载 600 MB,转录时占用约 487 MB 内存,而 Turbo 转录时约需 1.6 GB——在一台还开着浏览器的 8 GB Mac 上,这就是从容和局促的区别。代价是准确率,而且不是小代价:在 25 种欧洲语言的 FLEURS 测试中,Whisper Small 平均词错率 29.8%,Parakeet V3 是 12.0%。内存是硬约束时选它,追求准确率时别选。
你转录长录音——讲座、庭审记录、几小时的访谈
在覆盖你语言的模型里挑最快的那个,因为转录耗时随音频长度增长。两分钟语音备忘录上你根本察觉不到的速度差,放到三小时录音上就是喝杯咖啡和耗掉一下午的区别——所以只在语言确实需要时才把 Turbo 用在长文件上,并且要有等上几分钟而不是几秒的准备。长度还会放大 Whisper 的另一个风险:文件越长,静音片段越多,自回归解码器就越有机会凭空编出词来。这也是 Whisper Notes 在转录前先跑语音活动检测的原因。
放在一起看是这样——下表里的每个数字,要么来自我们自己的 Apple Silicon 实测,要么来自表下注明的公开基准:
| 模型 | 语言 | 英语 WER | 我们实测的速度 | 下载体积 | 运行内存 |
|---|---|---|---|---|---|
| Parakeet V3 | 25 种欧洲语言 | 6.32% | 35 分钟音频 18 秒(M4 Pro) | 465 MB | 约 800 MB |
| SenseVoice Small | 英语、中文(简体与繁体)、粤语、日语、韩语 | 本轮未测 | 27 分钟中文播客 13.83 秒(M4 Pro) | 827 MB | 约 700 MB |
| Whisper Small | 101 种 | 本轮未测 | 约为完整版 Large-v3 的 4 倍 | 600 MB | 约 487 MB |
| Whisper Large V3 Turbo | 101 种 | 7.83% | 约为完整版 Large-v3 的 5 倍;35 分钟音频约 3 分钟 | 约 1.6 GB | 约 1.6 GB |
英语 WER 是 Hugging Face Open ASR 排行榜多个英语数据集的平均值。SenseVoice Small 和 Whisper Small 不在那一轮英语测试里,所以这两格留空,不做推测。在 25 种欧洲语言的 FLEURS 平均值上,Parakeet V3 为 12.0%,完整版 Whisper Large V3 为 12.6%,Whisper Small 为 29.8%;Turbo 没有在这组多语言测试中单独跑过。速度是我们自己在 Apple Silicon 上的墙钟时间,两个相对倍数除外——它们是相对完整版 Large-v3 的。下载体积和内存占用,在 M4 Pro 上的 Whisper Notes Mac 版中实测。
同一套模型,按设备给合身的尺寸
你实际能加载哪些模型,取决于你用的是哪个版本。Whisper Notes 有三个渠道——iPhone 版、Mac App Store 版和官网下载版(DMG)——模型清单接近,但并不完全一样:
| 模型 | iPhone 版 | Mac App Store 版 | 官网下载版(DMG) |
|---|---|---|---|
| Parakeet V3 | 内置 | 已包含(默认) | 已包含(默认) |
| SenseVoice Small | 可选下载 | 可选下载 | 可选下载 |
| Whisper Small | 可选下载 | 可选下载 | 可选下载 |
| Whisper Large V3 Turbo | 不提供——设计如此 | 可选下载(约 1.6 GB) | 可选下载(约 1.6 GB) |
最后一行是产品决策,不是遗漏。Turbo 下载约 1.6 GB,运行时还要占用约 1.6 GB 内存——在 Apple Silicon Mac 上这是合理的要求,在大多数 iPhone 上就不合理了:同样的存储和内存,换成另一套模型能跑得更快,而且在它们各自的语言里更准。所以 iPhone 版内置 Parakeet V3,并提供 Whisper Small 和 SenseVoice Small 作为可选下载:Parakeet 负责 25 种欧洲语言(英语词错率 6.32%),SenseVoice 负责 CJK 和粤语,Whisper Small 作为覆盖 101 种语言的兜底,占用也能舒服地放进手机的内存预算。按设备给合身的模型,而不是把同一个 1.6 GB 文件塞进每一台技术上装得下的设备。
上面每个模型也都有值得先了解的失效场景——诚实的那一版在下文的各个模型分别错在哪。想看所有设备端方案(包括 Whisper Notes 不搭载的模型)的横向对比,可查看设备端语音模型对比。
社区基准测试:GPU 与 CPU
来自 faster-whisper 和 whisper.cpp 社区的独立基准测试在不同硬件上显示了一致的结果。在 GPU 上使用 faster-whisper 转录 13 分钟音频:
| 模型 | 数值精度 | 耗时 | GPU 显存 | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 秒 | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 秒 | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 秒 | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 秒 | 2,409 MB | 2.39% |
数据来源:faster-whisper 在 NVIDIA GPU 上的基准测试,LibriSpeech clean 验证集。Turbo int8 仅需 1.5 GB 显存——2 GB 显卡也能跑。
在 RTX 3060 笔记本(6 GB 显存,int8 精度)上进行批量推理,优势更加明显:
| 模型 | 顺序推理 | 批量 (10) | 批量 WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 秒 | 18.7 秒 | 7.7% |
| Large-v3 | 230.8 秒 | 43.0 秒 | 7.9% |
| Large-v2 | 178.3 秒 | 43.2 秒 | 8.8% |
| Medium | 113.3 秒 | 26.3 秒 | 8.9% |
数据来源:NilaierMusic 基准测试,Intel i7-12650H + RTX 3060 笔记本 6 GB 显存,法语音频,int8 精度。
批量推理下,Turbo 在所有测试模型中 WER 最低(7.7%),同时速度最快。是生产环境的最佳选择。
Turbo、Medium 与其他 Whisper 型号
Turbo 出现之前,Medium 通常是速度和准确率之间的折中。Turbo 只有 8.09 亿参数,和 Medium 的 7.69 亿很接近,却能提供接近 Large V3 的准确率,并在 Apple Silicon 上约快 5 倍。
| 模型 | 参数量 | 磁盘大小 | 相对速度 | 准确率层级 |
|---|---|---|---|---|
| tiny | 39M | 约 75 MB | 约 10× | 最低 |
| base | 74M | 约 142 MB | 约 7× | 较低 |
| small | 244M | 约 466 MB | 约 4× | 中等 |
| medium | 769M | 约 1.5 GB | 约 2× | 高 |
| large-v3 | 1,550M | 约 2.9 GB | 1× | 最高 |
| large-v3-turbo | 809M | 约 1.6 GB | Apple Silicon 上约 5× | 接近最高 |
官方模型卡给出的 Turbo 参数量为 809M。它在与 Medium 接近的体积下,提供更高准确率和更快转写速度。
这张表里 Whisper Notes 只搭载两行——Whisper Small 和 Whisper Large V3 Turbo。tiny、base 和 medium 是有意省掉的:在 Apple Silicon 上,它们每一个都被阵容里的别的模型压住了。你本来会用 tiny 或 base 的场景,Parakeet V3 更快也准得多;本来会用 medium 的场景,Turbo 在相近体积下做得更好。Whisper Small 之所以留下,是因为没有别的模型能用不到 500 MB 内存覆盖 101 种语言。
已知局限(以及 Whisper Notes 的应对方案)
不支持翻译
Turbo 的训练数据不包含翻译任务,只能用源语言转录——不像 Large-v3 支持音频→英文翻译。
Whisper Notes — Mac 版通过 Apple Intelligence 自动将转录结果翻译为指定语言,实现双语对照显示,不依赖模型自身的翻译能力。
噪音环境下幻觉更多
社区反馈表明 Turbo 在极短音频片段或高噪音录音中,比 V3 更容易产生幻觉。这与解码器缩减(4 层 vs 32 层)有关。
Whisper Notes — 转录前运行 VAD 语音活动检测,找出可能有人声的片段并跳过静音,减少静音诱发的重复文字。
各个模型分别错在哪
这套阵容里的每个模型都有真正不擅长的地方,一份诚实的清单比再来一张基准表更有用。Whisper——Small 和 Large V3 Turbo 都一样——会在静音处产生幻觉。它的解码器是自回归的:不管还有没有声音可听,它都会去预测下一个 token,于是一段安静可能被还原成重复的短语、一句莫名其妙的字幕署名,或者一个流畅但没人说过的句子。在极短或高噪音的片段上,Turbo 的 4 层解码器比完整版 Large-v3 更容易出现这种情况。语音活动检测能消掉其中大部分——它从一开始就不把静音送进模型;在我们的静音测试里,Parakeet V3 编造出来的词也少得多。但没有哪个语音模型配得上“绝不”两个字,在你真的依赖一份转录稿之前,还是应该先读一遍。
Parakeet V3 有一道硬的 25 语言天花板,而且这 25 种全是欧洲语言。没有中文、日语、韩语、粤语、阿拉伯语、印地语、泰语或希伯来语——而且当音频飘出它的支持范围时,它不会提醒你,只会一本正经地输出胡话。SenseVoice Small 的范围更窄:英语、简体与繁体中文、粤语、日语、韩语,仅此而已。在它被设计来处理的素材上,它是这里最快的模型;在别的一切上,它是错的工具。Whisper Small 最省资源,也最不准——在 25 种欧洲语言的 FLEURS 测试中平均词错率 29.8%,Parakeet V3 是 12.0%,差距最先体现在专有名词、专业词汇和带口音的语音上。
而且它们都要花掉存储和硬件。这些是落在你磁盘上的真实文件,不是一次 API 调用:Turbo 下载约 1.6 GB,转录时占用约 1.6 GB 内存;SenseVoice Small 827 MB,Whisper Small 600 MB,Parakeet V3 465 MB。整套阵容只在 Apple Silicon 上运行——Mac 需要 macOS 14 及以上、M1 及更新的芯片,iPhone 需要 iOS 18 及以上。没有 Intel Mac 版,没有 Windows 版,也没有 Android 版;而且这里没有任何一个模型做实时转录:Whisper Notes 是在你停止录音之后处理这段录音,而不是边说边出字。
该选哪个模型?
| 英语 / 欧洲语言 | Parakeet V3 — 比 Whisper 快 10 倍,精度更高 |
| 中文 / 日语 / 韩语 | SenseVoice — CJK 专用,52 倍速 |
| 其他语言 | Whisper Large V3 Turbo — 100+ 种语言,准确率高,速度慢 |
| 旧 Mac / 内存吃紧 | Whisper Small — 约 487 MB 内存覆盖 101 种语言,代价是实打实的准确率损失 |
| 在 iPhone 上 | 内置 Parakeet V3,Whisper Small 和 SenseVoice 可选下载 — Turbo 按设计只在 Mac 上提供 |
Whisper Large V3 Turbo 常见问题
本地语音转文字该用哪个模型?
取决于你的语言,而不是排行榜。英语和另外 24 种欧洲语言,Parakeet V3 比 Whisper Large V3 Turbo 又快又准(Hugging Face Open ASR 排行榜的英语平均词错率为 6.32% vs 7.83%;同一台 M4 Pro 上 35 分钟音频 18 秒 vs 约 3 分钟)。中文、日语、韩语或粤语,SenseVoice Small 是那个专用选手——27 分钟中文播客 13.83 秒。其余 101 种 Whisper 语言,比如阿拉伯语、印地语或泰语,Whisper Large V3 Turbo 才是正确选择。机器较旧或内存吃紧时,Whisper Small 用约 487 MB 内存覆盖同样的 101 种语言,代价是实打实的准确率损失。
iPhone 上能跑 Whisper Large V3 Turbo 吗?
在 Whisper Notes 里不能,而且这是有意为之。Turbo 下载约 1.6 GB,转录时占用约 1.6 GB 内存——在 Apple Silicon Mac 上说得通,在手机上就是浪费。iPhone 版内置 Parakeet V3,并提供 Whisper Small 和 SenseVoice Small 作为可选下载,用一小部分占用就覆盖了 101 种语言和 CJK。Whisper Large V3 Turbo 在两个 Mac 版本里都有:Mac App Store 版和官网下载版(DMG)。
Whisper Large V3 和 Turbo 有什么区别?
Turbo 保留 Large V3 的编码器,但把解码器从 32 层减到 4 层,因此转写更快,词错率只小幅上升。代价是 Turbo 不支持 Whisper 内置的音频转英文任务。
faster-whisper 支持 Large V3 Turbo 吗?
支持。faster-whisper 可通过 CTranslate2 转换运行 Turbo;上面的社区测试中,int8 版本约使用 1.5 GB 显存。
whisper.cpp 支持 Large V3 Turbo 吗?
支持。whisper.cpp 可以运行转换后的 GGML/GGUF Turbo 模型,比完整 Large V3 更容易放进消费级硬件。
在哪里下载 openai/whisper-large-v3-turbo?
OpenAI 的官方权重在 Hugging Face。Whisper Notes 用户不需要手动下载,应用会在模型选择界面完成设置。
想横向比较 Whisper、Parakeet V3、SenseVoice 和 Voxtral,可查看设备端语音模型对比;第一次接触 Whisper,可以从Whisper 转录指南开始。