Whisper Large V3 Turbo vs V3:Mac 上快 5 倍(基准测试)

2024年11月6日
·
6 min read
·Whisper Notes Team

OpenAI 的 Whisper Large-v3 Turbo 将解码器从 32 层裁剪到 4 层,参数量从 15.5 亿降至 8.09 亿。在我们的 Apple Silicon 测试中,它处理同一段音频约快 5 倍,词错率几乎不变。Whisper Notes 在 Mac 上搭载此模型——Mac App Store 版和官网下载版(DMG)都有——iPhone 版则有意不提供它,改用体积更合身的模型。

Whisper Large V3 Turbo 与 V3 架构对比

V3 Turbo vs V3:改了什么

Turbo 不是新架构。它就是 Whisper Large-v3,解码器从 32 层剪枝到 4 层,然后微调恢复精度。编码器完全不变。

Large-v3 Turbo Large-v3
参数量 809M 1,550M
解码器层数 4 32
语言数 100+ 100+
翻译任务 不支持 支持
开源协议 MIT Apache 2.0

Turbo 的训练数据明确排除了翻译任务。完整版 Large-v3 支持翻译,但 Whisper Notes 搭载的是 Turbo 而不是完整版 Large-v3——翻译在 Mac 上通过 Apple Intelligence 单独实现。

基础模型:Whisper Large V3 是什么?

Whisper Large V3 是 OpenAI 在 2023 年发布的开源语音识别模型,参数量 15.5 亿,使用 128 个 mel 频带,并在约 500 万小时音频上训练。官方模型卡列出 100+ 种语言,并把模型许可标为 Apache 2.0。想把它和其他设备端模型一起比较,可查看本地语音模型对比

速度基准:Whisper Notes 在 Apple Silicon 上的表现

Mac 版 Whisper Notes 中,Turbo 通过 CoreML 在 Neural Engine 上运行。处理 10 分钟音频:

设备 Whisper V3 V3 Turbo 提速
iPhone 15 Pro 425 秒 82 秒 5.2×
iPad Pro M2 380 秒 71 秒 5.4×
MacBook Pro M2 316 秒 63 秒 5.0×

测试方法:在每台表中设备上,用同一版 Whisper Notes 转写同一个 10 分钟音频文件。从点击开始到最终文本完成计墙钟时间;V3 与 Turbo 之间只更换模型。

5 倍提速是 Whisper Notes 在 Apple Silicon 上的实测结果,较小的解码器在 Neural Engine 上优化效果更好。在 GPU 上使用 faster-whisper 等框架时,差距缩小到约 2.7 倍(见下方社区基准测试)。

关于表中 iPhone 和 iPad 两行需要澄清一点:那是在这些硬件上对模型本身的评测,不是 iPhone 版实际提供的模型清单。iPhone 版 Whisper Notes 不提供 Large V3 Turbo——这是有意的选择,原因见下文的分设备对照表

精度对比:WER 词错率

Hugging Face Open ASR 排行榜在相同的英文数据集上测试了两个模型。Turbo 的词错率在每个基准上都与 V3 相差不到 0.5 个百分点:

数据集 V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
平均 WER 7.83% 7.44%

V3 在每个数据集上都略微更准,但差距很小——平均仅 0.39 个百分点。在实际使用中,基本感受不到区别。

在 YouTube-commons 长音频评估(最大的开源 ASR 基准之一)上,Turbo 的 WER 为 13.40%,V3 为 13.20%——但 Turbo 的实时因子达到 129.5×,而 V3 仅 55.3×。速度快 2.3 倍,精度几乎相同。

Turbo 在韩语、俄语等语言上的准确率如何?

上面的基准都是英语。据 OpenAI 的模型卡,Turbo 裁剪到 4 层的解码器在非英语语言上牺牲的准确率比英语略多,低资源语言的退化最明显。对于俄语和大多数欧洲语言,Turbo 与完整版 Large-v3 差距不大——而且如果你用的是 Whisper Notes,Parakeet V3 以 Whisper 10 倍的速度覆盖俄语和另外 24 种欧洲语言。

至于韩语、日语、中文和粤语,专门的模型更快、标点也更好:SenseVoice 以 52 倍实时速度转录 CJK。Whisper Notes 在 iPhone 版和两个 Mac 渠道都提供 SenseVoice,Mac 上还同时提供 Turbo,你可以按语言选对模型,而不是所有语言都硬塞给同一个。

本地语音转文字,该用哪个模型?

Large-v3 Turbo 是你能在本地跑的最好的通用 Whisper 模型。但对大多数具体任务来说它都不是最优解,因为在 Apple Silicon 上它要和两个专用模型同台竞争,而这两个模型在各自的语言范围内都比它更强。Whisper Notes 里实际可用的是四个模型——Parakeet V3、SenseVoice Small、Whisper Small 和 Whisper Large V3 Turbo——选哪个几乎完全取决于你说什么语言、用什么硬件,而不是排行榜怎么排。

你只转录英语

Parakeet V3。它既更准也快得多:Hugging Face Open ASR 排行榜的英语平均词错率为 6.32%,Turbo 为 7.83%;同一台 M4 Pro 上,35 分钟音频它 18 秒转完,Turbo 需要约 3 分钟。纯英语场景下,没有任何一种情况值得选 Turbo。

你转录欧洲语言

依然是 Parakeet V3——前提是你的语言在它支持的 25 种之内:保加利亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、德语、希腊语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、瑞典语和乌克兰语。在 FLEURS 上,这 25 种语言的平均词错率为 12.0%,基本追平完整版 Whisper Large V3 的 12.6%,速度却快出好几倍。如果你的欧洲语言不在这份名单里(挪威语、冰岛语、塞尔维亚语和加泰罗尼亚语都不在),那就该用 Turbo。

你转录中文、日语、韩语或粤语

SenseVoice Small。它专为英语、简体与繁体中文、粤语、日语、韩语而做,在这类素材上的速度差距一点也不含蓄:同一台 M4 Pro,27 分钟中文播客 13.83 秒转完,Turbo 在同一个文件上花了两分多钟。它对 CJK 的标点和断句也更好,而当你真的回头读一遍转录稿时,这比词错率小数点后一位更要紧。Parakeet V3 则完全不覆盖这些语言。

你需要尽可能广的语言覆盖

用 Whisper Large V3 Turbo。它覆盖 101 种语言——阿拉伯语、印地语、泰语、希伯来语、越南语、印尼语,以及两个专用模型都不碰的长尾——英语准确率与完整版 Large-v3 相差不到半个百分点,低资源语言上的差距更大,但仍然可用。这正是 Turbo 在这套阵容里存在的意义:一个在覆盖范围上永远不会出错的兜底选项。按引擎的完整对照见我们的语言支持页面

你的机器较旧,或者内存吃紧

用 Whisper Small。它同样覆盖 101 种语言,下载 600 MB,转录时占用约 487 MB 内存,而 Turbo 转录时约需 1.6 GB——在一台还开着浏览器的 8 GB Mac 上,这就是从容和局促的区别。代价是准确率,而且不是小代价:在 25 种欧洲语言的 FLEURS 测试中,Whisper Small 平均词错率 29.8%,Parakeet V3 是 12.0%。内存是硬约束时选它,追求准确率时别选。

你转录长录音——讲座、庭审记录、几小时的访谈

在覆盖你语言的模型里挑最快的那个,因为转录耗时随音频长度增长。两分钟语音备忘录上你根本察觉不到的速度差,放到三小时录音上就是喝杯咖啡和耗掉一下午的区别——所以只在语言确实需要时才把 Turbo 用在长文件上,并且要有等上几分钟而不是几秒的准备。长度还会放大 Whisper 的另一个风险:文件越长,静音片段越多,自回归解码器就越有机会凭空编出词来。这也是 Whisper Notes 在转录前先跑语音活动检测的原因。

放在一起看是这样——下表里的每个数字,要么来自我们自己的 Apple Silicon 实测,要么来自表下注明的公开基准:

模型 语言 英语 WER 我们实测的速度 下载体积 运行内存
Parakeet V3 25 种欧洲语言 6.32% 35 分钟音频 18 秒(M4 Pro) 465 MB 约 800 MB
SenseVoice Small 英语、中文(简体与繁体)、粤语、日语、韩语 本轮未测 27 分钟中文播客 13.83 秒(M4 Pro) 827 MB 约 700 MB
Whisper Small 101 种 本轮未测 约为完整版 Large-v3 的 4 倍 600 MB 约 487 MB
Whisper Large V3 Turbo 101 种 7.83% 约为完整版 Large-v3 的 5 倍;35 分钟音频约 3 分钟 约 1.6 GB 约 1.6 GB

英语 WER 是 Hugging Face Open ASR 排行榜多个英语数据集的平均值。SenseVoice Small 和 Whisper Small 不在那一轮英语测试里,所以这两格留空,不做推测。在 25 种欧洲语言的 FLEURS 平均值上,Parakeet V3 为 12.0%,完整版 Whisper Large V3 为 12.6%,Whisper Small 为 29.8%;Turbo 没有在这组多语言测试中单独跑过。速度是我们自己在 Apple Silicon 上的墙钟时间,两个相对倍数除外——它们是相对完整版 Large-v3 的。下载体积和内存占用,在 M4 Pro 上的 Whisper Notes Mac 版中实测。

同一套模型,按设备给合身的尺寸

你实际能加载哪些模型,取决于你用的是哪个版本。Whisper Notes 有三个渠道——iPhone 版、Mac App Store 版和官网下载版(DMG)——模型清单接近,但并不完全一样:

模型 iPhone 版 Mac App Store 版 官网下载版(DMG)
Parakeet V3 内置 已包含(默认) 已包含(默认)
SenseVoice Small 可选下载 可选下载 可选下载
Whisper Small 可选下载 可选下载 可选下载
Whisper Large V3 Turbo 不提供——设计如此 可选下载(约 1.6 GB) 可选下载(约 1.6 GB)

最后一行是产品决策,不是遗漏。Turbo 下载约 1.6 GB,运行时还要占用约 1.6 GB 内存——在 Apple Silicon Mac 上这是合理的要求,在大多数 iPhone 上就不合理了:同样的存储和内存,换成另一套模型能跑得更快,而且在它们各自的语言里更准。所以 iPhone 版内置 Parakeet V3,并提供 Whisper Small 和 SenseVoice Small 作为可选下载:Parakeet 负责 25 种欧洲语言(英语词错率 6.32%),SenseVoice 负责 CJK 和粤语,Whisper Small 作为覆盖 101 种语言的兜底,占用也能舒服地放进手机的内存预算。按设备给合身的模型,而不是把同一个 1.6 GB 文件塞进每一台技术上装得下的设备。

上面每个模型也都有值得先了解的失效场景——诚实的那一版在下文的各个模型分别错在哪。想看所有设备端方案(包括 Whisper Notes 不搭载的模型)的横向对比,可查看设备端语音模型对比

社区基准测试:GPU 与 CPU

来自 faster-whisper 和 whisper.cpp 社区的独立基准测试在不同硬件上显示了一致的结果。在 GPU 上使用 faster-whisper 转录 13 分钟音频:

模型 数值精度 耗时 GPU 显存 WER
Large-v3 Turbo fp16 19.2 秒 2,537 MB 1.92%
Large-v3 fp16 52.0 秒 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 秒 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 秒 2,409 MB 2.39%

数据来源:faster-whisper 在 NVIDIA GPU 上的基准测试,LibriSpeech clean 验证集。Turbo int8 仅需 1.5 GB 显存——2 GB 显卡也能跑。

在 RTX 3060 笔记本(6 GB 显存,int8 精度)上进行批量推理,优势更加明显:

模型 顺序推理 批量 (10) 批量 WER
Large-v3 Turbo 46.1 秒 18.7 秒 7.7%
Large-v3 230.8 秒 43.0 秒 7.9%
Large-v2 178.3 秒 43.2 秒 8.8%
Medium 113.3 秒 26.3 秒 8.9%

数据来源:NilaierMusic 基准测试,Intel i7-12650H + RTX 3060 笔记本 6 GB 显存,法语音频,int8 精度。

批量推理下,Turbo 在所有测试模型中 WER 最低(7.7%),同时速度最快。是生产环境的最佳选择。

Turbo、Medium 与其他 Whisper 型号

Turbo 出现之前,Medium 通常是速度和准确率之间的折中。Turbo 只有 8.09 亿参数,和 Medium 的 7.69 亿很接近,却能提供接近 Large V3 的准确率,并在 Apple Silicon 上约快 5 倍。

模型 参数量 磁盘大小 相对速度 准确率层级
tiny39M约 75 MB约 10×最低
base74M约 142 MB约 7×较低
small244M约 466 MB约 4×中等
medium769M约 1.5 GB约 2×
large-v31,550M约 2.9 GB最高
large-v3-turbo809M约 1.6 GBApple Silicon 上约 5×接近最高

官方模型卡给出的 Turbo 参数量为 809M。它在与 Medium 接近的体积下,提供更高准确率和更快转写速度。

这张表里 Whisper Notes 只搭载两行——Whisper Small 和 Whisper Large V3 Turbo。tiny、base 和 medium 是有意省掉的:在 Apple Silicon 上,它们每一个都被阵容里的别的模型压住了。你本来会用 tiny 或 base 的场景,Parakeet V3 更快也准得多;本来会用 medium 的场景,Turbo 在相近体积下做得更好。Whisper Small 之所以留下,是因为没有别的模型能用不到 500 MB 内存覆盖 101 种语言。

已知局限(以及 Whisper Notes 的应对方案)

不支持翻译

Turbo 的训练数据不包含翻译任务,只能用源语言转录——不像 Large-v3 支持音频→英文翻译。

Whisper Notes — Mac 版通过 Apple Intelligence 自动将转录结果翻译为指定语言,实现双语对照显示,不依赖模型自身的翻译能力。

噪音环境下幻觉更多

社区反馈表明 Turbo 在极短音频片段或高噪音录音中,比 V3 更容易产生幻觉。这与解码器缩减(4 层 vs 32 层)有关。

Whisper Notes — 转录前运行 VAD 语音活动检测,找出可能有人声的片段并跳过静音,减少静音诱发的重复文字。

各个模型分别错在哪

这套阵容里的每个模型都有真正不擅长的地方,一份诚实的清单比再来一张基准表更有用。Whisper——Small 和 Large V3 Turbo 都一样——会在静音处产生幻觉。它的解码器是自回归的:不管还有没有声音可听,它都会去预测下一个 token,于是一段安静可能被还原成重复的短语、一句莫名其妙的字幕署名,或者一个流畅但没人说过的句子。在极短或高噪音的片段上,Turbo 的 4 层解码器比完整版 Large-v3 更容易出现这种情况。语音活动检测能消掉其中大部分——它从一开始就不把静音送进模型;在我们的静音测试里,Parakeet V3 编造出来的词也少得多。但没有哪个语音模型配得上“绝不”两个字,在你真的依赖一份转录稿之前,还是应该先读一遍。

Parakeet V3 有一道硬的 25 语言天花板,而且这 25 种全是欧洲语言。没有中文、日语、韩语、粤语、阿拉伯语、印地语、泰语或希伯来语——而且当音频飘出它的支持范围时,它不会提醒你,只会一本正经地输出胡话。SenseVoice Small 的范围更窄:英语、简体与繁体中文、粤语、日语、韩语,仅此而已。在它被设计来处理的素材上,它是这里最快的模型;在别的一切上,它是错的工具。Whisper Small 最省资源,也最不准——在 25 种欧洲语言的 FLEURS 测试中平均词错率 29.8%,Parakeet V3 是 12.0%,差距最先体现在专有名词、专业词汇和带口音的语音上。

而且它们都要花掉存储和硬件。这些是落在你磁盘上的真实文件,不是一次 API 调用:Turbo 下载约 1.6 GB,转录时占用约 1.6 GB 内存;SenseVoice Small 827 MB,Whisper Small 600 MB,Parakeet V3 465 MB。整套阵容只在 Apple Silicon 上运行——Mac 需要 macOS 14 及以上、M1 及更新的芯片,iPhone 需要 iOS 18 及以上。没有 Intel Mac 版,没有 Windows 版,也没有 Android 版;而且这里没有任何一个模型做实时转录:Whisper Notes 是在你停止录音之后处理这段录音,而不是边说边出字。

该选哪个模型?

英语 / 欧洲语言 Parakeet V3 — 比 Whisper 快 10 倍,精度更高
中文 / 日语 / 韩语 SenseVoice — CJK 专用,52 倍速
其他语言 Whisper Large V3 Turbo — 100+ 种语言,准确率高,速度慢
旧 Mac / 内存吃紧 Whisper Small — 约 487 MB 内存覆盖 101 种语言,代价是实打实的准确率损失
在 iPhone 上 内置 Parakeet V3,Whisper Small 和 SenseVoice 可选下载 — Turbo 按设计只在 Mac 上提供

Whisper Large V3 Turbo 常见问题

本地语音转文字该用哪个模型?

取决于你的语言,而不是排行榜。英语和另外 24 种欧洲语言,Parakeet V3 比 Whisper Large V3 Turbo 又快又准(Hugging Face Open ASR 排行榜的英语平均词错率为 6.32% vs 7.83%;同一台 M4 Pro 上 35 分钟音频 18 秒 vs 约 3 分钟)。中文、日语、韩语或粤语,SenseVoice Small 是那个专用选手——27 分钟中文播客 13.83 秒。其余 101 种 Whisper 语言,比如阿拉伯语、印地语或泰语,Whisper Large V3 Turbo 才是正确选择。机器较旧或内存吃紧时,Whisper Small 用约 487 MB 内存覆盖同样的 101 种语言,代价是实打实的准确率损失。

iPhone 上能跑 Whisper Large V3 Turbo 吗?

在 Whisper Notes 里不能,而且这是有意为之。Turbo 下载约 1.6 GB,转录时占用约 1.6 GB 内存——在 Apple Silicon Mac 上说得通,在手机上就是浪费。iPhone 版内置 Parakeet V3,并提供 Whisper Small 和 SenseVoice Small 作为可选下载,用一小部分占用就覆盖了 101 种语言和 CJK。Whisper Large V3 Turbo 在两个 Mac 版本里都有:Mac App Store 版和官网下载版(DMG)。

Whisper Large V3 和 Turbo 有什么区别?

Turbo 保留 Large V3 的编码器,但把解码器从 32 层减到 4 层,因此转写更快,词错率只小幅上升。代价是 Turbo 不支持 Whisper 内置的音频转英文任务。

faster-whisper 支持 Large V3 Turbo 吗?

支持。faster-whisper 可通过 CTranslate2 转换运行 Turbo;上面的社区测试中,int8 版本约使用 1.5 GB 显存。

whisper.cpp 支持 Large V3 Turbo 吗?

支持。whisper.cpp 可以运行转换后的 GGML/GGUF Turbo 模型,比完整 Large V3 更容易放进消费级硬件。

在哪里下载 openai/whisper-large-v3-turbo?

OpenAI 的官方权重在 Hugging Face。Whisper Notes 用户不需要手动下载,应用会在模型选择界面完成设置。

想横向比较 Whisper、Parakeet V3、SenseVoice 和 Voxtral,可查看设备端语音模型对比;第一次接触 Whisper,可以从Whisper 转录指南开始。