TL;DR
| Parakeet V3 | Whisper 对比 | |
|---|---|---|
| 速度 | 比 Turbo 快 10×;比 V3 快约 23× | Turbo / Large V3 基准 |
| 支持语种 | 25 | 100+ |
| 英语错误率 (WER) | 6.32% | Turbo 7.83%;V3 7.44% |
| 25 种语言平均错误率 (WER) | 12.0% | 12.6% |
| 幻觉 | 实测静音时极少出现 | 静音时可能出现 |
| 适用 | 英语和欧洲语言 | 亚洲、阿拉伯等语言 |
* 速度:同一段 35 分钟音频,Apple Silicon 实测。英语 WER:Hugging Face Open ASR Leaderboard。25 语言均值:FLEURS。静音表现来自产品实测,不代表零错误保证。
从1.3.2 (Direct Download / DMG)版本开始,Mac 版 Whisper Notes 默认使用 NVIDIA Parakeet TDT 0.6B 作为语音引擎。英文转录速度比 Whisper Large V3 Turbo 快 10 倍,准确率也更高。如果你需要其他语言,Whisper 模型仍然可用。四个本地模型该怎么选?直接跳到选型表格。
为什么换了默认模型
Whisper 很好用,但它是个通用模型——支持 100+ 种语言、能翻译、能生成时间戳,是把瑞士军刀。代价是速度。对于英文听写这种只需要快速出字的场景,它太重了。
最让我难受的是:按住 Fn 用全局语音输入时,说完大概1分钟的话,要等3到5秒才能看到转录结果。这个等待打断了节奏——你说完了,盯着光标,什么都没出来,voice typing 的魔力瞬间消失。
Parakeet 彻底改变了这一点。它的速度快到说完的瞬间,文字就出现了。言出法随,毫无延迟。一旦体验过这种感觉——这种丝滑的、零等待的流畅——就很难再回到 Whisper 了。
Parakeet V3 有多快?
数字最有说服力。同一台 Mac 上,同一段 35 分钟的音频:
| 模型 | 35 分钟音频 |
|---|---|
| Whisper Large V3 Turbo | 3 分钟 |
| Parakeet TDT 0.6B v3 | 18 秒 |
快了 10 倍。而且模型更小(6 亿 vs 8 亿参数),内存和电量消耗也更低。
Parakeet v3 为什么这么快
Whisper 处理音频的方式就像逐字朗读一本书——一帧一帧,从不跳过。即使是静音,它也在处理,在猜测下一个词是什么。这很严谨,但太慢了。
Parakeet 的思路完全不同。它先把音频信号压缩 8 倍,只保留关键信息。然后,它不再逐帧磨,而是同时预测两件事:你说了什么词,以及这个词持续多久——然后直接跳到下一个词。静音?直接跳过。一个长元音?一次预测搞定,而不是重复几十次。
结果就是,模型处理语音的方式更像你的大脑——只关注有意义的词,忽略中间的空白。这就是为什么它用更少的参数、更高的准确率,做到了 10 倍的速度。
基准测试:Parakeet v3 vs Whisper
Parakeet v3 在 FLEURS、CoVoST 和 MLS 基准测试中匹敌甚至超越参数量 2-4 倍的模型
在 Hugging Face Open ASR 排行榜上,Parakeet v3 仅凭 6 亿参数就登顶——不到 Whisper Large V3 的 15.5 亿参数的一半:
| 模型 | 参数量 | 平均词错率 | 速度 (RTFx) |
|---|---|---|---|
| Parakeet TDT 0.6B v3 | 6 亿 | 6.32% | 3,333x |
| Canary 1B v2 | 10 亿 | 7.15% | 749x |
| Whisper Large V3 | 15.5 亿 | 7.44% | 146x |
| Whisper Large V3 Turbo | 8 亿 | 7.83% | 350x |
词错率越低越好,RTFx 越高越快。Parakeet 两项全赢。6 亿参数也意味着它是列表中最小的模型——在 Apple Silicon 上运行极其流畅,内存和电量消耗都很低。
多语言词错率:全部 25 种语言
上面的排行榜只涵盖英语。接下来是全貌——Whisper Notes 中可用的三个模型在 Parakeet 支持的全部 25 种语言上的表现,基于 FLEURS 基准测试。词错率越低 = 转录错误越少。每行中 Large V3 和 Parakeet 的最佳值已高亮显示:
| 语言 | Whisper Small | Whisper Large V3 | Parakeet V3 |
|---|---|---|---|
| 保加利亚语 | 37.3 | 12.9 | 12.6 |
| 克罗地亚语 | 33.4 | 11.1 | 12.5 |
| 捷克语 | 37.6 | 11.3 | 11.0 |
| 丹麦语 | 32.8 | 12.6 | 18.4 |
| 荷兰语 | 16.4 | 5.6 | 7.5 |
| 英语 | 6.1 | 4.3 | 4.9 |
| 爱沙尼亚语 | 51.3 | 19.1 | 17.7 |
| 芬兰语 | 24.0 | 7.7 | 13.2 |
| 法语 | 15.0 | 6.3 | 5.2 |
| 德语 | 10.2 | 4.3 | 5.0 |
| 希腊语 | 30.8 | 27.0 | 20.7 |
| 匈牙利语 | 38.9 | 14.1 | 15.7 |
| 意大利语 | 9.8 | 2.3 | 3.0 |
| 拉脱维亚语 | 53.2 | 18.3 | 22.8 |
| 立陶宛语 | 65.6 | 22.3 | 20.4 |
| 马耳他语 | 92.2 | 68.9 | 20.5 |
| 波兰语 | 14.7 | 4.7 | 7.3 |
| 葡萄牙语 | 7.3 | 3.7 | 4.8 |
| 罗马尼亚语 | 29.8 | 8.2 | 12.4 |
| 俄语 | 11.4 | 4.2 | 5.5 |
| 斯洛伐克语 | 33.3 | 8.4 | 8.8 |
| 斯洛文尼亚语 | 49.3 | 19.9 | 24.0 |
| 西班牙语 | 5.6 | 3.1 | 3.5 |
| 瑞典语 | 20.8 | 7.9 | 15.1 |
| 乌克兰语 | 19.3 | 6.5 | 6.8 |
| 平均 | 29.8 | 12.6 | 12.0 |
词错率(%)基于 FLEURS 测试集。Whisper Small 数据来自 Radford 等人;Large V3 和 Parakeet V3 数据来自 NVIDIA Canary-1B-v2 论文。
Whisper Large V3 在多数单语言上略胜一筹,但 Parakeet V3 的平均值很接近(12.0% vs 12.6%),在希腊语、法语、爱沙尼亚语和马耳他语上领先,而且比 Whisper Small 的平均错误率低约 60%。实际优势是这组组合:接近 Large V3 的多语言准确率、约 23 倍速度、更小的运行时占用,以及我们在听写测试中观察到的更可靠静音处理。
为什么它在静音时更少出现幻觉
如果你用 Whisper 做过听写,可能遇到过它在静音时产生幻觉——重复短语、凭空造词,甚至输出"Subtitles by Amara.org"这种莫名其妙的文字。这是因为 Whisper 的自回归解码器总是期望生成文本,即使根本没有内容可转录。
Parakeet 的转导器架构可以输出空白,不必在每个时间点强行生成文字。在我们的全局听写测试里,它比 Whisper 更少在停顿时补出重复或无关内容。但它仍是语音模型,所以准确的说法是“更少”,不是“从不”。
Parakeet 支持的语言
Parakeet v3 支持 25 种语言:保加利亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、德语、希腊语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、瑞典语和乌克兰语。
它基本覆盖欧洲语言,但不支持中文、日语、韩语、阿拉伯语或印地语。中日韩粤建议用 SenseVoice;阿拉伯语、印地语和其他不在 Parakeet 列表里的语言,用 Whisper Large V3 Turbo。
本地模型该怎么选?
Whisper Notes 内置四个本地语音转文字引擎,选起来其实比看上去简单:绝大多数时候,你要转录的语言就决定了答案,剩下的由硬件决定。选哪个都不影响隐私——四个模型全部在你的设备上离线运行。变化的只是速度、准确率,以及模型要占多少磁盘和内存。
整个决策就在下面这张表里。
| 你的情况 | 选它 | 原因 |
|---|---|---|
| 只用英语——听写、访谈、会议 | Parakeet V3 | 四个模型里英语错误率最低(WER 6.32%),速度也遥遥领先:M4 Pro 上 35 分钟音频 18 秒转完。 |
| 欧洲语言——法语、德语、西班牙语、波兰语、乌克兰语等 25 种 | Parakeet V3 | 在 FLEURS 上,它支持的 25 种语言平均 WER 为 12.0%,略优于 Whisper Large V3 的 12.6%——而速度约为后者的 23 倍。 |
| 中文、日语、韩语或粤语 | SenseVoice Small | 专为中日韩粤打造:M4 Pro 上 27 分钟中文播客 13.83 秒转完。Parakeet 完全不支持这些语言。 |
| 语言覆盖要最广——阿拉伯语、印地语、土耳其语、越南语、泰语 | Whisper Large V3 Turbo | 这里唯一覆盖全部 101 种语言的引擎,英语 WER 7.83%,速度约为 Whisper Large V3 的 5 倍。 |
| 事先不知道是什么语言,或者音频中途换语言 | Whisper Large V3 Turbo | 覆盖面最广,还能自动识别语言。等你确定了语种,再换成对应的专精模型。 |
| 老设备,或者内存吃紧 | Whisper Small,或 Parakeet V3 | Whisper Small 用小得多的体积装下了完整的 101 种语言——代价是准确率(上表 25 种语言平均 29.8%)。如果你的语言在 Parakeet 的 25 种之内,就选 Parakeet:磁盘 465 MB,内存约 800 MB。 |
| 长录音——一小时以上 | Parakeet V3(中日韩粤用 SenseVoice Small) | 时长越长,速度差距被放得越大。按 35 分钟 18 秒的实测推算,M4 Pro 上一小时的文件远不到一分钟就能转完;同一段 35 分钟音频,Whisper Large V3 Turbo 用了 3 分钟。 |
| 停顿很多的听写 | Parakeet V3 | 它的转导器可以输出空白,而不必硬凑出一个词,停顿处就保持空白,不会被编造的文字填上。 |
同样这四个模型,换成决定取舍的参数来看:
| 模型 | 语言 | 准确率 | 速度(M4 Pro) | 下载 / 内存 |
|---|---|---|---|---|
| Parakeet V3 | 25(欧洲语言) | 英语 WER 6.32%;25 种语言平均 12.0% | 35 分钟 18 秒;约为 Whisper Turbo 的 10 倍 | 465 MB / 约 800 MB |
| SenseVoice Small | 6 种可选——英语、简体中文、繁体中文、粤语、日语、韩语 | 专为中日韩粤打造;未参加英语排行榜评测 | 27 分钟中文播客 13.83 秒 | 827 MB / 约 700 MB |
| Whisper Small | 101 | 同样 25 种 FLEURS 语言平均 29.8% | 轻量版 Whisper;仍然慢于 Parakeet | 比 Turbo 小——具体体积见应用内的模型选择器 |
| Whisper Large V3 Turbo | 101 | 英语 WER 7.83% | 同一段 35 分钟音频 3 分钟;约为 Whisper Large V3 的 5 倍 | 约 1.6 GB / 约 1.6 GB |
英语 WER 来自 Open ASR Leaderboard;25 种语言均值来自上文的 FLEURS 表格。速度、下载体积和内存数据来自我们在 Apple M4 Pro 上对 Mac 版的实测——iPhone 上的占用会有所不同。
不确定你的语言在不在列表里?语言支持页上的分引擎表格由应用源码直接生成,逐个引擎列出——“我的语言支持吗、由哪个模型支持”可以直接查到。如果上面的表格把你指向了 Parakeet 之外的模型,每个专精模型也都有各自的实测文章:中日韩粤看 SenseVoice,101 种语言的长尾看 Whisper Large V3 Turbo。
同一套模型,按设备合身:iPhone 与 Mac
有一个差别值得直说,因为它是刻意的设计选择,不是短板。Mac 上——Mac App Store 版和官网下载版(DMG)都一样——四个引擎全都可用:默认的 Parakeet V3,加上 SenseVoice Small、Whisper Small 和 Whisper Large V3 Turbo。
iPhone 版内置 Parakeet V3,另外可以按需下载 Whisper Small 和 SenseVoice Small。Whisper Large V3 Turbo 有意不放进 iPhone:这个模型下载约 1.6 GB,转录时内存占用也差不多同样大,让大多数 iPhone 一直背着它并不现实。与其塞进一个装得上、用起来却让手机很难受的模型,我们更愿意按设备把模型阵容配到合身。
在 iPhone 上你并不会损失语言覆盖:Whisper Small 提供和 Turbo 一样的 101 种语言,占用却只有它的一小部分。你让出的是最难那批语言上的准确率——在手机上这是正确的取舍。如果你需要 Turbo 级别的多语言准确率来处理长音频,就把这件事交给 Mac;官网下载版(DMG)也总是最先拿到新模型和模型更新。
模型选择器:Parakeet V3(默认)、SenseVoice Small、Whisper Small 和 Whisper Large V3 Turbo,全部本地运行
Whisper Notes 中的模型选择器
打开设置即可切换模型:
- Parakeet V3(默认)— 最快,最适合英语和欧洲语言
- SenseVoice Small — 中文、日语、韩语和粤语速度最快
- Whisper Small — 更轻量,覆盖 100+ 种语言
- Whisper Large V3 Turbo — 覆盖 100+ 种语言,准确率更高
所有模型都在你的 Mac 上 100% 本地运行。无需联网,无需云端,数据不会离开你的设备。
每个模型各自的短板
这四个引擎每一个都是取舍,而一条推荐只有说清楚你放弃了什么才算有用。下面是实话版本。
Whisper(两个尺寸都一样)会在静音处产生幻觉。长停顿、环境底噪和空白段落,都可能让它输出重复短语、凭空造句,或者那句著名的"Subtitles by Amara.org"——它的解码器被设计成必须一直吐字,于是静音就被随便填上了东西。Whisper Notes 在转录前会先用 Pyannote 做语音活动检测把静音切掉,这能减少很多,但再多预处理也不能让模型免疫。Whisper Large V3 Turbo 也是应用里最重的选项:下载约 1.6 GB,转录时内存占用也差不多同样大。Whisper Small 是进入 101 种语言最省资源的方式,它的多语言准确率就是代价——上表 25 种语言平均 WER 29.8%,而 Large V3 是 12.6%。
Parakeet V3 有一道 25 种语言的硬天花板。而且全是欧洲语言。这个列表之外没有“打折支持”:喂它日语,你得到的不是差一点的日语,而是用错了工具。中文、日语、韩语、粤语、阿拉伯语、印地语、土耳其语、越南语,一概不支持。在不少单个语言上它也弱于 Whisper Large V3——上文 FLEURS 表里的丹麦语、芬兰语、瑞典语、斯洛文尼亚语和拉脱维亚语——所以“Parakeet 拿下欧洲”是平均值上的结论,不是每一行都成立。至于静音幻觉,它确实少得多,但我们愿意担保的说法是“少得多”,不是“从不”。
SenseVoice Small 是专才,不是通才。六个选项——英语、简体中文、繁体中文、粤语、日语、韩语——再没有别的。在这个范围里它极其出色,出了这个范围就没有意义。它也是应用里最新的引擎,在官网下载版(DMG)1.5.0 中取代了 Qwen3-ASR,Mac App Store 版同样搭载。
还有一些限制是四个模型共有的。Mac 版需要 Apple Silicon 和 macOS 14 及以上——不支持 Intel Mac。模型是在应用内下载的,不随安装包打包,所以第一次用某个引擎要花一次下载和一份磁盘空间。很长的录音需要真实的内存,在老硬件上耗时也会成比例增加。另外这四个模型都不做实时字幕:Whisper Notes 是在录音停止之后转录,不是边说边出字。如果你要的是实时字幕,那不管选哪个模型,这个应用都不对路。
Parakeet V2 怎么样?
如果你之前用过 V2,可能想知道它和 V3 有什么不同。V2 是纯英语模型,英语准确率实际上比 V3 略高(WER 6.05% vs 6.32%)。V3 用这一点点差距换来了 25 种语言的支持。不过两者都比 Whisper 准确得多。
| Parakeet V2 | Parakeet V3 | Whisper Large V3 | |
|---|---|---|---|
| 英语 WER | 6.05% | 6.32% | 7.44% |
| 支持语种 | 仅英语 | 25 | 100+ |
简单来说:如果你只需要英语,V2 和 V3 都很优秀。Whisper Notes 默认使用 V3,因为多语言支持对大多数用户更有价值——英语准确率的差异几乎可以忽略。
WhisperKit 又是什么?
WhisperKit 是 Argmax 为 Apple 设备开发的开源 Swift 框架,运行的是 Whisper 系列模型;Parakeet 则来自 NVIDIA。一个是开发工具,一个是模型家族,不能直接当作同类产品比较。Whisper Notes 把 Parakeet V3、Whisper Large V3 Turbo 和 SenseVoice 做成可直接使用的 Mac 与 iPhone 应用。
想把所有设备端模型放在一起比较,可查看本地语音模型对比;如果想先弄清 Whisper 的型号、运行方式和费用,可从Whisper 转录指南开始。
常见问题
Parakeet V3 比 Whisper 更好吗?
对英语和欧洲语言通常是。在我们的 35 分钟测试里,Parakeet 比 Whisper Turbo 快 10 倍;Open ASR Leaderboard 的英语 WER 为 6.32%,Turbo 为 7.83%。但 Whisper 覆盖 100+ 种语言,Parakeet 只有 25 种。
本地语音转文字模型该选哪个?
按语言来选。英语或欧洲语言:Parakeet V3——英语 WER 6.32%,M4 Pro 上 35 分钟音频 18 秒转完。中文、日语、韩语或粤语:SenseVoice Small——27 分钟中文播客 13.83 秒。其他语言(阿拉伯语、印地语、土耳其语、越南语):Whisper Large V3 Turbo,这里唯一覆盖全部 101 种语言的引擎。老设备或内存吃紧:Whisper Small,同样 101 种语言,占用更小、准确率更低。四个模型在 Whisper Notes 里全部在设备本地运行。
Parakeet V3 支持哪些语言?
它支持 25 种欧洲语言,包括英语、法语、德语、西班牙语、葡萄牙语、意大利语、俄语和乌克兰语。完整列表见上文。
Mac 能运行 Parakeet V3 吗?
可以。Whisper Notes Mac 版把 Parakeet V3 设为默认引擎,在 Apple Silicon 上完全本地运行。
Parakeet V3 会像 Whisper 一样产生幻觉吗?
我们的静音测试中明显更少,但不能承诺从不发生。Parakeet 可以在停顿时输出空白;Whisper 的自回归解码器更容易在静音时生成重复或无关文字。
Parakeet V2 和 V3 该选哪个?
V2 只支持英语,英语 WER 略低;V3 用很小的准确率差异换来 25 种语言支持,因此更适合作为默认模型。
Parakeet V3 支持中文、日语或韩语吗?
不支持。中日韩粤可在 Whisper Notes 中选择 SenseVoice;其他非欧洲语言选择 Whisper。两类引擎都支持 Mac 和 iPhone 离线运行。
iPhone 上能用 Whisper Large V3 Turbo 吗?
不能,这是刻意的设计。iPhone 版内置 Parakeet V3,另外可以按需下载 Whisper Small 和 SenseVoice Small;Whisper Large V3 Turbo 放在 Mac 端——Mac App Store 版和官网下载版(DMG)——因为一个下载约 1.6 GB、转录时内存占用也差不多的模型,对大多数 iPhone 并不现实。通过 Whisper Small,iPhone 依然能用到全部 101 种 Whisper 语言。
长录音用哪个模型最好?
如果你的语言在 Parakeet 的 25 种之内,就用 Parakeet V3;中文、日语、韩语或粤语用 SenseVoice Small。时长越长,速度差距被放得越大——M4 Pro 上 Parakeet 把 35 分钟音频转完只用 18 秒,同一个文件 Whisper Large V3 Turbo 用了 3 分钟。长录音同样吃内存,所以不管选哪个模型,老设备都会更慢。
Parakeet V3 有多大?
6 亿参数。在 Whisper Notes Mac 版中,下载约 465 MB,转写时内存约 800 MB;Whisper Large V3 Turbo 下载和运行内存都约 1.6 GB。
来试试
Parakeet v3 现已在 Mac 版中可用——直接下载最新 DMG 即可体验。(更新:最新版 iOS 已支持 Parakeet。)
有问题或反馈?邮件联系 support@whispernotes.app。