录音不会离开这台设备
大多数打着 Whisper 名号的应用,是把你的音频传到服务器上跑模型。Whisper Notes 在你的 iPhone 或 Mac 上跑——这个做法开发起来更难,但要解释清楚就简单多了。
为什么要把模型放在设备上跑?
每个转录应用在做别的决定之前,都先做了一个决定:音频在哪里被处理。传到服务器上是更容易的做法,而且能用上最大的模型,那些模型到今天仍然稍微更准一些。让模型在手机或笔记本上跑要难做得多,但换来的是:录音没有地方可去。
我们选了后者,理由比"保护隐私"这种口号要具体。声音是生物特征,密码泄露了可以改,声音不行。音频一旦落在别人的基础设施上,它就同时受制于对方的泄露记录、留存策略,以及条款里关于训练数据的那几行——这三件事只要文件还在,你就得一直盯着。
Whisper Notes 把 Whisper Large V3 Turbo、Parakeet V3 或 SenseVoice 跑在你设备的神经网络引擎上,链路里根本没有转录服务器。没有队列,没有上传,开飞行模式和连着 Wi-Fi 是一样的。最后这一条,与其信我们,不如你自己试一下。
免费的 Whisper 应用,代价是什么?
一个不收钱的转录工具,通常是这样运转的:音频传到服务器,模型在那边跑,录音留存的时间足够长,长到对运营方有用。对很多人来说这笔交换是划算的。只是值得知道,你确实做了这笔交换。
为什么录音和密码不是一回事
密码泄露只是麻烦一下午,因为你可以改掉它。声音泄露是永久的,因为用来识别你的东西就是声音本身,而几秒钟的音频,携带的声学特征已经足够在别处把你认出来。
最近变了的,是攻击者需要的音频变得很少。把一个人的声音克隆到能骗过人,现在只要几秒钟的样本,而不再是几分钟。2025 年就有人用克隆的意大利国防部长的声音,向几位商人行骗。我们不是说这大概率会发生在你身上,只是想指出:这是唯一一类泄露之后你没法更换的数据。
所以音频送去转录服务时,被存下来的不是一份文档,而是一段生物特征——存在一个留存策略不由你定的地方。
转录数据到底是怎么泄露的
出事的方式很少是那种戏剧性的入侵。真实情况是,音频和转录稿经过的系统,比任何架构图上画的都多:转录服务商、它背后的模型提供方、一层日志、一条分析管线、一份备份。每一处都可能因为一个配置错误就把私密变成公开;环节越多,越没有人能说清某一份录音此刻究竟在哪。
医疗行业给出了最清楚的例子——受保护的健康信息通过转录集成和配置错误的存储泄露出去,而不是因为什么称得上"攻击"的事。客服中心给出了另一个:转录稿流向模型,账号却没打码就进了调试日志。
这些都不是在说云端转录很鲁莽。它们说的是:该数的是"有多少个系统各存了一份",而设备端处理把这个数字压到了 1。
风往哪边吹?
2025 年 3 月,亚马逊把 Echo 上的"不发送语音录音"这个开关取消了。此后对 Alexa 说的每一句话都会送到亚马逊的服务器,也不再有关掉它的地方。
一个产品去掉一个开关算不上趋势,但背后的动机是长期存在的:训练数据有价值,而一个会减少数据收集量的开关,就永远处在商业压力之下。隐私设置本质上是一个承诺,而承诺可以在某一版发布说明里被改写。
Whisper Notes 的做法是让这种开关根本不存在。没有服务器可以发送音频,所以"不要发送"不是我们在遵守的一项偏好设置,而是对这个应用能力边界的描述。
免费工具三年下来花多少
不收钱的网页工具,一般都在条款里保留了"用你的音频改进模型"的权利,而那份条款几乎没人读。按分钟计费的 API 看起来很便宜,$0.006 到 $0.40 一分钟,直到你每周转一小时的音频,一年的账单就到了几百美元。订阅制反而是这套安排里最诚实的版本:Otter 一年大约 $99,而且它明说了。
Whisper Notes 是 App Store $7.99、官网直下 Mac 版 $14,都只付一次。下面这张表就是全部的价格论证,而重点在第四行:免费那个选项和付一次那个选项,三年下来花的钱差不多,区别在于录音去了哪。
每年成本
| 服务类型 | 第1年 | 第2年 | 第3年 | 数据处理 |
|---|---|---|---|---|
| Whisper Notes | $7.99 | $0 | $0 | 永不离开设备 |
| 订阅服务 | $99 | $99 | $99 | 云端处理 |
| 按分钟云API | $120-480 | $120-480 | $120-480 | 云端处理 |
| "免费"网页工具 | $0 | $0 | $0 | 用于AI训练 |
什么情况下你该去用云服务
在干净音频上,云端的大模型确实还要更准一些,因为它们跑在任何手机和笔记本都装不下的尺寸上;它们也能做到边说边出字幕,这一点设备端目前还追不上。这些是真实的优势,我们不打算装作看不见。
如果你需要实时字幕,或者要几个人在会议进行中同时改同一份转录稿,又或者最后那一点点准确率比"音频存在哪"更重要,那云服务就是更合适的工具,我们宁愿你去用。
我们想反驳的只是一件事:不要把准确率的差距当成决策里唯一的数字。做的是有保密义务的活——病历、涉密材料、对消息源的采访——"音频去了哪"是你必须能回答的问题,而最经得起追问的答案,是它哪儿也没去。
浏览器工具、云 API,还是原生应用?
搜"Whisper app",返回的是三种顶着同一个名字、行为却相当不同的东西:在浏览器标签页里跑模型的网页、把模型跑在别人服务器上的 API,以及为你手上这台设备编译的应用。它们的差别大到——先看它属于哪一类,比看功能列表更有用。
浏览器工具
网页工具说自己"本地处理",这通常是真的:音频确实留在标签页里。限制不在于它诚不诚实,而在于一个标签页能做什么。多数浏览器的 WebAssembly 内存上限在 4GB 左右,这就给模型大小封了顶;而通过 JavaScript 做推理,要付出原生代码不必付的速度代价。
真正会让人卡住的限制更具体、也更烦人:你一切到别的应用,它就没法继续跑;硬件加速就算能用也用得别扭;不小心关掉标签页,这一趟就白跑了,没有可续的地方。拿来试模型很合适,拿来存工作就很折磨。
| 处理 | 浏览器中的WebAssembly/TensorFlow.js |
| 模型大小 | 受浏览器内存限制(~4GB) |
| 速度 | 因JavaScript开销而较慢 |
| 隐私 | 比云端好,但浏览器可访问 |
| 可靠性 | 标签页可能崩溃,无后台处理 |
原生应用
Whisper Notes 是为 macOS 和 iOS 编译的,直接跟神经网络引擎打交道——就是驱动 Face ID 和计算摄影的那块专用芯片。这一页上的速度数字之所以可能,全靠它:在 M4 Pro 上,Parakeet V3 处理完 35 分钟的音频大约要 18 秒。
剩下的差别不好看,但更影响日常。你切到别的应用,转录还在跑;被打断之后,它能干净地接上;操作系统的沙盒把它挡在其他应用的数据之外。你的录音和转录文字没有上传通道,这一条你花三十秒就能自己验证:打开飞行模式,转一个文件试试。
| 处理 | 直接访问Apple神经引擎 |
| 模型大小 | 完整Whisper Large V3 Turbo(1.2GB) |
| 速度 | Apple Silicon上最高10倍实时 |
| 隐私 | 沙盒化,无网络权限 |
| 可靠性 | 后台处理,系统集成 |
云 API
服务器资源基本没有上限,所以云 API 能跑最大的模型,也能做那些吃算力的功能,实时字幕就是其中之一。在干净音频上,它会是这一页里最准的那个选项。
你让渡的是"知道录音在哪"。它要过公网,在一台不归你管的机器上被处理,按一份不是你写的、而且可以不通知你就改的留存策略保存着。
对有保密义务的心理咨询师、经手涉密材料的律师、要保护消息源的记者来说,评估通常到这里就结束了——不是因为准确率不好,而是因为"你能告诉我这段录音现在在哪吗"这个问题没有好答案。
| 处理 | 远程服务器(无限计算) |
| 模型大小 | 最大可用模型 |
| 速度 | 取决于网络和服务器队列 |
| 隐私 | 音频上传并可能被存储 |
| 可靠性 | 需要网络,受速率限制 |
这样做,我们放弃了什么
做成原生应用,是让隐私这件事从"合同承诺"变成"结构约束"的唯一办法。"先本地处理再同步"和"传输过程加密"都是真话,但这两种系统最后仍然留着你音频的一份副本;我们想要的是那个没有副本可留的版本。
代价体现在功能上。我们做不到边录边出字幕,因为能把这件事做好的模型装不进手机。我们跑不了比你设备容量更大的模型。我们也提供不了多人协同编辑或团队工作区,因为那些都需要一台服务器,而我们没有。
这三件事里只要有一件在你的清单上,那这就不是合适的应用,某个云服务才是。与其让你买完才发现,不如现在就写在这里。
技术基础:OpenAI Whisper Large V3 Turbo
顶尖离线语音转文字
技术规格
| 离线AI模型 | Whisper Large V3 Turbo、Parakeet V3(默认)、SenseVoice |
| 支持语言 | 100+ 种语言,包括技术术语 |
| 音频格式 | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| 处理速度 | 在现代设备上可达实时的10倍速度 |
| 文件大小限制 | 无人为限制(取决于设备内存) |
| 平台 | iOS 18+, macOS 11+(针对Apple Silicon优化) |
核心功能和能力
Whisper Notes提供了为专业用例设计的全面转录功能套件。
离线文件导入
导入音频文件或完成的录音进行高精度离线AI转录。这个离线语音转文字应用使用完整上下文分析处理文件,与在线语音转文字服务相比提供卓越的结果。
- ✓从各种来源导入音频文件(文件、语音备忘录等)
- ✓先录制音频,然后转录以获得最佳准确性
- ✓在使用其他应用时后台离线语音转文字处理
- ✓自动文件组织和转录管理
高级导出选项
为不同用例量身定制的专业级输出格式,从简单文本文档到视频内容的字幕文件。
- ✓可自定义格式的纯文本
- ✓用于视频的SRT和VTT字幕文件
- ✓带时间戳的转录用于参考
- ✓说话者识别和标记
- ✓自定义段落分割
隐私保护:真正的离线语音转文字处理
强大数据安全措施确保敏感信息在整个离线AI转录过程中受到保护。
- ✓完全离线语音转文字处理(无数据传输)
- ✓链路里没有第三方数据处理者:医疗、法律和商务场景的私密转录
- ✓所有离线AI转录的加密本地存储
- ✓无云依赖离线转录软件
- ✓企业离线语音转文字环境的审计追踪
到底有多准,这个数字是哪来的?
公开基准,加上我们自己在指名机器上的实测
我们不做自家的准确率测试——厂商给自己判卷,没什么参考价值。下面的词错误率来自 Hugging Face Open ASR Leaderboard 和 FLEURS 基准,两个都是公开的,也都由跟这款应用没有利害关系的人在维护。速度数字是我们自己测的,机器型号写在下面。
各模型的词错误率
| 模型 | 来源 | 错误率 | 说明 |
|---|---|---|---|
| Parakeet V3(Mac 默认) | Open ASR Leaderboard | 英语 WER 6.32% | 覆盖 25 种欧洲语言;在 FLEURS 上这 25 种平均 12.0% |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 英语 WER 7.83% | 三者中覆盖最广:约 100 种语言 |
| Whisper Large V3(完整版) | Open ASR Leaderboard | 英语 WER 7.44% | 参照点;Turbo 用一点准确率换了速度 |
| SenseVoice Small | 我们自测,M4 Pro | 27 分钟播客 13.83 秒 | 专为中文、日语、韩语和粤语打造 |
Key Findings
- •Parakeet V3 在 M4 Pro 上把 35 分钟音频转完只要 18 秒;同一个文件 Whisper Turbo 要三分钟左右
- •在英语上,三个模型之间的词错误率差距不到两个百分点
- •这些数字测的是朗读和有准备的讲话。你自己的录音会更差,而且麦克风和几个人抢话对结果的影响,比选哪个模型大得多
在干净音频上,云端大模型仍然领先一点点,因为它们跑在任何手机和笔记本都装不下的尺寸上。这段差距就是「音频永远不离开设备」的代价。如果你的活儿不需要最后那一个百分点,这笔交换通常值。如果需要,那老实说你该用云端服务。
离线语音转文字市场分析
Whisper Notes应用与其他离线转录软件的比较
离线语音转文字市场包括云服务、内置设备功能和专业离线转录软件。Whisper Notes应用通过将专业级离线AI转录与使用Whisper Large V3 Turbo的完全离线操作相结合,占据了独特地位。
离线语音转文字比较:Whisper Notes与替代方案
| 功能 | Whisper Notes应用 | 云服务 | 内置工具 | 企业软件 |
|---|---|---|---|---|
| 离线语音转文字准确性 | 6.3-7.8% WER | 95-98%(仅在线) | 75-85%(有限) | 90-95%(昂贵) |
| 离线AI转录隐私 | 完全离线处理 | 数据传输到云端 | 混合方法 | 本地部署选项 |
| 成本结构 | $7.99一次性购买 | $0.006-0.40/分钟 | 免费(有限) | $500-2000/许可证 |
| 语言支持 | 100+ 种语言 | 50-100种语言 | 10-30种语言 | 20-50种语言 |
| 文件大小限制 | 硬件限制 | 通常1-2小时 | 5-10分钟 | 各异 |
| 需要互联网 | 否 | 是 | 有时 | 本地部署:否 |
Market Position: Whisper Notes应用通过在消费者友好的包装中提供专业级离线AI转录功能,填补了离线语音转文字市场的关键空白,具有传统在线语音转文字服务无法匹配的隐私保证。
专业离线语音转文字用例
不同部门的现实离线AI转录应用
医疗保健:医疗实践的离线语音转文字
链路里没有第三方数据处理者:医疗、法律和商务场景的私密转录
Use Cases
- •患者咨询文档
- •医疗程序记录和观察
- •研究访谈转录
- •远程医疗会话记录
- •医疗培训和教育内容
Benefits
- ✓链路里没有第三方数据处理者:医疗、法律和商务场景的私密转录
- ✓可自定义词库,收录临床术语和药品名
- ✓与现有EMR工作流程的离线转录集成
- ✓通过离线AI转录减少60-70%的文档时间
法律:执法部门的离线AI转录
法律专业人员利用Whisper Notes离线语音转文字应用进行证词、客户访谈和案件准备,同时通过离线转录维护律师-客户特权。
Use Cases
- •客户访谈文档
- •证词和听证会转录
- •案件研究和准备记录
- •法律程序记录
- •调查访谈转录
Benefits
- ✓律师-客户特权保护
- ✓可自定义词库,收录案件名称和法律术语
- ✓离线AI转录的法庭就绪转录格式
- ✓相比专业在线转录服务显著降低成本
商业:企业离线语音转文字解决方案
企业使用Whisper Notes离线转录软件进行会议文档、培训材料和内部沟通转录,具有完整的数据安全性。
Use Cases
- •董事会会议和高管会议记录
- •培训会议文档
- •客户访谈分析
- •产品开发讨论
- •内部播客和视频内容
Benefits
- ✓通过离线AI转录实现企业数据安全合规
- ✓全球团队的多语言离线语音转文字支持
- ✓部门间离线转录的成本效益扩展
- ✓与现有商业工具的离线语音转文字集成
离线语音转文字性能和限制
离线AI转录能力和约束的透明分析
离线AI转录性能指标
Whisper Notes离线语音转文字应用在不同设备配置和离线转录场景中表现出一致的性能。
离线语音转文字处理速度
iPhone 15 Pro使用离线AI转录处理1小时音频大约需要6-8分钟
在Apple Silicon上比实时离线转录快10倍
电池使用
转录1小时音频大约消耗8-12%的电池
针对Apple的神经引擎优化
离线转录存储需求
应用大小:1.2GB(包括Whisper Large V3 Turbo模型),每次离线语音转文字转录的额外存储最少
压缩离线AI转录输出:每小时音频约0.1MB
内存使用
在支持的设备上处理期间峰值RAM使用:2-3GB
建议最少4GB RAM以获得最佳性能
当前离线语音转文字限制
像任何离线转录软件一样,Whisper Notes应用在选择离线AI转录解决方案时有用户应该了解的特定约束。
设备兼容性
需要具有足够处理能力的相对现代的Apple设备
Impact: 可能无法在超过3-4年的设备上运行
离线AI转录处理时间
虽然离线语音转文字速度很快,但对于非常长的录音仍需要大量时间
Impact: 4小时以上的录音可能需要30-40分钟完成离线转录
音频质量依赖
在音频质量很差或极端背景噪音的情况下性能会下降
Impact: 在具有挑战性的声学环境中准确性可能降至70-80%
语言混合
在单个录音中快速切换语言时表现困难
Impact: 在整个录音中使用一致语言时效果最佳
那么,这个应用适合谁?
离线 AI 转录 - 仅需 $7.99
设备端。零上传。零订阅。
$7.99 买断 • 零订阅 • 无限 • 零上传