Whisper Large V3 Turbo vs V3: 5× Mais Rápido no Mac (Benchmark)

6 de novembro de 2024
·
6 min read
·Whisper Notes Team

O Whisper Large-v3 Turbo da OpenAI reduz o decoder de 32 camadas para 4, cortando os parâmetros de 1,55 mil milhões para 809M. Nos nossos testes em Apple Silicon, transcreveu o mesmo áudio cerca de 5× mais depressa com precisão quase idêntica. O Whisper Notes inclui-o no Mac e no iPhone.

Comparação de arquitetura entre o Whisper Large V3 Turbo e o V3

V3 Turbo vs V3: o que mudou

O Turbo não é uma arquitetura nova. É exatamente o mesmo modelo Whisper Large-v3 com o decoder podado de 32 camadas para 4, depois afinado (fine-tuned) para recuperar a precisão. O encoder fica intocado.

Large-v3 Turbo Large-v3
Parâmetros 809M 1,550M
Camadas do decoder 4 32
Idiomas 100+ 100+
Tarefa de tradução Não suportada Suportada
Licença MIT Apache 2.0

Método: o mesmo ficheiro de áudio de 10 minutos foi transcrito na mesma build do Whisper Notes em cada dispositivo indicado. Os tempos são segundos de relógio desde o início da transcrição até ao texto final; entre o V3 e o Turbo, só o modelo mudou.

A tarefa de tradução foi explicitamente excluída dos dados de treino do Turbo. O modelo completo Large-v3 suporta-a, mas o Whisper Notes inclui apenas o Turbo — a tradução é tratada à parte através da Apple Intelligence.

O modelo base: o que é o Whisper Large-v3?

O Whisper Large-v3 é o modelo de reconhecimento de voz open-source de referência da OpenAI, lançado em novembro de 2023. Tem 1,55 mil milhões de parâmetros, usa uma entrada de espetrograma com 128 mel-bins, foi treinado com 5 milhões de horas de áudio (1 milhão com anotação fraca + 4 milhões com pseudo-anotação) e suporta mais de 100 idiomas. No Open ASR Leaderboard da Hugging Face regista uma taxa média de erro por palavra de ~7,4% — o teto de precisão contra o qual o Turbo é medido ao longo deste artigo. Para ver como o Large-v3 se compara com todos os outros modelos locais, consulte a nossa comparação de modelos Whisper.

Benchmark de velocidade: Whisper Notes em Apple Silicon

No Whisper Notes para Mac, o Turbo corre via CoreML no Neural Engine. A processar 10 minutos de áudio:

Dispositivo Whisper V3 V3 Turbo Aceleração
iPhone 15 Pro 425 s 82 s 5.2×
iPad Pro M2 380 s 71 s 5.4×
MacBook Pro M2 316 s 63 s 5.0×

A aceleração de 5× é específica do Whisper Notes em Apple Silicon, onde o decoder mais pequeno beneficia da otimização do Neural Engine. Em GPU, com frameworks como o faster-whisper, a diferença encurta para ~2,7× (ver os benchmarks da comunidade abaixo).

Precisão: comparação de WER

O Open ASR Leaderboard da Hugging Face testa ambos os modelos nos mesmos datasets em inglês. A taxa de erro por palavra (WER) do Turbo fica a menos de meio ponto do V3 em todos os benchmarks:

Dataset WER V3 Turbo WER V3
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
WER médio 7.83% 7.44%

O V3 é ligeiramente mais preciso em todos os datasets, mas a diferença é pequena — 0,39 pontos percentuais em média. Na maioria das transcrições do mundo real, não vai notar a diferença.

Na avaliação de áudio longo do YouTube-commons (um dos maiores benchmarks de ASR open-source), o Turbo obtém 13,40% de WER contra 13,20% do V3 — a funcionar a um fator de tempo real de 129,5× contra 55,3×. Ou seja, 2,3× mais rápido com precisão quase idêntica em áudio do mundo real.

Qual é a precisão do Turbo em coreano, russo e outros idiomas?

Os benchmarks acima são em inglês. Segundo a model card da OpenAI, o decoder podado de 4 camadas do Turbo custa um pouco mais de precisão fora do inglês, com a maior degradação nos idiomas com menos recursos. Em russo e na maioria das línguas europeias, o Turbo mantém-se próximo do Large-v3 completo — e, se usa o Whisper Notes, o Parakeet V3 cobre o russo e outras 24 línguas europeias a 10× a velocidade do Whisper.

Para coreano, japonês, chinês e cantonês, um modelo concebido de propósito é ao mesmo tempo mais rápido e melhor na pontuação: o SenseVoice transcreve CJK a 52× o tempo real. O Whisper Notes inclui o SenseVoice ao lado do Turbo tanto no Mac como no iOS, para que possa escolher o modelo certo para cada idioma em vez de forçar tudo por um só.

Benchmarks da comunidade: GPU e CPU

Benchmarks independentes das comunidades do faster-whisper e do whisper.cpp mostram resultados consistentes em hardware diferente. A transcrever 13 minutos de áudio com o faster-whisper em GPU:

Modelo Precisão Tempo Memória GPU WER
Large-v3 Turbo fp16 19.2 s 2,537 MB 1.92%
Large-v3 fp16 52.0 s 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2,409 MB 2.39%

Fonte: benchmark do faster-whisper em GPU NVIDIA, split de validação clean do LibriSpeech. O Turbo em int8 usa apenas 1,5 GB de VRAM — cabe numa GPU de 2 GB.

A inferência em lote numa RTX 3060 Laptop (6 GB de VRAM, precisão int8) alarga ainda mais a vantagem:

Modelo Sequencial Em lote (10) WER em lote
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Fonte: benchmark de NilaierMusic, Intel i7-12650H + RTX 3060 Laptop de 6 GB, áudio em francês, precisão int8.

Com processamento em lote, o Turbo alcança o melhor WER de todos os modelos testados (7,7%), sendo ao mesmo tempo o mais rápido. É o ponto ideal claro para uso em produção.

Turbo vs Medium vs todos os tamanhos do Whisper

Antes do Turbo, o Medium era o compromisso habitual: precisão aceitável a uma velocidade tolerável. O Turbo torna essa troca obsoleta — com 809M de parâmetros, é pouco maior do que o Medium (769M) e, ainda assim, oferece precisão de classe large a várias vezes a velocidade. Eis a família completa de modelos lado a lado:

Modelo Parâmetros Tamanho em disco Velocidade relativa Nível de precisão
tiny 39M ~75 MB ~10× O mais baixo
base 74M ~142 MB ~7× Baixo
small 244M ~466 MB ~4× Moderado
medium 769M ~1,5 GB ~2× Alto
large-v3 1,550M ~2,9 GB 1× (referência) O mais alto
large-v3-turbo 809M ~1,6 GB ~5× em Apple Silicon Quase o mais alto

Lançado a 30 de setembro de 2024, o Turbo tem 809M de parâmetros. Se escolhia o Medium para poupar espaço em disco ou ganhar velocidade, o Turbo supera-o agora em precisão e em velocidade com praticamente a mesma pegada.

Limitações conhecidas (e como o Whisper Notes as resolve)

Sem tradução integrada

O Turbo foi treinado sem dados de tradução. Transcreve apenas no idioma de origem — ao contrário do Large-v3, que suporta tradução de áudio para inglês.

Whisper Notes — a Apple Intelligence traduz automaticamente as transcrições para o idioma que escolher, dando-lhe saída bilingue independentemente do modelo que usar.

Mais alucinações em áudio com ruído

Relatos da comunidade indicam que o Turbo alucina mais do que o V3 em clips muito curtos ou gravações com ruído. É expectável dado o decoder reduzido (4 camadas vs 32).

Whisper Notes — executa o Pyannote VAD antes da transcrição, detetando os segmentos de fala e eliminando silêncio/ruído para que o modelo processe apenas voz real.

Que modelo deve usar?

Inglês / línguas europeias Parakeet V3 — 10× mais rápido do que o Whisper, melhor precisão
Chinês / Japonês / Coreano SenseVoice — concebido para CJK, velocidade 52×
Outros idiomas Whisper Large V3 Turbo — mais de 100 idiomas, alta precisão, mais lento

Perguntas frequentes sobre o Whisper Large-v3 Turbo

Qual é a diferença entre o Whisper Large-v3 e o Large-v3 Turbo?

O Large-v3 Turbo mantém o encoder do Large-v3, mas reduz o decoder de 32 camadas para 4. É por isso que é muito mais rápido, mantendo-se próximo da precisão do Large-v3 na transcrição. A contrapartida é que o Turbo não suporta a tarefa de tradução integrada do Whisper.

O faster-whisper suporta o Large-v3 Turbo?

Sim. O faster-whisper suporta o Large-v3 Turbo através de conversões CTranslate2, e os benchmarks da comunidade mostram que o Turbo é uma escolha forte quando a VRAM é limitada. No benchmark acima, o Turbo em int8 usou cerca de 1,5 GB de VRAM.

O whisper.cpp suporta o Large-v3 Turbo?

Sim. O whisper.cpp consegue executar versões convertidas para GGML/GGUF do Whisper Large-v3 Turbo. Se está a montar o seu próprio pipeline de transcrição local, o Turbo cabe muitas vezes em hardware de consumo com mais facilidade do que o Large-v3 completo.

Onde posso descarregar o openai/whisper-large-v3-turbo?

Os pesos oficiais do modelo estão disponíveis na Hugging Face, publicados pela OpenAI. Os utilizadores do Whisper Notes não precisam de os descarregar manualmente: a aplicação para Mac trata da configuração do modelo local diretamente na interface.

A comparar todas as opções locais? Todos os modelos de voz para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper. Novo no Whisper? Comece pelo Guia de Transcrição com Whisper — o que é o modelo, todas as formas de o executar e quanto custa.