Whisper Large V3 Turbo vs V3: 5× Más Rápido en Mac (Benchmark)

6 de noviembre de 2024
·
6 min read
·Whisper Notes Team

El Whisper Large-v3 Turbo de OpenAI recorta el decoder de 32 capas a 4, reduciendo los parámetros de 1.550 millones a 809 millones. En nuestras pruebas con Apple Silicon transcribió el mismo audio unas 5× más rápido con una precisión casi idéntica. Whisper Notes lo incluye en Mac y iPhone.

Comparación de arquitectura entre Whisper Large V3 Turbo y V3

V3 Turbo vs V3: qué cambió

Turbo no es una arquitectura nueva. Es exactamente el mismo modelo Whisper Large-v3 con el decoder podado de 32 capas a 4, ajustado después (fine-tuning) para recuperar precisión. El encoder queda intacto.

Large-v3 Turbo Large-v3
Parámetros 809M 1,550M
Capas del decoder 4 32
Idiomas 100+ 100+
Tarea de traducción No soportada Soportada
Licencia MIT Apache 2.0

Método: el mismo archivo de audio de 10 minutos se transcribió con la misma build de Whisper Notes en cada dispositivo indicado. Los tiempos son segundos de reloj desde que arranca la transcripción hasta el texto final; entre V3 y Turbo solo cambió el modelo.

La tarea de traducción se excluyó explícitamente de los datos de entrenamiento de Turbo. El modelo completo Large-v3 la admite, pero Whisper Notes solo incluye Turbo — la traducción se gestiona por separado mediante Apple Intelligence.

El modelo base: ¿qué es Whisper Large-v3?

Whisper Large-v3 es el modelo insignia de reconocimiento de voz de código abierto de OpenAI, publicado en noviembre de 2023. Tiene 1.550 millones de parámetros, usa una entrada de espectrograma de 128 mel-bins, se entrenó con 5 millones de horas de audio (1 millón con etiquetas débiles + 4 millones con pseudoetiquetas) y admite más de 100 idiomas. En el Open ASR Leaderboard de Hugging Face promedia una tasa de error por palabra de ~7,4 % — el techo de precisión contra el que se mide Turbo a lo largo de este artículo. Para ver cómo queda Large-v3 frente al resto de modelos locales, consulta nuestra comparativa de modelos Whisper.

Benchmark de velocidad: Whisper Notes en Apple Silicon

En Whisper Notes para Mac, Turbo se ejecuta vía CoreML en el Neural Engine. Procesando 10 minutos de audio:

Dispositivo Whisper V3 V3 Turbo Aceleración
iPhone 15 Pro 425 s 82 s 5.2×
iPad Pro M2 380 s 71 s 5.4×
MacBook Pro M2 316 s 63 s 5.0×

La aceleración de 5× es específica de Whisper Notes en Apple Silicon, donde el decoder más pequeño se beneficia de la optimización del Neural Engine. En GPU con frameworks como faster-whisper, la diferencia se reduce a ~2,7× (ver los benchmarks de la comunidad más abajo).

Precisión: comparación de WER

El Open ASR Leaderboard de Hugging Face evalúa ambos modelos con los mismos datasets en inglés. La tasa de error por palabra (WER) de Turbo queda a menos de medio punto de V3 en todos los benchmarks:

Dataset WER V3 Turbo WER V3
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
WER promedio 7.83% 7.44%

V3 es ligeramente más preciso en todos los datasets, pero la diferencia es pequeña — 0,39 puntos porcentuales de media. En la mayoría de las transcripciones del mundo real no notarás la diferencia.

En la evaluación de audio largo de YouTube-commons (uno de los mayores benchmarks ASR de código abierto), Turbo obtiene un WER del 13,40 % frente al 13,20 % de V3 — funcionando a un factor de tiempo real de 129,5× frente a 55,3×. Es decir, 2,3× más rápido con una precisión casi idéntica en audio real.

¿Qué precisión tiene Turbo en coreano, ruso y otros idiomas?

Los benchmarks anteriores son en inglés. Según la model card de OpenAI, el decoder podado de 4 capas de Turbo pierde algo más de precisión fuera del inglés, con la mayor degradación en idiomas con menos recursos. En ruso y en la mayoría de las lenguas europeas, Turbo se mantiene cerca del Large-v3 completo — y si usas Whisper Notes, Parakeet V3 cubre el ruso y otros 24 idiomas europeos a 10× la velocidad de Whisper.

Para coreano, japonés, chino y cantonés, un modelo específico es a la vez más rápido y puntúa mejor: SenseVoice transcribe CJK a 52× tiempo real. Whisper Notes incluye SenseVoice junto a Turbo tanto en Mac como en iOS, así que puedes elegir el modelo adecuado para cada idioma en lugar de forzarlo todo por uno solo.

Benchmarks de la comunidad: GPU y CPU

Los benchmarks independientes de las comunidades de faster-whisper y whisper.cpp muestran resultados consistentes en hardware distinto. Transcribiendo 13 minutos de audio con faster-whisper en GPU:

Modelo Precisión Tiempo Memoria GPU WER
Large-v3 Turbo fp16 19.2 s 2,537 MB 1.92%
Large-v3 fp16 52.0 s 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2,409 MB 2.39%

Fuente: benchmark de faster-whisper en GPU NVIDIA, split de validación clean de LibriSpeech. Turbo en int8 usa solo 1,5 GB de VRAM — cabe en una GPU de 2 GB.

La inferencia por lotes en una RTX 3060 Laptop (6 GB de VRAM, precisión int8) amplía aún más la ventaja:

Modelo Secuencial Por lotes (10) WER por lotes
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Fuente: benchmark de NilaierMusic, Intel i7-12650H + RTX 3060 Laptop de 6 GB, audio en francés, precisión int8.

Con procesamiento por lotes, Turbo logra el mejor WER de todos los modelos probados (7,7 %) siendo al mismo tiempo el más rápido. Es el punto óptimo claro para uso en producción.

Turbo vs Medium vs todos los tamaños de Whisper

Antes de Turbo, Medium era el compromiso habitual: precisión aceptable a una velocidad tolerable. Turbo deja ese dilema obsoleto — con 809M de parámetros apenas supera a Medium (769M) y, aun así, ofrece precisión de clase large a varias veces su velocidad. Aquí tienes toda la familia de modelos lado a lado:

Modelo Parámetros Tamaño en disco Velocidad relativa Nivel de precisión
tiny 39M ~75 MB ~10× El más bajo
base 74M ~142 MB ~7× Bajo
small 244M ~466 MB ~4× Moderado
medium 769M ~1,5 GB ~2× Alto
large-v3 1,550M ~2,9 GB 1× (línea base) El más alto
large-v3-turbo 809M ~1,6 GB ~5× en Apple Silicon Casi el más alto

Lanzado el 30 de septiembre de 2024, Turbo tiene 809M de parámetros. Si elegías Medium para ahorrar espacio en disco o ganar velocidad, Turbo ahora lo supera en precisión y en velocidad con prácticamente la misma huella.

Limitaciones conocidas (y cómo las maneja Whisper Notes)

Sin traducción integrada

Turbo se entrenó sin datos de traducción. Solo transcribe en el idioma original — a diferencia de Large-v3, que admite traducción de audio a inglés.

Whisper Notes — Apple Intelligence traduce automáticamente las transcripciones al idioma que elijas, dándote salida bilingüe sin importar qué modelo uses.

Más alucinaciones con audio ruidoso

Los reportes de la comunidad indican que Turbo alucina más que V3 en clips muy cortos o grabaciones con ruido. Es esperable dado el decoder reducido (4 capas frente a 32).

Whisper Notes — ejecuta Pyannote VAD antes de la transcripción: detecta los segmentos con voz y elimina silencio y ruido para que el modelo solo procese voz real.

¿Qué modelo deberías usar?

Inglés / lenguas europeas Parakeet V3 — 10× más rápido que Whisper, mejor precisión
Chino / japonés / coreano SenseVoice — diseñado para CJK, velocidad 52×
Otros idiomas Whisper Large V3 Turbo — más de 100 idiomas, alta precisión, más lento

Preguntas frecuentes sobre Whisper Large-v3 Turbo

¿Cuál es la diferencia entre Whisper Large-v3 y Large-v3 Turbo?

Large-v3 Turbo conserva el encoder de Large-v3 pero reduce el decoder de 32 capas a 4. Por eso es mucho más rápido manteniéndose cerca de la precisión de Large-v3 en transcripción. La contrapartida es que Turbo no admite la tarea de traducción integrada de Whisper.

¿faster-whisper es compatible con Large-v3 Turbo?

Sí. faster-whisper soporta Large-v3 Turbo mediante conversiones a CTranslate2, y los benchmarks de la comunidad muestran que Turbo es una opción muy sólida cuando la VRAM es limitada. En el benchmark de arriba, Turbo en int8 usó alrededor de 1,5 GB de VRAM.

¿whisper.cpp es compatible con Large-v3 Turbo?

Sí. whisper.cpp puede ejecutar versiones convertidas a GGML/GGUF de Whisper Large-v3 Turbo. Si estás montando tu propio pipeline de transcripción local, Turbo suele caber en hardware de consumo con más facilidad que el Large-v3 completo.

¿Dónde puedo descargar openai/whisper-large-v3-turbo?

Los pesos oficiales del modelo están disponibles en Hugging Face, publicados por OpenAI. Los usuarios de Whisper Notes no necesitan descargarlos a mano: la app de Mac gestiona la configuración del modelo local desde la propia interfaz.

¿Comparando todas las opciones locales? Todos los modelos de voz a texto en el dispositivo — las variantes de Whisper, Parakeet V3, SenseVoice y Voxtral — están comparados lado a lado en nuestra página de comparación de modelos Whisper. ¿Nuevo con Whisper? Empieza por la guía de transcripción con Whisper — qué es el modelo, todas las formas de ejecutarlo y cuánto cuesta.