Respuesta directa — ¿Deberías elegir Whisper large-v3 Turbo o Distil-Whisper en 2026? Elige Whisper large-v3 Turbo si dictas en más de un idioma: conserva los 99 idiomas en 809 M de parámetros. Elige Distil-Whisper (distil-large-v3, 756 M) solo para inglés, donde su ficha del modelo reporta una latencia relativa de 6,3x frente a large-v3. Ambos pueden ejecutarse en whisper.cpp. Las diferencias de precisión entre las dos familias son pequeñas; la cobertura de idiomas no lo es.

Elegir el mejor modelo de Whisper en 2026 empieza por una comparación de modelos de voz locales, no por una tabla de tamaños. El large-v3 Turbo de OpenAI y el Distil-Whisper de Hugging Face comprimen ambos el large-v3 de 1.550 M de parámetros a aproximadamente la mitad de su tamaño, y ambos existen por la misma razón: la decodificación era demasiado lenta para un dictado cómodo en tiempo real.

Llegaron hasta ahí por caminos distintos, y esos caminos producen equilibrios realmente diferentes. Esta comparación cubre qué cambia cada modelo a nivel arquitectónico, qué miden realmente las tasas de error de palabras publicadas, cómo se comportan ambos dentro de whisper.cpp, y cuál encaja en un flujo de trabajo de dictado.

Si todavía estás montando el runtime, empieza por nuestra guía de instalación de whisper.cpp.

¿Qué es Whisper large-v3 Turbo?

Whisper large-v3 Turbo es una versión podada y con ajuste fino de large-v3, con 809 M de parámetros. La ficha del modelo de OpenAI la describe como «una versión con ajuste fino de un Whisper large-v3 podado», en la que «el número de capas de decodificación se ha reducido de 32 a 4».

La poda consiste en eliminar componentes enteros de una red ya entrenada — en este caso, 28 de las 32 capas del decodificador — y luego aplicar ajuste fino a lo que queda para que recupere la mayor parte del comportamiento perdido. El codificador, que convierte el audio en una representación interna, permanece intacto.

Esa asimetría es todo el diseño. En Whisper, el codificador se ejecuta una vez por cada ventana de 30 segundos, mientras que el decodificador se ejecuta una vez por cada token generado, así que el decodificador domina la latencia en las transcripciones largas.

Y algo fundamental: Turbo conserva la cabeza multilingüe. La ficha del modelo enumera los mismos 99 idiomas que large-v3, lo que lo convierte en un sustituto directo, y no en una variante especializada.

¿Qué es Distil-Whisper, y por qué es exclusivamente en inglés?

Distil-Whisper es una familia de modelos exclusivamente en inglés, entrenados mediante destilación de conocimiento a partir de Whisper large-v2 y large-v3. La destilación de conocimiento entrena a un modelo «estudiante» más pequeño para reproducir las salidas de un modelo «maestro» más grande, en lugar de aprender únicamente a partir de etiquetas de referencia verificadas.

El artículo de Distil-Whisper (arXiv:2311.00430) reporta un modelo estudiante con «un 51% menos de parámetros» que es «5,8 veces más rápido» mientras se mantiene «dentro de un 1% de WER en datos de prueba fuera de distribución» en un escenario de transferencia zero-shot. Esas cifras describen distil-large-v2.

Al igual que Turbo, Distil-Whisper conserva el codificador: la ficha del modelo señala que «se copia por completo del maestro al estudiante y se congela durante el entrenamiento». El ahorro vuelve a venir de un decodificador drásticamente acortado.

La limitación de idioma no es un descuido, sino una restricción de los datos de entrenamiento. El repositorio de Distil-Whisper indica sin rodeos que la serie «solo está disponible para el reconocimiento de voz en inglés» y recomienda «usar el checkpoint Whisper Turbo» para el trabajo multilingüe.

La familia Distil-Whisper publicada

ModeloParámetrosLatencia relativaWER de forma cortaWER de forma larga
distil-large-v3756 M6,3x9,7%10,8%
distil-large-v2756 M5,8x10,1%11,6%
distil-medium.en394 M6,8x11,1%12,4%
distil-small.en166 M5,6x12,1%12,8%

Cifras publicadas en el repositorio de Distil-Whisper. Los cuatro son exclusivamente en inglés; la latencia es relativa a Whisper large-v3, fijado en 1,0.

Whisper V3 Turbo vs Distil-Whisper: especificaciones lado a lado

Los dos modelos están cerca en tamaño y muy alejados en alcance. Esto es lo que publican las fichas de los modelos oficiales.

AtributoWhisper large-v3large-v3 Turbodistil-large-v3
Parámetros1.550 M809 M756 M
Idiomas9999Solo inglés
Capas de decodificador324Acortadas (codificador congelado)
Factor de velocidad publicadoreferencia baseninguno publicadolatencia relativa de 6,3x
Métodopoda + ajuste finodestilación de conocimiento
Objetivo de descarga en whisper.cpp❌ requiere conversión

Una fila merece atención: OpenAI no publica ningún factor de velocidad numérico para Turbo. La ficha del modelo dice únicamente que «el modelo es mucho más rápido, a costa de una ligera degradación de calidad». Cualquier multiplicador concreto que veas citado para Turbo procede de pruebas de terceros, no de OpenAI.

¿Qué modelo es más preciso en 2026?

Ambos ceden precisión frente a large-v3, y ambos ceden menos de lo que sugeriría su reducción de tamaño. Pero las dos familias publican sus cifras en benchmarks distintos, así que las cifras destacadas no son directamente comparables.

Los resultados de evaluación en las fichas de los modelos de OpenAI reportan una tasa de error de palabras media de 7,83 para large-v3-turbo frente a 7,44 para large-v3 en la suite English Open ASR Leaderboard — una diferencia de aproximadamente 0,4 puntos.

El equipo de Distil-Whisper evalúa en su propia suite en inglés, donde distil-large-v3 registra un 9,7% de WER en forma corta frente al 8,4% de large-v3, y un 10,8% en audio secuencial de forma larga frente al 10,0% de large-v3. En forma larga fragmentada, el modelo destilado incluso se adelanta ligeramente: 10,9% frente a 11,0%.

No restes 7,83 de 9,7. Conjuntos de datos distintos, algoritmos de decodificación distintos y duraciones de audio distintas producen un WER absoluto distinto para el mismo modelo. Cada cifra solo tiene sentido frente a su propia referencia base.

El resumen honesto: en relación con large-v3, Turbo pierde aproximadamente medio punto de WER en el leaderboard en inglés, y distil-large-v3 pierde aproximadamente 1,3 puntos en forma corta y 0,8 puntos en forma larga secuencial en la suite de Distil-Whisper. Para el dictado, ambos se sitúan bien dentro del rango en el que la calidad del micrófono y el ruido de fondo dominan el resultado.

Explicamos cómo leer las cifras de los benchmarks de voz sin sobreinterpretarlas en nuestra comparación de benchmarks entre Voxtral y Whisper.

¿Cuál es el modelo de Whisper más rápido en la práctica?

Para cargas de trabajo exclusivamente en inglés en una máquina local, Distil-Whisper cuenta con la evidencia publicada más sólida. Su ficha del modelo incluye una medición específica para whisper.cpp: «En un benchmark provisional en un Mac M1, distil-large-v3 es más de 5 veces más rápido que Whisper large-v3».

Es una afirmación acotada y reproducible — un runtime concreto, un hardware concreto, una comparación concreta — y es el tipo de cifra que merece confianza. También está etiquetada explícitamente como provisional.

La ventaja de Turbo es más difícil de cuantificar porque OpenAI no ha publicado ninguna cifra. Estructuralmente, recortar el decodificador de 32 capas a 4 elimina el mismo cuello de botella al que apunta Distil-Whisper, así que ambos deberían situarse en un rango bastante similar sobre el mismo hardware.

Tres variables mueven el rendimiento real más que el propio checkpoint:

¿Cómo se comportan ambos modelos dentro de whisper.cpp?

Turbo es más fácil de adoptar. El repositorio de whisper.cpp incluye large-v3-turbo entre sus modelos descargables, junto a los demás checkpoints oficiales, así que obtener el archivo ggml es un único comando.

Distil-Whisper no es uno de esos objetivos de descarga. La ficha del modelo distil-large-v3 documenta cómo ejecutarlo «con el paquete Whisper.cpp usando el algoritmo original de transcripción secuencial de forma larga», lo que implica un paso de conversión antes de tener un archivo ggml utilizable.

Esa diferencia importa más de lo que parece. Un modelo que puedes descargar directamente se mantiene al día con las publicaciones oficiales; un modelo que conviertes tú mismo es un paso que tienes que mantener.

La memoria es la otra restricción práctica. whisper.cpp documenta aproximadamente 3,9 GB para un modelo de clase large, así que un checkpoint de la mitad del tamaño es lo que hace viable el dictado local en una máquina de 8 GB.

¿Qué modelo deberías elegir?

Recorre esta lista y detente en la primera línea que coincida con tu caso.

  1. Dictas en más de un idioma. Elige large-v3 Turbo. Distil-Whisper no puede servirte, y el propio proyecto Distil-Whisper lo reconoce así.
  2. Solo inglés, y la latencia es tu restricción determinante. Elige distil-large-v3, acepta el paso de conversión y valida con tu propio audio.
  3. Solo inglés, y quieres la vía de mantenimiento más sencilla. Elige large-v3 Turbo de todos modos. La cabeza multilingüe no te cuesta nada en tiempo de inferencia.
  4. Precisión ante todo, velocidad en segundo plano. Quédate con el large-v3 completo.
  5. Quieres dictado, no un pipeline de modelos. Usa una aplicación que gestione el checkpoint por ti.

Esa última línea es en la que aterriza la mayoría de la gente. Compilar un runtime, convertir checkpoints y ajustar la cuantización es una tarde genuinamente interesante — y un mal compromiso semanal.

Weesper Neon Flow está construido sobre whisper.cpp, funciona completamente offline sin que ningún audio salga del dispositivo, admite más de 55 idiomas, y usa aceleración Metal en Apple Silicon. Prueba Weesper gratis durante 15 días si prefieres dictar antes que hacer benchmarks.

La conclusión sobre Whisper V3 Turbo vs Distil-Whisper

Estos dos modelos resuelven el mismo problema — un decodificador demasiado lento para el uso en tiempo real — con herramientas distintas, y aterrizan en una clase de tamaño similar: 809 M frente a 756 M de parámetros, ambos aproximadamente la mitad de large-v3.

La diferencia de precisión entre ellos es lo bastante pequeña como para que tu micrófono importe más. La diferencia de idiomas es absoluta: 99 idiomas frente a uno. Para cualquiera cuyo trabajo no sea exclusivamente en inglés, esa única fila decide la comparación antes de que la velocidad entre siquiera en la discusión.

Si quieres ver cómo se comparan estos modelos locales frente a los motores integrados en tu sistema operativo, lee nuestro análisis de el Dictado de Apple frente a OpenAI Whisper.

¿Listo para dictar offline? Instala Weesper Neon Flow en macOS o Windows, o consulta el Centro de ayuda para la configuración inicial y de idiomas.