Respuesta directa — ¿Parakeet o Whisper es mejor para transcribir archivos? En precisión, Parakeet va ligeramente por delante en ambos tracks en inglés del Open ASR Leaderboard 2026: una tasa de error de palabra media de 6,32% frente a 7,44% de Whisper large-v3 en clips de forma corta, y 10,7% frente a 11,2% en grabaciones de forma larga. En los cinco idiomas europeos en los que se comparan ambos modelos, empatan en 4,81%. La diferencia decisiva es la cobertura: Whisper cubre 99 idiomas, Parakeet 25.

Todas las comparativas de parakeet vs whisper transcripción publicadas este año citan el mismo titular: el modelo de NVIDIA es más preciso y muchísimo más rápido que el de OpenAI. Esa afirmación se sostiene — y resuelve mucho menos de lo que parece resolver.

El artículo del Open ASR Leaderboard que hay detrás ejecuta varios tracks independientes, y la brecha de precisión parakeet vs whisper se comporta de forma distinta en cada uno. Léelos todos y la decisión para un archivo real deja de depender por completo del primer decimal.

Esta guía los presenta en el orden que importa a la hora de elegir el mejor modelo de transcripción local 2026 para entrevistas, clases y archivos de vídeo: qué es cada modelo, qué mide la brecha de forma corta, qué le ocurre en grabaciones de una hora, dónde la cobertura de idiomas traza una línea infranqueable, y qué sobrevive cuando el modelo abandona una GPU de centro de datos y pasa a tu Mac.

¿Qué son Parakeet y Whisper, y en qué se diferencian?

Dos familias de modelos de reconocimiento de voz abiertos, construidas sobre arquitecturas distintas para prioridades distintas. Ninguna es un producto — ambas son pesos que ejecutas dentro de otra cosa.

Parakeet TDT 0.6B v3 es el modelo multilingüe de NVIDIA, descrito en su ficha como un sistema de 600 millones de parámetros con arquitectura FastConformer-TDT, publicado bajo licencia CC-BY-4.0. TDT significa token-and-duration transducer: en lugar de puntuar cada fotograma de audio, el decodificador predice cuánto puede avanzar de golpe, y de ahí viene su rendimiento.

Whisper large-v3 es el transformer encoder-decoder de OpenAI, entrenado con lo que su ficha llama «1 millón de horas de audio débilmente etiquetado y 4 millones de horas de audio pseudoetiquetado recopilado con Whisper large-v2», y del que se reporta una «reducción de errores del 10% al 20% en comparación con Whisper large-v2».

Whisper large-v3-turbo es la variante que la mayoría de las apps de Mac realmente incluyen. Su ficha es directa sobre el compromiso: «es exactamente el mismo modelo, salvo que el número de capas de decodificación se ha reducido de 32 a 4», así que «el modelo es mucho más rápido, a costa de una degradación de calidad menor».

Parakeet TDT 0.6B v3Whisper large-v3Whisper large-v3-turbo
EditorNVIDIAOpenAIOpenAI
ArquitecturaFastConformer-TDTTransformer encoder-decoderEl mismo, decodificador reducido a 4 capas
Parámetros600 millones1.550 M809 M
Idiomas25 (todos europeos)9999
Puntuación y mayúsculasAutomáticaAutomáticaAutomática
Marcas de tiempoA nivel de palabra y de segmentoA nivel de segmento y de palabraA nivel de segmento y de palabra
Licencia indicada en la fichaCC-BY-4.0Apache 2.0MIT

¿Supera Parakeet a Whisper en precisión?

En el track de forma corta en inglés, sí, por 1,12 puntos. El artículo del Open ASR Leaderboard — que compara 86 sistemas de código abierto y propietarios en 12 datasets — reporta una tasa de error de palabra media de 6,32% para Parakeet TDT 0.6B v3 frente a 7,44% para Whisper large-v3.

El contexto importa más que la brecha. Esa media se calcula sobre los datasets de forma corta en inglés del leaderboard — incluidos AMI, GigaSpeech, LibriSpeech clean y other, SPGISpeech, VoxPopuli y un subconjunto de cinco horas de Earnings22 — que son en su mayoría clips pre-segmentados y no grabaciones continuas de una hora.

Las cifras de velocidad provienen de la misma ejecución. El factor de tiempo real inverso, definido en el artículo como la duración total del audio dividida entre el tiempo de transcripción, se midió en una GPU NVIDIA A100-SXM4-80GB con un batch size de 64.

Track de forma corta en inglésWER mediaRTFx (A100, batch 64)
NVIDIA Parakeet TDT 0.6B v26,05%3.390
NVIDIA Parakeet TDT 0.6B v36,32%3.330
NVIDIA Parakeet CTC 1.1B7,40%2.730
OpenAI Whisper large-v37,44%146

Lee la columna de la derecha antes de repetirla: describe una GPU de centro de datos procesando 64 archivos a la vez, no un portátil trabajando en una sola grabación. Casi todas las afirmaciones publicadas sobre precisión parakeet vs whisper se quedan en esta tabla.

¿Se mantiene esa brecha en grabaciones de una hora?

El orden se mantiene. Las cifras no. El leaderboard ejecuta un track de forma larga en inglés independiente sobre CORAAL, Earnings21, el Earnings22 completo y TED-LIUM v3 — grabaciones continuas en lugar de clips — y esta es la tabla que se corresponde con lo que arrastras a una app de transcripción.

Parakeet TDT 0.6B v3 sigue por delante de ambas versiones de Whisper ahí, con una tasa de error de palabra media del 10,7% frente al 11,0% de large-v3-turbo y al 11,2% de large-v3. Pero su ventaja de 1,12 puntos en forma corta se reduce a medio punto, y cada modelo abierto de la tabla duplica aproximadamente la tasa de error que obtuvo en clips.

Track de forma larga (modelos abiertos)WER mediaRTFx (A100, batch 64)
Cohere Labs Transcribe9,73%418
NVIDIA Parakeet TDT 0.6B v310,7%1.000
OpenAI Whisper large-v3-turbo11,0%148
OpenAI Whisper large-v311,2%68,6
Distil-Whisper large-v3.511,7%156
NVIDIA Parakeet CTC 1.1B12,9%2.790

Hay tres cosas que merece la pena extraer de ahí. Ninguna de las dos familias encabeza el track — Cohere Labs Transcribe lidera los modelos abiertos, y cuatro sistemas de API propietarios se sitúan por encima de todos ellos, entre el 7,32% y el 9,54%. Parakeet sigue siendo drásticamente más rápido en todo momento, así que su ventaja de rendimiento es real incluso donde su ventaja de precisión es marginal. Y el audio continuo es sencillamente más difícil para todos: un modelo del 6% en el benchmark es un modelo del 11% en una grabación de dos horas, sea cual sea la etiqueta que lleve.

El mismo corpus de Earnings22 ilustra el punto. El track de forma corta usa un subconjunto de cinco horas; el track de forma larga usa las 119 horas completas, y las tasas de error se mueven en consecuencia.

La razón arquitectónica es visible en la propia ficha de NVIDIA. Parakeet admite «audio de hasta 24 minutos con atención completa (en una A100 de 80GB) o de hasta 3 horas con atención local» — un límite documentado que una entrevista de dos horas puede alcanzar, y un cambio de modo que una app de transcripción tiene que gestionar por ti.

¿Qué modelo cubre más idiomas para transcribir archivos?

Whisper, por un factor de aproximadamente cuatro, y este es el único punto donde los dos modelos realmente se separan. Parakeet TDT 0.6B v3 admite 25 idiomas, todos europeos; las fichas de OpenAI para large-v3 y large-v3-turbo indican ambas 99.

Dentro de la zona de solapamiento son indistinguibles. El track multilingüe del leaderboard evalúa cinco idiomas — alemán, francés, italiano, español y portugués, sobre los datasets CoVoST-2 y FLEURS — y ambos modelos llegan exactamente a la misma media.

WER media, track multilingüeWhisper large-v3Parakeet TDT 0.6B v3
Alemán4,26%4,20%
Francés6,36%5,42%
Italiano4,69%4,81%
Español3,65%3,73%
Portugués4,96%6,16%
Media de los cinco4,81%4,81%

Un empate, repartido entre los idiomas: Parakeet se lleva el alemán y el francés, Whisper se lleva el italiano, el español y el portugués. Fuera de esos cinco no hay comparación posible. El japonés, el árabe, el hindi, el mandarín, el coreano, el turco y el hebreo no tienen token de idioma en Parakeet, y ninguna cantidad de rendimiento compensa un idioma que el modelo nunca fue entrenado para producir.

Ese límite, y no medio punto de tasa de error de palabra, es la razón por la que Weesper Transcribe está construido sobre Whisper y no sobre el modelo más rápido: 57 idiomas de transcripción determinan si un archivo dentro de un archivo con contenido mixto llega a transcribirse siquiera.

¿Qué cambia cuando el modelo sale de la A100 y se ejecuta en tu Mac?

Casi todo en cuanto a velocidad, y muy poco en cuanto a precisión. Este es el paso en el que las cifras del leaderboard dejan de ser predictivas.

Ocurren tres cambios a la vez:

Weesper Transcribe toma esa vía: Whisper en el dispositivo a través de whisper.cpp, un modelo turbo cuantizado junto con un modelo base más ligero, con aceleración Metal en Apple Silicon y soporte para Macs Intel con AVX2, en macOS 13 o posterior. No se sube nada, así que una entrevista bajo embargo permanece en el equipo que la grabó.

Para el detalle a nivel de modelo detrás de esa elección, nuestra comparativa entre turbo y Distil-Whisper explica qué cuesta la poda y qué cuesta la destilación en cada caso, y el análisis más amplio de modelos de voz de código abierto sitúa a ambos frente a las incorporaciones más recientes.

¿Cómo elegir entre ambos para archivos?

Responde a cuatro preguntas en orden y el mejor modelo de transcripción local 2026 para tu propio material suele elegirse solo.

  1. ¿En qué idioma está la grabación? Fuera de los 25 idiomas europeos de Parakeet, la comparación termina aquí. Whisper es el único de los dos que tiene un token para ese idioma.
  2. ¿Cuánto duran los archivos? Ambas familias pierden aproximadamente cuatro puntos de precisión en grabaciones continuas frente a clips segmentados, así que prevé tiempo de corrección en un archivo de dos horas, sea cual sea el modelo que lo haya procesado.
  3. ¿Qué hardware lo ejecuta? El rendimiento de Parakeet se midió en una A100 con batch 64. Si tu carga de trabajo es un archivo a la vez en un Mac, la proporción publicada no es la que vas a ver.
  4. ¿Qué necesitas después de la transcripción? Las marcas de tiempo, los subtítulos, las colas por lotes, las correcciones y la búsqueda son propiedades de la aplicación, no de los pesos del modelo.

Ese último punto es el único que las tablas de benchmark no pueden expresar. En audio de forma larga las dos familias quedan a medio punto de distancia, mientras que la diferencia entre procesar una grabación de dos horas en una sola pasada y cortarla a mano es la diferencia entre un trabajo terminado y una tarde perdida.

En la práctica, el flujo de trabajo es lo que decide: procesamiento por lotes en toda una carpeta, nueve formatos de exportación incluidos SRT y VTT con marcas de tiempo, edición en línea con marcas de tiempo clicables, una API de automatización local, y un historial en el que puedes buscar por sentido en lugar de por palabra clave.

Conclusión

Parakeet TDT 0.6B v3 gana el benchmark que citan la mayoría de los artículos, y también gana el que se saltan: por delante de Whisper tanto en clips cortos en inglés como en grabaciones de una hora, con un rendimiento al que ningún modelo encoder-decoder se acerca. En los cinco idiomas europeos en los que ambos se miden, empatan exactamente en 4,81%.

Lo que deja la decisión donde las tablas no pueden llegar. Medio punto de tasa de error de palabra en audio de forma larga no es una decisión; 99 idiomas admitidos frente a 25 sí lo es. Más allá del conjunto europeo de Parakeet no hay un segundo candidato, y en un Mac el runtime, la cola por lotes y el manejo de archivos largos resuelven el resto.

¿Quieres probarlo con tu propia grabación? Descubre cómo funciona la transcripción de archivos en el dispositivo, o consigue la app en la Mac App Store — gratis para descargar, macOS 13 o posterior, archivos de hasta 15 minutos a calidad completa, con una mejora a Pro de pago único en lugar de una suscripción.