Resposta direta — Parakeet ou Whisper é melhor para transcrição de arquivos? Em precisão, o Parakeet está ligeiramente na frente nas duas categorias em inglês do Open ASR Leaderboard de 2026: taxa média de erro de palavras de 6,32% contra 7,44% do Whisper large-v3 em clipes de formato curto, e 10,7% contra 11,2% em gravações de formato longo. Nos cinco idiomas europeus em que os dois modelos são avaliados, eles empatam em 4,81%. A diferença decisiva é a cobertura: o Whisper cobre 99 idiomas, o Parakeet 25.

Toda comparação de transcrição parakeet vs whisper publicada este ano repete a mesma manchete: o modelo da NVIDIA é mais preciso e muito mais rápido que o da OpenAI. Essa afirmação se sustenta — e resolve muito menos do que parece resolver.

O artigo do Open ASR Leaderboard por trás dela roda diversas categorias separadas, e a diferença de precisão parakeet vs whisper se comporta de forma diferente em cada uma. Leia todas elas e a decisão para um arquivo real deixa de depender só da primeira casa decimal.

Este guia as apresenta na ordem que importa quando você está escolhendo o melhor modelo de transcrição local 2026 para entrevistas, palestras e arquivos de vídeo: o que é cada modelo, o que a diferença no formato curto mede, o que acontece com ela em gravações de horas de duração, onde a cobertura de idiomas traça uma linha rígida, e o que sobrevive quando o modelo sai de uma GPU de data center e chega ao seu Mac.

O que são o Parakeet e o Whisper, e como eles diferem?

Duas famílias de modelos abertos de reconhecimento de fala, construídas sobre arquiteturas diferentes para prioridades diferentes. Nenhum dos dois é um produto — ambos são pesos (weights) que você executa dentro de outra coisa.

O Parakeet TDT 0.6B v3 é o modelo multilíngue da NVIDIA, descrito em seu card como um sistema de 600 milhões de parâmetros com arquitetura FastConformer-TDT, lançado sob a licença CC-BY-4.0. TDT significa token-and-duration transducer: em vez de pontuar cada frame de áudio, o decoder prevê quanto tempo pular adiante, e é daí que vem seu throughput.

O Whisper large-v3 é o transformer encoder-decoder da OpenAI, treinado com o que seu card chama de “1 milhão de horas de áudio com rótulos fracos e 4 milhões de horas de áudio com pseudo-rótulos coletadas usando o Whisper large-v2”, e reportado como capaz de entregar “redução de 10% a 20% nos erros em comparação com o Whisper large-v2”.

O Whisper large-v3-turbo é a variante que a maioria dos aplicativos de Mac realmente distribui. Seu card é direto sobre a troca: “é exatamente o mesmo modelo, exceto que o número de camadas de decodificação foi reduzido de 32 para 4”, então “o modelo é muito mais rápido, ao custo de uma pequena degradação de qualidade”.

Parakeet TDT 0.6B v3Whisper large-v3Whisper large-v3-turbo
DesenvolvedorNVIDIAOpenAIOpenAI
ArquiteturaFastConformer-TDTTransformer encoder-decoderIgual, decoder reduzido para 4 camadas
Parâmetros600 milhões1.550 M809 M
Idiomas25 (todos europeus)9999
Pontuação e capitalizaçãoAutomáticaAutomáticaAutomática
TimestampsNível de palavra e segmentoNível de segmento e palavraNível de segmento e palavra
Licença declarada no cardCC-BY-4.0Apache 2.0MIT

O Parakeet supera o Whisper em precisão?

Na categoria de formato curto em inglês, sim, por 1,12 ponto. O artigo do Open ASR Leaderboard — que compara 86 sistemas de código aberto e proprietários em 12 conjuntos de dados — reporta uma taxa média de erro de palavras de 6,32% para o Parakeet TDT 0.6B v3 contra 7,44% para o Whisper large-v3.

O contexto ao redor importa mais do que a diferença. Essa média é calculada sobre os conjuntos de dados de formato curto em inglês do ranking — incluindo AMI, GigaSpeech, LibriSpeech clean e other, SPGISpeech, VoxPopuli e um subconjunto de cinco horas do Earnings22 — que são majoritariamente clipes pré-segmentados, e não gravações contínuas de horas de duração.

Os números de velocidade vêm da mesma execução. O fator inverso de tempo real, definido no artigo como a duração total do áudio dividida pelo tempo de transcrição, foi medido em uma GPU NVIDIA A100-SXM4-80GB com tamanho de lote 64.

Categoria de formato curto em inglêsWER médioRTFx (A100, lote 64)
NVIDIA Parakeet TDT 0.6B v26,05%3.390
NVIDIA Parakeet TDT 0.6B v36,32%3.330
NVIDIA Parakeet CTC 1.1B7,40%2.730
OpenAI Whisper large-v37,44%146

Leia a coluna da direita antes de repeti-la: ela descreve uma GPU de data center processando 64 arquivos ao mesmo tempo, não um notebook trabalhando em uma gravação por vez. Quase toda afirmação publicada sobre precisão parakeet vs whisper para por aqui, nesta tabela.

Essa diferença se mantém em gravações de horas de duração?

A ordem se mantém. Os números, não. O ranking roda uma categoria separada de formato longo em inglês sobre CORAAL, Earnings21, o Earnings22 completo e o TED-LIUM v3 — gravações contínuas em vez de clipes — e essa é a tabela que corresponde ao que você realmente solta dentro de um aplicativo de transcrição.

O Parakeet TDT 0.6B v3 ainda lidera as duas versões do Whisper ali, com uma taxa média de erro de palavras de 10,7% contra 11,0% do large-v3-turbo e 11,2% do large-v3. Mas sua vantagem de 1,12 ponto no formato curto se reduz a meio ponto, e todo modelo aberto da tabela praticamente dobra a taxa de erro que registrou nos clipes.

Categoria de formato longo (modelos abertos)WER médioRTFx (A100, lote 64)
Cohere Labs Transcribe9,73%418
NVIDIA Parakeet TDT 0.6B v310,7%1.000
OpenAI Whisper large-v3-turbo11,0%148
OpenAI Whisper large-v311,2%68,6
Distil-Whisper large-v3.511,7%156
NVIDIA Parakeet CTC 1.1B12,9%2.790

Três coisas vale a pena reter daqui. Nenhuma das duas famílias lidera a categoria — o Cohere Labs Transcribe fica na frente dos modelos abertos, e quatro sistemas de API proprietários ficam acima de todos eles, de 7,32% a 9,54%. O Parakeet permanece dramaticamente mais rápido em todos os casos, então sua vantagem de throughput é real mesmo onde sua vantagem de precisão é marginal. E o áudio contínuo é simplesmente mais difícil para todos: um modelo de 6% no benchmark se torna um modelo de 11% em uma gravação de duas horas, seja qual for o crachá que ele carregue.

O próprio corpus Earnings22 ilustra isso. A categoria de formato curto usa um subconjunto de cinco horas dele; a categoria de formato longo usa as 119 horas completas, e as taxas de erro se movem de acordo.

A razão arquitetural é visível no próprio card da NVIDIA. O Parakeet suporta “áudio de até 24 minutos com atenção completa (em uma A100 80GB) ou até 3 horas com atenção local” — um teto documentado que uma entrevista de duas horas pode alcançar, e uma troca de modo que um aplicativo de transcrição precisa gerenciar por você.

Qual modelo cobre mais idiomas para transcrição de arquivos?

O Whisper, por um fator de aproximadamente quatro, e este é o único ponto em que os dois modelos realmente se separam. O Parakeet TDT 0.6B v3 é compatível com 25 idiomas, todos europeus; os cards da OpenAI para o large-v3 e o large-v3-turbo declaram, ambos, 99.

Dentro da sobreposição, eles são indistinguíveis. A categoria multilíngue do ranking avalia cinco idiomas — alemão, francês, italiano, espanhol e português, sobre os conjuntos de dados CoVoST-2 e FLEURS — e os dois modelos chegam exatamente à mesma média.

WER médio, categoria multilíngueWhisper large-v3Parakeet TDT 0.6B v3
Alemão4,26%4,20%
Francês6,36%5,42%
Italiano4,69%4,81%
Espanhol3,65%3,73%
Português4,96%6,16%
Média dos cinco4,81%4,81%

Um empate, dividido entre os idiomas: o Parakeet vence em alemão e francês, o Whisper vence em italiano, espanhol e português. Fora desses cinco, não há comparação alguma. Japonês, árabe, hindi, mandarim, coreano, turco e hebraico não têm token de idioma no Parakeet, e nenhuma quantidade de throughput compensa um idioma que o modelo nunca foi treinado para produzir.

É essa fronteira, e não meio ponto de taxa de erro de palavras, que explica por que o Weesper Transcribe é construído sobre o Whisper, e não sobre o modelo mais rápido: 57 idiomas de transcrição decidem se um arquivo dentro de um arquivo misto chega a ser transcrito.

O que muda quando o modelo sai da A100 e passa a rodar no seu Mac?

Quase tudo em relação à velocidade, e muito pouco em relação à precisão. É nessa etapa que os números do ranking deixam de ser preditivos.

Três mudanças acontecem ao mesmo tempo:

O Weesper Transcribe segue esse caminho: Whisper no dispositivo via whisper.cpp, um modelo turbo quantizado ao lado de um modelo base mais leve, com aceleração Metal em Apple Silicon e suporte a Macs Intel com AVX2, no macOS 13 ou posterior. Nada é enviado para servidores, então uma entrevista sob embargo permanece na máquina que a gravou.

Para o detalhe no nível do modelo por trás dessa escolha, nossa comparação entre turbo e Distil-Whisper cobre o que a poda (pruning) e a destilação custam a cada um, e o levantamento mais amplo de modelos de fala de código aberto coloca os dois frente a frente com os concorrentes mais recentes.

Como escolher entre eles para arquivos?

Responda quatro perguntas em ordem e o melhor modelo de transcrição local 2026 para o seu próprio material geralmente se define por si só.

  1. Em que idioma está a gravação? Fora dos 25 idiomas europeus do Parakeet, a comparação termina aqui. O Whisper é o único dos dois que tem token para o idioma.
  2. Qual a duração dos arquivos? As duas famílias perdem aproximadamente quatro pontos de precisão em gravações contínuas, comparadas a clipes segmentados, então reserve tempo de correção para um arquivo de duas horas, seja qual for o modelo que o produziu.
  3. Que hardware executa o modelo? O throughput do Parakeet foi medido em uma A100 com lote de 64. Se sua carga de trabalho é um arquivo por vez em um Mac, a proporção publicada não é a proporção que você vai ver.
  4. O que você precisa depois da transcrição? Timestamps, legendas, filas de lote, correções e busca são propriedades do aplicativo, não dos pesos (weights) do modelo.

Esse último ponto é o único que as tabelas de benchmark não conseguem expressar. Em áudio de formato longo, as duas famílias ficam separadas por meio ponto, enquanto a diferença entre processar uma gravação de duas horas de uma só vez e fatiá-la manualmente é a diferença entre um trabalho concluído e uma tarde perdida.

Na prática, é o fluxo de trabalho que decide: processamento em lote de uma pasta inteira, nove formatos de exportação incluindo SRT e VTT com marcação de tempo, edição inline com timestamps clicáveis, uma API de automação local, e um histórico no qual você pode buscar por significado em vez de por palavra-chave.

Conclusão

O Parakeet TDT 0.6B v3 vence o benchmark que a maioria dos artigos cita, e também vence aquele que costumam pular: na frente do Whisper tanto em clipes curtos em inglês quanto em gravações de horas de duração, com um throughput que nenhum modelo encoder-decoder chega perto de alcançar. Nos cinco idiomas europeus em que os dois são medidos, eles empatam exatamente em 4,81%.

O que deixa a decisão exatamente onde as tabelas não alcançam. Meio ponto de taxa de erro de palavras em áudio de formato longo não é uma decisão; 99 idiomas compatíveis contra 25 é. Além do conjunto europeu do Parakeet não há um segundo candidato, e em um Mac o runtime, a fila de lote e o tratamento de arquivos longos resolvem o resto.

Quer testar isso na sua própria gravação? Veja como funciona a transcrição de arquivos no dispositivo, ou baixe o aplicativo na Mac App Store — gratuito para baixar, macOS 13 ou posterior, arquivos de até 15 minutos em qualidade máxima, com upgrade Pro de compra única em vez de assinatura.