Resposta direta — Você deveria escolher o Whisper large-v3 Turbo ou o Distil-Whisper em 2026? Escolha o Whisper large-v3 Turbo se você dita em mais de um idioma: ele mantém os 99 idiomas em 809M de parâmetros. Escolha o Distil-Whisper (distil-large-v3, 756M) apenas para inglês, onde seu model card reporta uma latência relativa de 6,3x em relação ao large-v3. Ambos podem rodar no whisper.cpp. As diferenças de precisão entre as duas famílias são pequenas; a cobertura de idiomas não é.
Escolher o melhor modelo Whisper em 2026 começa com uma comparação de modelos de fala locais, não com uma tabela de tamanhos. O large-v3 Turbo da OpenAI e o Distil-Whisper da Hugging Face comprimem o large-v3, de 1.550M de parâmetros, para aproximadamente metade do seu tamanho, e ambos existem pelo mesmo motivo: a decodificação era lenta demais para um ditado confortável em tempo real.
Eles seguiram caminhos diferentes para chegar lá, e esses caminhos produzem trade-offs genuinamente distintos. Esta comparação cobre o que cada modelo muda na arquitetura, o que as taxas de erro de palavras publicadas realmente medem, como os dois se comportam dentro do whisper.cpp, e qual deles pertence a um fluxo de trabalho de ditado.
Se você ainda está montando o runtime, comece pelo nosso guia de instalação do whisper.cpp.
O que é o Whisper large-v3 Turbo?
O Whisper large-v3 Turbo é uma versão podada e ajustada (fine-tuned) do large-v3, com 809M de parâmetros. O model card da OpenAI o descreve como “uma versão ajustada (finetuned) de um Whisper large-v3 podado”, no qual “o número de camadas de decodificação foi reduzido de 32 para 4”.
Poda (pruning) significa remover componentes inteiros de uma rede já treinada — neste caso, 28 das 32 camadas do decoder — e então fazer um fine-tuning do que resta, para que recupere a maior parte do comportamento perdido. O encoder, que transforma o áudio em uma representação interna, permanece intocado.
Essa assimetria é todo o design. No Whisper, o encoder roda uma vez por janela de 30 segundos, enquanto o decoder roda uma vez por token gerado — por isso o decoder domina a latência em transcrições longas.
Crucialmente, o Turbo mantém a cabeça multilíngue. O model card lista os mesmos 99 idiomas do large-v3, o que o torna um substituto direto (drop-in), e não uma variante especializada.
O que é o Distil-Whisper, e por que ele é exclusivo para inglês?
O Distil-Whisper é uma família de modelos exclusivos para inglês, treinados por destilação de conhecimento a partir do Whisper large-v2 e large-v3. A destilação de conhecimento (knowledge distillation) treina um modelo “estudante” menor para reproduzir as saídas de um modelo “professor” maior, em vez de aprender apenas a partir de rótulos de referência (ground-truth).
O artigo do Distil-Whisper (arXiv:2311.00430) relata um modelo estudante com “51% menos parâmetros”, que é “5,8 vezes mais rápido”, mantendo-se “dentro de 1% de WER em dados de teste fora da distribuição (out-of-distribution)” em um cenário de transferência zero-shot. Esses números descrevem o distil-large-v2.
Assim como o Turbo, o Distil-Whisper mantém o encoder: o model card observa que ele “é totalmente copiado do professor para o estudante e congelado durante o treinamento”. A economia, novamente, vem de um decoder drasticamente encurtado.
A limitação de idioma não é um descuido, mas uma restrição dos dados de treinamento. O repositório do Distil-Whisper afirma claramente que a série “está disponível apenas para reconhecimento de fala em inglês” e recomenda “usar o checkpoint Whisper Turbo” para trabalhos multilíngues.
A família Distil-Whisper publicada
| Modelo | Parâmetros | Latência relativa | WER formato curto | WER formato longo |
|---|---|---|---|---|
| distil-large-v3 | 756M | 6,3x | 9,7% | 10,8% |
| distil-large-v2 | 756M | 5,8x | 10,1% | 11,6% |
| distil-medium.en | 394M | 6,8x | 11,1% | 12,4% |
| distil-small.en | 166M | 5,6x | 12,1% | 12,8% |
Números conforme publicados no repositório do Distil-Whisper. Os quatro são exclusivos para inglês; a latência é relativa ao Whisper large-v3, definido como 1,0.
Whisper V3 Turbo vs Distil-Whisper: especificações lado a lado
Os dois modelos são próximos em tamanho e muito distantes em escopo. Eis o que os model cards oficiais publicam.
| Atributo | Whisper large-v3 | large-v3 Turbo | distil-large-v3 |
|---|---|---|---|
| Parâmetros | 1.550M | 809M | 756M |
| Idiomas | 99 | 99 | Apenas inglês |
| Camadas do decoder | 32 | 4 | Encurtado (encoder congelado) |
| Fator de velocidade publicado | linha de base | nenhum publicado | latência relativa de 6,3x |
| Método | — | poda + fine-tuning | destilação de conhecimento |
| Alvo de download no whisper.cpp | ✅ | ✅ | ❌ requer conversão |
Uma linha merece atenção: a OpenAI não publica nenhum fator numérico de velocidade para o Turbo. O model card diz apenas que “o modelo é muito mais rápido, às custas de uma pequena degradação de qualidade”. Qualquer multiplicador específico que você veja citado para o Turbo vem de testes de terceiros, não da OpenAI.
Qual modelo é mais preciso em 2026?
Ambos abrem mão de precisão em relação ao large-v3, e ambos abrem mão de menos do que sua redução de tamanho sugeriria. Mas as duas famílias publicam seus números em benchmarks diferentes, então os números de destaque não são diretamente comparáveis.
Os resultados de avaliação nos model cards da OpenAI reportam uma taxa média de erro de palavras de 7,83 para o large-v3-turbo, contra 7,44 para o large-v3, na suíte English Open ASR Leaderboard — uma diferença de aproximadamente 0,4 ponto.
A equipe do Distil-Whisper avalia em sua própria suíte em inglês, na qual o distil-large-v3 registra 9,7% de WER em formato curto, contra 8,4% do large-v3, e 10,8% em áudio longo sequencial, contra 10,0% do large-v3. Em formato longo fragmentado (chunked), o modelo destilado na verdade sai na frente: 10,9% contra 11,0%.
Não subtraia 7,83 de 9,7. Conjuntos de dados diferentes, algoritmos de decodificação diferentes e durações de áudio diferentes produzem WER absolutos diferentes para o mesmo modelo. Cada número só faz sentido em relação à sua própria linha de base.
O resumo honesto: em relação ao large-v3, o Turbo perde cerca de meio ponto de WER no leaderboard em inglês, e o distil-large-v3 perde cerca de 1,3 ponto em formato curto e 0,8 ponto em formato longo sequencial na suíte do Distil-Whisper. Para ditado, ambos ficam bem dentro da faixa em que a qualidade do microfone e o ruído de fundo dominam o resultado.
Já mostramos como ler números de benchmark de fala sem superinterpretá-los em nossa comparação de benchmarks entre Voxtral e Whisper.
Qual é o modelo Whisper mais rápido na prática?
Para cargas de trabalho exclusivamente em inglês, em uma máquina local, o Distil-Whisper tem a evidência publicada mais forte. Seu model card inclui uma medição específica para o whisper.cpp: “Em um benchmark provisório em um Mac M1, o distil-large-v3 é mais de 5x mais rápido que o Whisper large-v3.”
Essa é uma afirmação delimitada e reproduzível — um runtime nomeado, um hardware nomeado, uma comparação nomeada — e é o tipo de número que vale a pena confiar. Também está explicitamente rotulada como provisória.
A vantagem do Turbo é mais difícil de quantificar porque a OpenAI optou por não publicar um número. Estruturalmente, cortar o decoder de 32 camadas para 4 remove o mesmo gargalo que o Distil-Whisper ataca, então os dois devem ficar em uma faixa amplamente semelhante no mesmo hardware.
Três variáveis afetam a taxa de processamento no mundo real mais do que o checkpoint em si:
- Quantização. O whisper.cpp suporta arquivos ggml quantizados (Q5_0, entre outros), que reduzem o consumo de memória e aceleram a inferência a um certo custo de precisão.
- Aceleração de hardware. Em Apple Silicon, o whisper.cpp pode direcionar a inferência do encoder para o Neural Engine via Core ML, e rodar a inferência na GPU via Metal.
- Duração do áudio e algoritmo. Estratégias de formato longo sequenciais e fragmentadas produzem perfis diferentes de velocidade e precisão para o mesmo modelo.
Como os dois modelos se comportam dentro do whisper.cpp?
O Turbo é mais fácil de adotar. O repositório do whisper.cpp lista large-v3-turbo entre seus modelos disponíveis para download, ao lado dos demais checkpoints oficiais, de modo que baixar o arquivo ggml é um único comando.
O Distil-Whisper não é um desses alvos de download. O model card do distil-large-v3 documenta sua execução “com o pacote Whisper.cpp, usando o algoritmo original de transcrição sequencial de formato longo”, o que significa uma etapa de conversão antes de você ter um arquivo ggml utilizável.
Essa diferença importa mais do que parece. Um modelo que você baixa diretamente se mantém atualizado com os releases upstream; um modelo que você mesmo converte é uma etapa que você precisa manter.
Memória é a outra restrição prática. O whisper.cpp documenta aproximadamente 3,9 GB para um modelo da classe large, então um checkpoint de metade do tamanho é o que torna o ditado local sequer viável em uma máquina com 8 GB.
Qual modelo você deveria escolher?
Percorra esta lista e pare na primeira linha que se aplicar ao seu caso.
- Você dita em mais de um idioma. Escolha o large-v3 Turbo. O Distil-Whisper não pode atendê-lo, e o próprio projeto Distil-Whisper afirma isso.
- Apenas inglês, e a latência é sua restrição principal. Escolha o distil-large-v3, aceite a etapa de conversão e valide com seu próprio áudio.
- Apenas inglês, e você quer o caminho de manutenção mais simples. Escolha o large-v3 Turbo mesmo assim. A cabeça multilíngue não custa nada em tempo de inferência.
- Precisão acima de tudo, velocidade em segundo plano. Fique com o large-v3 completo.
- Você quer ditado, não um pipeline de modelos. Use um aplicativo que gerencie o checkpoint por você.
Essa última linha é onde a maioria das pessoas acaba chegando. Compilar um runtime, converter checkpoints e ajustar a quantização é uma tarde genuinamente interessante — e um péssimo compromisso semanal.
O Weesper Neon Flow é construído sobre o whisper.cpp, roda inteiramente offline, sem que nenhum áudio saia do dispositivo, suporta mais de 55 idiomas e usa aceleração Metal em Apple Silicon. Experimente o Weesper gratuitamente por 15 dias se você preferir ditar a fazer benchmark.
O resumo final sobre Whisper V3 Turbo vs Distil-Whisper
Esses dois modelos resolvem o mesmo problema — um decoder lento demais para uso em tempo real — com ferramentas diferentes, e acabam em uma classe de tamanho semelhante: 809M contra 756M de parâmetros, ambos aproximadamente a metade do large-v3.
A diferença de precisão entre eles é pequena o suficiente para que seu microfone importe mais. A diferença de idiomas é absoluta: 99 idiomas contra um. Para qualquer pessoa cujo trabalho não seja exclusivamente em inglês, essa única linha decide a comparação antes mesmo de a velocidade entrar na discussão.
Se você quiser ver como esses modelos locais se comparam aos motores embutidos no seu sistema operacional, leia nossa análise sobre Apple Dictation e OpenAI Whisper.
Pronto para ditar offline? Instale o Weesper Neon Flow no macOS ou Windows, ou acesse a Central de Ajuda para configuração de idiomas e primeiros passos.