Resposta direta — Whisper ou Gemma 4: qual é melhor para ditado local? Eles foram feitos para tarefas diferentes. O Whisper é um modelo de reconhecimento de fala dedicado cuja única saída é uma transcrição. O Gemma 4 é um modelo de linguagem multimodal que aceita áudio entre outras entradas e pode raciocinar sobre ele. Nenhum benchmark público avalia os dois no mesmo conjunto de teste de fala, então qualquer pessoa que cite um número de precisão comparando os dois está comparando medições diferentes. Para ditado, o modelo dedicado continua sendo a escolha de engenharia mais segura.
Desde que o Google publicou o Gemma 4, a mesma pergunta continua voltando de desenvolvedores e usuários técnicos: se um modelo multimodal geral agora consegue transcrever áudio em um laptop, um modelo de reconhecimento de fala dedicado como o Whisper ainda é o motor certo para a precisão do ditado local?
É uma boa pergunta, e a maioria das respostas em circulação se apoia em números que não resistem a uma checagem nas fontes primárias. Este artigo compara os dois modelos de reconhecimento de fala local com base no que está de fato documentado — arquitetura, avaliações publicadas, restrições — e é honesto sobre onde a informação disponível termina.
O que são o Whisper e o Gemma 4?
Eles pertencem a duas famílias de modelos diferentes, com objetivos de design diferentes.
O Whisper é um modelo de reconhecimento automático de fala lançado pela OpenAI. O artigo que o descreve, Robust Speech Recognition via Large-Scale Weak Supervision, foi submetido em dezembro de 2022 e relata treinamento em 680.000 horas de supervisão multilingual e multitarefa, com os modelos alcançando desempenho competitivo em benchmarks em um cenário de transferência zero-shot. O checkpoint principal atual, o large-v3, é documentado em seu model card como um Transformer encoder-decoder de 1.550M de parâmetros, treinado em 1 milhão de horas de áudio com rótulos fracos (weakly labelled) e 4 milhões de horas de áudio com pseudo-rótulos, e a OpenAI relata “redução de 10% a 20% nos erros em comparação com o Whisper large-v2”. Sua saída é uma transcrição. Essa é toda a superfície do modelo.
O Gemma 4 é a família de modelos com pesos abertos (open weights) do Google. O Google anunciou o Gemma 4 12B em 3 de junho de 2026 como, em suas próprias palavras, “nosso primeiro modelo de tamanho médio com entradas de áudio nativas”. O model card do Gemma 4 lista cinco tamanhos — E2B, E4B, 12B Unified, 26B A4B (Mixture-of-Experts) e 31B Dense — dos quais apenas o E2B, o E4B e o 12B aceitam áudio. Sua saída é texto do tipo que você pedir: uma transcrição, uma tradução, um resumo, uma resposta.
O caminho de áudio do Gemma 4 não é um design único
O Gemma 4 Technical Report descreve “encoders de visão e áudio melhorados para todos os tamanhos de modelo”, junto com “uma arquitetura unificada e sem encoder para nosso modelo 12B, que processa áudio bruto e patches de imagem”. O post de lançamento do Google coloca a segunda metade de forma mais direta: para o 12B, ele “removeu completamente o encoder de áudio e projetou o sinal de áudio bruto no mesmo espaço dimensional dos tokens de texto”.
Ou seja, “áudio no Gemma 4” significa duas coisas diferentes dependendo do tamanho. As variantes E2B e E4B têm um encoder de áudio dedicado — o card do Hugging Face para o gemma-4-E4B-it estima esse encoder em aproximadamente 300M de parâmetros. O 12B não tem.
Como as duas arquiteturas se diferenciam para o ditado?
A diferença que importa para o ditado é o que existe entre o microfone e o campo de texto.
O decoder do Whisper existe para emitir uma transcrição, e nada além disso. O decoder do Gemma 4 é um modelo de linguagem que faz geração de propósito geral, e a transcrição é apenas uma instrução entre muitas. Isso é uma vantagem real de capacidade quando você quer que o áudio seja compreendido, e um desvio desnecessário quando você só quer que ele seja transcrito.
| Whisper large-v3 | Gemma 4 E2B / E4B | Gemma 4 12B | |
|---|---|---|---|
| Tipo de modelo | ASR dedicado | LLM multimodal | LLM multimodal |
| Parâmetros | 1.550M | 2,3B / 4,5B efetivos (5,1B / 8B com embeddings) | 11,95B |
| Caminho de áudio | Encoder-decoder, áudio na entrada, texto na saída | Encoder de áudio dedicado (~300M no E4B) | Sem encoder: áudio bruto projetado no espaço de embedding de texto |
| Saída | Apenas transcrição | Transcrição, tradução, resumo, respostas | Transcrição, tradução, resumo, respostas |
| Janela de áudio documentada | Campo receptivo de 30 segundos; arquivos longos via janela deslizante de 30 segundos | 30 segundos | 30 segundos |
| Idiomas documentados | 99 | 12 na avaliação FLEURS publicada | 12 na avaliação FLEURS publicada |
| Termos | Licença MIT para código e pesos do modelo | Pesos abertos, “uso comercial responsável” sob os termos do Gemma | Mesmo |
Fontes de cada célula: o repositório openai/whisper e seu model card; o model card do Gemma 4 do Google, a documentação de áudio e o Technical Report.
Duas linhas merecem um segundo olhar.
A janela de 30 segundos é uma restrição compartilhada, alcançada a partir de direções opostas. A documentação da OpenAI descreve um campo receptivo de 30 segundos e explica que seu método transcribe() “processa o áudio com uma janela deslizante de 30 segundos”. A documentação de áudio do Google afirma claramente que “o áudio suporta um comprimento máximo de 30 segundos”. Nenhum dos dois modelos processa uma gravação de uma hora em uma única passagem; ambos precisam de uma lógica de fragmentação em torno deles.
A linha de idiomas não é uma comparação equivalente. Os 99 idiomas do Whisper são uma cobertura documentada. O 12 do Gemma 4 é o tamanho do conjunto de avaliação que o Google publicou, não um limite para o que o modelo pode tentar — mas fora desses 12 idiomas você não tem nenhuma medição publicada para se basear.
Existe um benchmark publicado que os compara diretamente?
Não — e essa é a coisa mais importante a saber antes de confiar em qualquer comparação que você leia.
O Gemma 4 Technical Report do Google contém uma tabela de avaliação de fala, “FLEURS ASR (WER, quanto menor melhor)”, cobrindo 12 idiomas. Todos os modelos dessa tabela são modelos Gemma: o Gemma 4 E2B e o E4B medidos em comparação com seus predecessores Gemma 3n. O Whisper não aparece como referência em nenhum ponto da avaliação de áudio. A OpenAI, por sua vez, publica o detalhamento por idioma do Whisper no Common Voice e no FLEURS, avaliado em seus próprios termos e em sua própria lista de idiomas.
A consequência é inevitável. Para produzir uma frase do tipo “o Whisper marca X% e o Gemma marca Y%”, é preciso pegar um número de uma avaliação e colocá-lo ao lado de um número de outra — subconjuntos de idiomas diferentes, normalização de texto diferente, transcrições de referência diferentes, anos diferentes. A aritmética funciona. A comparação não.
Isso não é um problema específico do Gemma. É o estado normal do benchmarking de ASR, e é por isso que nosso guia de precisão em reconhecimento de fala dedica mais tempo a como um número foi produzido do que ao número em si. A taxa de erro de palavras (WER) é a proporção de palavras que um sistema erra — substituições, exclusões e inserções divididas pelo número de palavras na referência. Ela descreve uma execução, não um modelo.
Mude qualquer um dos itens abaixo e os mesmos pesos produzem um WER diferente:
- O conjunto de dados. O FLEURS é fala lida: frases preparadas, gravadas com qualidade controlada. O ditado é espontâneo, com falsos começos, nomes de produtos e um microfone de laptop.
- O idioma. Os próprios números do Google variam em mais de quatro vezes entre os 12 idiomas medidos.
- A convenção de pontuação. O Google marca alguns idiomas em sua tabela com taxa de erro de caracteres em vez de taxa de erro de palavras, porque os limites entre palavras não existem da mesma forma.
- As condições de áudio. Ruído de fundo, sotaque e falas sobrepostas movem o número muito mais do que a escolha entre dois modelos fortes.
O que os números de fala do Gemma 4 publicados pelo Google realmente mostram?
Eles mostram uma melhoria geracional clara em relação ao Gemma 3n, e mostram por que uma média é um resumo pobre.
Estes são os valores da Tabela 7 do Gemma 4 Technical Report — FLEURS, fala lida, WER em que quanto menor melhor, calculados como média nos 12 idiomas avaliados pelo Google, convertidos aqui das frações decimais do relatório para porcentagens:
| Modelo | Média, 12 idiomas | Inglês | Alemão | Francês | Espanhol |
|---|---|---|---|---|---|
| Gemma 3n E2B | 10,8% | 7,6% | 7,9% | 13,0% | 5,1% |
| Gemma 3n E4B | 8,5% | 6,6% | 6,5% | 9,8% | 4,1% |
| Gemma 4 E2B | 9,0% | 8,0% | 7,6% | 10,1% | 4,2% |
| Gemma 4 E4B | 7,5% | 6,5% | 6,1% | 8,0% | 3,5% |
Duas ressalvas acompanham essa tabela e não devem ser descartadas. Primeiro, a média dos 12 idiomas mistura convenções de pontuação, porque o Google relata taxa de erro de caracteres em vez de taxa de erro de palavras para alguns idiomas do conjunto. Segundo, o model card do Google lista separadamente o 12B em 0,069 no FLEURS, mas sinaliza isso como “excluindo o idioma chinês” — um conjunto de idiomas diferente, então ele não fica na mesma linha que os outros.
Agora a parte interessante. O Gemma 4 E2B melhora a média dos 12 idiomas em relação ao Gemma 3n E2B, de 10,8% para 9,0% — mas seu WER em inglês vai na direção contrária, de 7,6% para 8,0%. Um modelo pode melhorar na média e piorar no idioma em que você realmente dita. Se o seu trabalho é ditado em inglês, a média nunca foi o número que você precisava.
Esse é o argumento para testar com o seu próprio áudio, no seu próprio idioma, em vez de escolher um modelo a partir de uma linha de um leaderboard.
Qual modelo você deve escolher para ditado local?
Escolha pelo resultado que você precisa, não pela manchete que te impressionou.
Escolha um modelo de ASR dedicado, como o Whisper, quando:
- O resultado final é uma transcrição que vai para um campo de texto, um editor ou um arquivo de legendas
- Você precisa de ampla cobertura de idiomas — 99 idiomas documentados é uma rede ampla
- Você quer um runtime local maduro; o whisper.cpp tem anos de otimização específica de plataforma por trás dele, e nosso guia de instalação do whisper.cpp explica passo a passo como executá-lo você mesmo
- A latência por enunciado importa mais do que a versatilidade, porque o ditado é um ciclo que você executa centenas de vezes por dia
Escolha um modelo multimodal, como o Gemma 4, quando:
- Você quer que a gravação seja compreendida, não apenas transcrita — resumida, consultada, classificada
- Você já está executando um modelo de linguagem no dispositivo e prefere não distribuir um segundo
- A tradução de fala faz parte do produto, algo que o Google mede separadamente no CoVoST
- O consumo extra de memória é aceitável; o Google posiciona o 12B como capaz de rodar localmente “com apenas 16GB de VRAM”
Existe uma terceira resposta que costuma estar certa: os dois, em pontos diferentes. Transcreva com o modelo dedicado e depois passe o texto para um modelo de linguagem se ele precisar de ajustes. Esse é um pipeline mais simples do que pedir que um único modelo se destaque em duas tarefas, e cada etapa permanece testável de forma independente.
Onde o Weesper Neon Flow se posiciona
O Weesper Neon Flow executa o Whisper localmente através do whisper.cpp no macOS e no Windows, com mais de 50 idiomas, nenhuma chamada de rede e um teste gratuito de 15 dias. Essa escolha não é uma afirmação de que o Whisper é o melhor modelo de fala que existe — é uma questão de adequação.
O ditado é um ciclo sensível à latência que acontece dentro de qualquer aplicativo em que você já esteja: um e-mail, um editor de código, uma anotação clínica. O que ele precisa é de uma transcrição, rápida, repetidamente, sem que nada saia da máquina. Um modelo de ASR dedicado produz exatamente essa saída, então o orçamento de engenharia vai para a experiência de ditado — atalhos de teclado (hotkeys), inserção de texto, vocabulário personalizado. A documentação de ajuda cobre modelos, idiomas e permissões.
Acompanhamos de perto a abordagem alternativa. Nossa análise do aplicativo de ditado Eloquent do Google examina o ditado local baseado em Gemma em um produto de consumo já lançado, e nossa comparação entre Voxtral e Whisper cobre o lado do ASR dedicado do mesmo mercado. Para saber onde a inferência deveria acontecer, veja nossa comparação entre transcrição local e em nuvem.
Perguntas frequentes
O Gemma 4 é mais preciso que o Whisper para ditado?
Não existe uma resposta direta publicada. O Gemma 4 Technical Report do Google avalia o reconhecimento de fala do Gemma 4 no FLEURS em comparação com seu próprio predecessor, o Gemma 3n, e não inclui o Whisper como referência. As avaliações do Whisper feitas pela OpenAI usam conjuntos de teste diferentes e uma lista de idiomas diferente. Qualquer número único que afirme que um supera o outro por uma determinada margem está combinando duas medições que nunca foram executadas nas mesmas condições.
O Gemma 4 tem um encoder de áudio?
Depende do tamanho. O Technical Report descreve encoders de áudio melhorados para os tamanhos de modelo em geral, e uma arquitetura unificada e sem encoder separada para o 12B, que processa áudio bruto e patches de imagem diretamente. O card do Hugging Face para o gemma-4-E4B-it lista um encoder de áudio de aproximadamente 300M de parâmetros. Ou seja, o E2B e o E4B usam um encoder de áudio dedicado; o 12B projeta o sinal bruto no mesmo espaço dos tokens de texto.
O que é a taxa de erro de palavras (WER), e por que os números de WER publicados divergem?
A taxa de erro de palavras (WER) é a proporção de palavras que um sistema erra, contando substituições, exclusões e inserções em relação a uma transcrição de referência. É uma proporção, não uma propriedade do modelo. Mude o conjunto de dados, o idioma, as condições de gravação, as regras de normalização ou a transcrição de referência, e os mesmos pesos produzem um WER diferente. Um número só tem significado quando acompanhado do seu escopo.
O Gemma 4 pode transcrever áudios com mais de 30 segundos?
A documentação de áudio do Google afirma que o áudio suporta um comprimento máximo de 30 segundos. O Whisper tem o mesmo tipo de restrição, mas por outro caminho: a documentação da OpenAI descreve um campo receptivo de 30 segundos, e seu método transcribe lida com arquivos longos usando uma janela deslizante de 30 segundos. Em ambos os casos, gravações mais longas exigem uma lógica de fragmentação em torno do modelo, em vez de uma única passagem por ele.
Qual modelo o Weesper Neon Flow usa, e por quê?
O Weesper Neon Flow executa o Whisper localmente por meio do whisper.cpp no macOS e no Windows. O motivo é o escopo: o ditado precisa de uma coisa feita bem e repetidamente — transformar fala em texto com baixa latência, dentro de qualquer aplicativo em que você esteja. Um modelo de reconhecimento de fala dedicado tem exatamente essa saída e um runtime local maduro, então o esforço de engenharia vai para a experiência de ditado, em vez de restringir um modelo geral a uma única tarefa.
Desenvolvedores que estão construindo um recurso de ditado devem escolher um modelo de ASR ou um LLM multimodal?
Escolha pelo resultado, não pela manchete. Se você precisa de uma transcrição que caia em um campo de texto, um modelo de ASR dedicado é o caminho mais curto. Se você precisa que o áudio seja compreendido em vez de apenas transcrito — resumido, consultado, classificado — um modelo multimodal faz em uma única etapa o que, de outra forma, seria transcrição seguida por um segundo modelo. Muitos produtos querem os dois, em pontos diferentes do fluxo de trabalho.
A conclusão prática
O Gemma 4 é um trabalho significativo: uma família de pesos abertos em que três dos cinco tamanhos recebem áudio nativamente, e em que o 12B elimina completamente o encoder de áudio. Ele não é, com base no que foi publicado, um substituto comprovado para um modelo de ASR dedicado em um produto de ditado — porque ninguém publicou essa comprovação.
Até que alguém execute os dois no mesmo conjunto de teste com a mesma normalização, a comparação honesta é arquitetural, não numérica. Um aplicativo de ditado precisa de uma transcrição, rápida, em contexto, sem que nada saia do dispositivo. Um modelo multimodal precisa compreender o áudio. Tarefas diferentes — e a segunda não substitui automaticamente a primeira.
Quer testar a rota do ASR dedicado com a sua própria voz? Experimente o Weesper Neon Flow gratuitamente por 15 dias no macOS ou Windows — Whisper rodando localmente, sem conta, sem upload, sem cobrança por minuto.