Resposta direta — Whisper ou Gemma 4: qual é melhor para ditado local? Eles foram feitos para tarefas diferentes. O Whisper é um modelo de reconhecimento de fala dedicado cuja única saída é uma transcrição. O Gemma 4 é um modelo de linguagem multimodal que aceita áudio entre outras entradas e pode raciocinar sobre ele. Nenhum benchmark público avalia os dois no mesmo conjunto de teste de fala, então qualquer pessoa que cite um número de precisão comparando os dois está comparando medições diferentes. Para ditado, o modelo dedicado continua sendo a escolha de engenharia mais segura.

Desde que o Google publicou o Gemma 4, a mesma pergunta continua voltando de desenvolvedores e usuários técnicos: se um modelo multimodal geral agora consegue transcrever áudio em um laptop, um modelo de reconhecimento de fala dedicado como o Whisper ainda é o motor certo para a precisão do ditado local?

É uma boa pergunta, e a maioria das respostas em circulação se apoia em números que não resistem a uma checagem nas fontes primárias. Este artigo compara os dois modelos de reconhecimento de fala local com base no que está de fato documentado — arquitetura, avaliações publicadas, restrições — e é honesto sobre onde a informação disponível termina.

O que são o Whisper e o Gemma 4?

Eles pertencem a duas famílias de modelos diferentes, com objetivos de design diferentes.

O Whisper é um modelo de reconhecimento automático de fala lançado pela OpenAI. O artigo que o descreve, Robust Speech Recognition via Large-Scale Weak Supervision, foi submetido em dezembro de 2022 e relata treinamento em 680.000 horas de supervisão multilingual e multitarefa, com os modelos alcançando desempenho competitivo em benchmarks em um cenário de transferência zero-shot. O checkpoint principal atual, o large-v3, é documentado em seu model card como um Transformer encoder-decoder de 1.550M de parâmetros, treinado em 1 milhão de horas de áudio com rótulos fracos (weakly labelled) e 4 milhões de horas de áudio com pseudo-rótulos, e a OpenAI relata “redução de 10% a 20% nos erros em comparação com o Whisper large-v2”. Sua saída é uma transcrição. Essa é toda a superfície do modelo.

O Gemma 4 é a família de modelos com pesos abertos (open weights) do Google. O Google anunciou o Gemma 4 12B em 3 de junho de 2026 como, em suas próprias palavras, “nosso primeiro modelo de tamanho médio com entradas de áudio nativas”. O model card do Gemma 4 lista cinco tamanhos — E2B, E4B, 12B Unified, 26B A4B (Mixture-of-Experts) e 31B Dense — dos quais apenas o E2B, o E4B e o 12B aceitam áudio. Sua saída é texto do tipo que você pedir: uma transcrição, uma tradução, um resumo, uma resposta.

O caminho de áudio do Gemma 4 não é um design único

O Gemma 4 Technical Report descreve “encoders de visão e áudio melhorados para todos os tamanhos de modelo”, junto com “uma arquitetura unificada e sem encoder para nosso modelo 12B, que processa áudio bruto e patches de imagem”. O post de lançamento do Google coloca a segunda metade de forma mais direta: para o 12B, ele “removeu completamente o encoder de áudio e projetou o sinal de áudio bruto no mesmo espaço dimensional dos tokens de texto”.

Ou seja, “áudio no Gemma 4” significa duas coisas diferentes dependendo do tamanho. As variantes E2B e E4B têm um encoder de áudio dedicado — o card do Hugging Face para o gemma-4-E4B-it estima esse encoder em aproximadamente 300M de parâmetros. O 12B não tem.

Como as duas arquiteturas se diferenciam para o ditado?

A diferença que importa para o ditado é o que existe entre o microfone e o campo de texto.

O decoder do Whisper existe para emitir uma transcrição, e nada além disso. O decoder do Gemma 4 é um modelo de linguagem que faz geração de propósito geral, e a transcrição é apenas uma instrução entre muitas. Isso é uma vantagem real de capacidade quando você quer que o áudio seja compreendido, e um desvio desnecessário quando você só quer que ele seja transcrito.

Whisper large-v3Gemma 4 E2B / E4BGemma 4 12B
Tipo de modeloASR dedicadoLLM multimodalLLM multimodal
Parâmetros1.550M2,3B / 4,5B efetivos (5,1B / 8B com embeddings)11,95B
Caminho de áudioEncoder-decoder, áudio na entrada, texto na saídaEncoder de áudio dedicado (~300M no E4B)Sem encoder: áudio bruto projetado no espaço de embedding de texto
SaídaApenas transcriçãoTranscrição, tradução, resumo, respostasTranscrição, tradução, resumo, respostas
Janela de áudio documentadaCampo receptivo de 30 segundos; arquivos longos via janela deslizante de 30 segundos30 segundos30 segundos
Idiomas documentados9912 na avaliação FLEURS publicada12 na avaliação FLEURS publicada
TermosLicença MIT para código e pesos do modeloPesos abertos, “uso comercial responsável” sob os termos do GemmaMesmo

Fontes de cada célula: o repositório openai/whisper e seu model card; o model card do Gemma 4 do Google, a documentação de áudio e o Technical Report.

Duas linhas merecem um segundo olhar.

A janela de 30 segundos é uma restrição compartilhada, alcançada a partir de direções opostas. A documentação da OpenAI descreve um campo receptivo de 30 segundos e explica que seu método transcribe() “processa o áudio com uma janela deslizante de 30 segundos”. A documentação de áudio do Google afirma claramente que “o áudio suporta um comprimento máximo de 30 segundos”. Nenhum dos dois modelos processa uma gravação de uma hora em uma única passagem; ambos precisam de uma lógica de fragmentação em torno deles.

A linha de idiomas não é uma comparação equivalente. Os 99 idiomas do Whisper são uma cobertura documentada. O 12 do Gemma 4 é o tamanho do conjunto de avaliação que o Google publicou, não um limite para o que o modelo pode tentar — mas fora desses 12 idiomas você não tem nenhuma medição publicada para se basear.

Existe um benchmark publicado que os compara diretamente?

Não — e essa é a coisa mais importante a saber antes de confiar em qualquer comparação que você leia.

O Gemma 4 Technical Report do Google contém uma tabela de avaliação de fala, “FLEURS ASR (WER, quanto menor melhor)”, cobrindo 12 idiomas. Todos os modelos dessa tabela são modelos Gemma: o Gemma 4 E2B e o E4B medidos em comparação com seus predecessores Gemma 3n. O Whisper não aparece como referência em nenhum ponto da avaliação de áudio. A OpenAI, por sua vez, publica o detalhamento por idioma do Whisper no Common Voice e no FLEURS, avaliado em seus próprios termos e em sua própria lista de idiomas.

A consequência é inevitável. Para produzir uma frase do tipo “o Whisper marca X% e o Gemma marca Y%”, é preciso pegar um número de uma avaliação e colocá-lo ao lado de um número de outra — subconjuntos de idiomas diferentes, normalização de texto diferente, transcrições de referência diferentes, anos diferentes. A aritmética funciona. A comparação não.

Isso não é um problema específico do Gemma. É o estado normal do benchmarking de ASR, e é por isso que nosso guia de precisão em reconhecimento de fala dedica mais tempo a como um número foi produzido do que ao número em si. A taxa de erro de palavras (WER) é a proporção de palavras que um sistema erra — substituições, exclusões e inserções divididas pelo número de palavras na referência. Ela descreve uma execução, não um modelo.

Mude qualquer um dos itens abaixo e os mesmos pesos produzem um WER diferente:

O que os números de fala do Gemma 4 publicados pelo Google realmente mostram?

Eles mostram uma melhoria geracional clara em relação ao Gemma 3n, e mostram por que uma média é um resumo pobre.

Estes são os valores da Tabela 7 do Gemma 4 Technical Report — FLEURS, fala lida, WER em que quanto menor melhor, calculados como média nos 12 idiomas avaliados pelo Google, convertidos aqui das frações decimais do relatório para porcentagens:

ModeloMédia, 12 idiomasInglêsAlemãoFrancêsEspanhol
Gemma 3n E2B10,8%7,6%7,9%13,0%5,1%
Gemma 3n E4B8,5%6,6%6,5%9,8%4,1%
Gemma 4 E2B9,0%8,0%7,6%10,1%4,2%
Gemma 4 E4B7,5%6,5%6,1%8,0%3,5%

Duas ressalvas acompanham essa tabela e não devem ser descartadas. Primeiro, a média dos 12 idiomas mistura convenções de pontuação, porque o Google relata taxa de erro de caracteres em vez de taxa de erro de palavras para alguns idiomas do conjunto. Segundo, o model card do Google lista separadamente o 12B em 0,069 no FLEURS, mas sinaliza isso como “excluindo o idioma chinês” — um conjunto de idiomas diferente, então ele não fica na mesma linha que os outros.

Agora a parte interessante. O Gemma 4 E2B melhora a média dos 12 idiomas em relação ao Gemma 3n E2B, de 10,8% para 9,0% — mas seu WER em inglês vai na direção contrária, de 7,6% para 8,0%. Um modelo pode melhorar na média e piorar no idioma em que você realmente dita. Se o seu trabalho é ditado em inglês, a média nunca foi o número que você precisava.

Esse é o argumento para testar com o seu próprio áudio, no seu próprio idioma, em vez de escolher um modelo a partir de uma linha de um leaderboard.

Qual modelo você deve escolher para ditado local?

Escolha pelo resultado que você precisa, não pela manchete que te impressionou.

Escolha um modelo de ASR dedicado, como o Whisper, quando:

Escolha um modelo multimodal, como o Gemma 4, quando:

Existe uma terceira resposta que costuma estar certa: os dois, em pontos diferentes. Transcreva com o modelo dedicado e depois passe o texto para um modelo de linguagem se ele precisar de ajustes. Esse é um pipeline mais simples do que pedir que um único modelo se destaque em duas tarefas, e cada etapa permanece testável de forma independente.

Onde o Weesper Neon Flow se posiciona

O Weesper Neon Flow executa o Whisper localmente através do whisper.cpp no macOS e no Windows, com mais de 50 idiomas, nenhuma chamada de rede e um teste gratuito de 15 dias. Essa escolha não é uma afirmação de que o Whisper é o melhor modelo de fala que existe — é uma questão de adequação.

O ditado é um ciclo sensível à latência que acontece dentro de qualquer aplicativo em que você já esteja: um e-mail, um editor de código, uma anotação clínica. O que ele precisa é de uma transcrição, rápida, repetidamente, sem que nada saia da máquina. Um modelo de ASR dedicado produz exatamente essa saída, então o orçamento de engenharia vai para a experiência de ditado — atalhos de teclado (hotkeys), inserção de texto, vocabulário personalizado. A documentação de ajuda cobre modelos, idiomas e permissões.

Acompanhamos de perto a abordagem alternativa. Nossa análise do aplicativo de ditado Eloquent do Google examina o ditado local baseado em Gemma em um produto de consumo já lançado, e nossa comparação entre Voxtral e Whisper cobre o lado do ASR dedicado do mesmo mercado. Para saber onde a inferência deveria acontecer, veja nossa comparação entre transcrição local e em nuvem.

Perguntas frequentes

O Gemma 4 é mais preciso que o Whisper para ditado?

Não existe uma resposta direta publicada. O Gemma 4 Technical Report do Google avalia o reconhecimento de fala do Gemma 4 no FLEURS em comparação com seu próprio predecessor, o Gemma 3n, e não inclui o Whisper como referência. As avaliações do Whisper feitas pela OpenAI usam conjuntos de teste diferentes e uma lista de idiomas diferente. Qualquer número único que afirme que um supera o outro por uma determinada margem está combinando duas medições que nunca foram executadas nas mesmas condições.

O Gemma 4 tem um encoder de áudio?

Depende do tamanho. O Technical Report descreve encoders de áudio melhorados para os tamanhos de modelo em geral, e uma arquitetura unificada e sem encoder separada para o 12B, que processa áudio bruto e patches de imagem diretamente. O card do Hugging Face para o gemma-4-E4B-it lista um encoder de áudio de aproximadamente 300M de parâmetros. Ou seja, o E2B e o E4B usam um encoder de áudio dedicado; o 12B projeta o sinal bruto no mesmo espaço dos tokens de texto.

O que é a taxa de erro de palavras (WER), e por que os números de WER publicados divergem?

A taxa de erro de palavras (WER) é a proporção de palavras que um sistema erra, contando substituições, exclusões e inserções em relação a uma transcrição de referência. É uma proporção, não uma propriedade do modelo. Mude o conjunto de dados, o idioma, as condições de gravação, as regras de normalização ou a transcrição de referência, e os mesmos pesos produzem um WER diferente. Um número só tem significado quando acompanhado do seu escopo.

O Gemma 4 pode transcrever áudios com mais de 30 segundos?

A documentação de áudio do Google afirma que o áudio suporta um comprimento máximo de 30 segundos. O Whisper tem o mesmo tipo de restrição, mas por outro caminho: a documentação da OpenAI descreve um campo receptivo de 30 segundos, e seu método transcribe lida com arquivos longos usando uma janela deslizante de 30 segundos. Em ambos os casos, gravações mais longas exigem uma lógica de fragmentação em torno do modelo, em vez de uma única passagem por ele.

Qual modelo o Weesper Neon Flow usa, e por quê?

O Weesper Neon Flow executa o Whisper localmente por meio do whisper.cpp no macOS e no Windows. O motivo é o escopo: o ditado precisa de uma coisa feita bem e repetidamente — transformar fala em texto com baixa latência, dentro de qualquer aplicativo em que você esteja. Um modelo de reconhecimento de fala dedicado tem exatamente essa saída e um runtime local maduro, então o esforço de engenharia vai para a experiência de ditado, em vez de restringir um modelo geral a uma única tarefa.

Desenvolvedores que estão construindo um recurso de ditado devem escolher um modelo de ASR ou um LLM multimodal?

Escolha pelo resultado, não pela manchete. Se você precisa de uma transcrição que caia em um campo de texto, um modelo de ASR dedicado é o caminho mais curto. Se você precisa que o áudio seja compreendido em vez de apenas transcrito — resumido, consultado, classificado — um modelo multimodal faz em uma única etapa o que, de outra forma, seria transcrição seguida por um segundo modelo. Muitos produtos querem os dois, em pontos diferentes do fluxo de trabalho.

A conclusão prática

O Gemma 4 é um trabalho significativo: uma família de pesos abertos em que três dos cinco tamanhos recebem áudio nativamente, e em que o 12B elimina completamente o encoder de áudio. Ele não é, com base no que foi publicado, um substituto comprovado para um modelo de ASR dedicado em um produto de ditado — porque ninguém publicou essa comprovação.

Até que alguém execute os dois no mesmo conjunto de teste com a mesma normalização, a comparação honesta é arquitetural, não numérica. Um aplicativo de ditado precisa de uma transcrição, rápida, em contexto, sem que nada saia do dispositivo. Um modelo multimodal precisa compreender o áudio. Tarefas diferentes — e a segunda não substitui automaticamente a primeira.

Quer testar a rota do ASR dedicado com a sua própria voz? Experimente o Weesper Neon Flow gratuitamente por 15 dias no macOS ou Windows — Whisper rodando localmente, sem conta, sem upload, sem cobrança por minuto.