Réponse directe — Whisper ou Gemma 4 : lequel est le meilleur pour la dictée on-device ? Ils sont conçus pour des usages différents. Whisper est un modèle de reconnaissance vocale dédié dont la seule sortie est une transcription. Gemma 4 est un modèle de langage multimodal qui accepte l’audio parmi d’autres entrées et peut raisonner à son sujet. Aucun benchmark public n’évalue les deux modèles sur le même jeu de test vocal, si bien que toute personne citant un chiffre de précision comparatif compare en réalité deux mesures différentes. Pour la dictée, le modèle dédié reste le choix d’ingénierie le plus sûr.

Depuis que Google a publié Gemma 4, la même question revient sans cesse chez les développeurs et les utilisateurs techniques : si un modèle multimodal généraliste peut désormais transcrire de l’audio sur un ordinateur portable, un modèle de reconnaissance vocale dédié comme Whisper reste-t-il le bon moteur pour la précision de dictée on-device ?

C’est une bonne question, et la plupart des réponses qui circulent s’appuient sur des chiffres qui ne résistent pas à un examen des sources primaires. Cet article compare les deux modèles de reconnaissance vocale on-device sur ce qui est réellement documenté — architecture, évaluations publiées, contraintes — et reste honnête sur les limites de ce que l’on sait.

Que sont Whisper et Gemma 4 ?

Ils appartiennent à deux familles de modèles différentes, avec des objectifs de conception différents.

Whisper est un modèle de reconnaissance automatique de la parole publié par OpenAI. L’article qui le décrit, Robust Speech Recognition via Large-Scale Weak Supervision, a été soumis en décembre 2022 et rapporte un entraînement sur 680 000 heures de supervision multilingue et multitâche, les modèles atteignant des performances de référence compétitives en configuration zero-shot. Le point de contrôle phare actuel, large-v3, est documenté sur sa fiche modèle comme un transformeur encodeur-décodeur de 1 550 M de paramètres, entraîné sur 1 million d’heures d’audio faiblement annoté et 4 millions d’heures d’audio pseudo-annoté, et OpenAI indique une « réduction de 10 % à 20 % des erreurs par rapport à Whisper large-v2 ». Sa sortie est une transcription. C’est tout son périmètre.

Gemma 4 est la famille de modèles open weights de Google. Google a annoncé Gemma 4 12B le 3 juin 2026 comme, selon ses propres mots, « notre premier modèle de taille intermédiaire à intégrer des entrées audio natives ». La fiche modèle Gemma 4 répertorie cinq tailles — E2B, E4B, 12B Unified, 26B A4B (Mixture-of-Experts) et 31B Dense — parmi lesquelles seules E2B, E4B et 12B acceptent l’audio. Sa sortie est du texte de la nature demandée : une transcription, une traduction, un résumé, une réponse.

Le chemin audio de Gemma 4 n’est pas une architecture unique

Le Technical Report de Gemma 4 décrit « des encodeurs vision et audio améliorés pour toutes les tailles de modèle », ainsi qu’« une architecture unifiée, sans encodeur, pour notre modèle 12B, qui ingère l’audio brut et les patches d’image ». L’article de lancement de Google formule la seconde moitié plus crûment : pour le 12B, l’équipe a « entièrement supprimé l’encodeur audio et projeté le signal audio brut dans le même espace dimensionnel que les tokens de texte ».

« L’audio de Gemma 4 » désigne donc deux choses différentes selon la taille du modèle. Les variantes E2B et E4B embarquent un encodeur audio dédié — la fiche Hugging Face de gemma-4-E4B-it l’estime à environ 300 M de paramètres. Le 12B, lui, n’en a pas.

En quoi les deux architectures diffèrent-elles pour la dictée ?

La différence qui compte pour la dictée est ce qui se trouve entre le microphone et le champ de texte.

Le décodeur de Whisper n’existe que pour produire une transcription, rien d’autre. Le décodeur de Gemma 4 est un modèle de langage qui fait de la génération à usage général, et la transcription n’est qu’une instruction parmi d’autres. C’est un véritable avantage en capacité quand vous voulez que l’audio soit compris, et un détour inutile quand vous voulez seulement qu’il soit retranscrit.

Whisper large-v3Gemma 4 E2B / E4BGemma 4 12B
Type de modèleASR dédiéLLM multimodalLLM multimodal
Paramètres1 550 M2,3B / 4,5B effectifs (5,1B / 8B avec les embeddings)11,95B
Chemin audioEncodeur-décodeur, audio en entrée, texte en sortieEncodeur audio dédié (~300 M sur E4B)Sans encodeur : audio brut projeté dans l’espace d’embedding du texte
SortieTranscription uniquementTranscription, traduction, résumé, réponsesTranscription, traduction, résumé, réponses
Fenêtre audio documentéeChamp récepteur de 30 secondes ; fichiers longs via une fenêtre glissante de 30 secondes30 secondes30 secondes
Langues documentées9912 dans l’évaluation FLEURS publiée12 dans l’évaluation FLEURS publiée
ConditionsLicence MIT pour le code et les poids du modèleOpen weights, « utilisation commerciale responsable » selon les conditions de GemmaIdentique

Sources pour chaque cellule : le dépôt openai/whisper et sa fiche modèle ; la fiche modèle Gemma 4 de Google, sa documentation audio et son Technical Report.

Deux lignes méritent un second regard.

La fenêtre de 30 secondes est une contrainte partagée, atteinte depuis deux directions opposées. La documentation d’OpenAI décrit un champ récepteur de 30 secondes et explique que sa méthode transcribe() « traite l’audio avec une fenêtre glissante de 30 secondes ». La documentation audio de Google indique sans détour que « l’audio prend en charge une durée maximale de 30 secondes ». Aucun des deux modèles n’avale un enregistrement d’une heure en un seul passage ; tous deux nécessitent une logique de découpage autour d’eux.

La ligne des langues n’est pas une comparaison à périmètre égal. Les 99 langues de Whisper constituent une couverture documentée. Les 12 de Gemma 4 correspondent à la taille de l’ensemble d’évaluation publié par Google, pas à un plafond de ce que le modèle peut tenter — mais en dehors de ces 12 langues, vous ne disposez d’aucune mesure publiée sur laquelle vous appuyer.

Existe-t-il un benchmark publié qui les compare directement ?

Non — et c’est la chose la plus importante à savoir avant de faire confiance à une comparaison que vous lisez.

Le Technical Report de Gemma 4 de Google contient un tableau d’évaluation vocale, « FLEURS ASR (WER, plus bas est meilleur) », couvrant 12 langues. Chaque modèle de ce tableau est un modèle Gemma : Gemma 4 E2B et E4B mesurés face à leurs prédécesseurs Gemma 3n. Whisper n’apparaît nulle part comme référence dans l’évaluation audio. OpenAI, de son côté, publie la répartition par langue de Whisper sur Common Voice et FLEURS, évaluée selon ses propres termes et sa propre liste de langues.

La conséquence est inévitable. Pour produire une phrase du type « Whisper obtient X % et Gemma obtient Y % », il faut prendre un chiffre issu d’une évaluation et le placer à côté d’un chiffre issu d’une autre — sous-ensembles de langues différents, normalisation de texte différente, transcriptions de référence différentes, années différentes. L’arithmétique fonctionne. La comparaison, elle, ne fonctionne pas.

Ce n’est pas un problème spécifique à Gemma. C’est l’état normal du benchmarking en ASR, et c’est pourquoi notre guide sur la précision de la reconnaissance vocale passe plus de temps sur la façon dont un chiffre a été produit que sur le chiffre lui-même. Le taux d’erreur sur les mots (WER) est la proportion de mots qu’un système restitue de façon erronée — substitutions, suppressions et insertions, divisées par le nombre de mots de la référence. Il décrit une exécution, pas un modèle.

Changez l’un des éléments suivants, et les mêmes poids produiront un WER différent :

Que montrent réellement les chiffres vocaux publiés de Gemma 4 ?

Ils montrent une amélioration générationnelle nette par rapport à Gemma 3n, et ils montrent pourquoi une moyenne est un mauvais résumé.

Voici les valeurs du Tableau 7 du Technical Report de Gemma 4 — FLEURS, parole lue, WER où plus bas est meilleur, moyenné sur les 12 langues évaluées par Google, converties ici des fractions décimales du rapport en pourcentages :

ModèleMoyenne, 12 languesAnglaisAllemandFrançaisEspagnol
Gemma 3n E2B10,8 %7,6 %7,9 %13,0 %5,1 %
Gemma 3n E4B8,5 %6,6 %6,5 %9,8 %4,1 %
Gemma 4 E2B9,0 %8,0 %7,6 %10,1 %4,2 %
Gemma 4 E4B7,5 %6,5 %6,1 %8,0 %3,5 %

Deux réserves accompagnent ce tableau et ne doivent pas être laissées de côté. D’abord, la moyenne sur 12 langues mélange les conventions de notation, car Google indique un taux d’erreur sur les caractères plutôt qu’un taux d’erreur sur les mots pour certaines langues de l’ensemble. Ensuite, la fiche modèle de Google indique séparément 0,069 pour le 12B sur FLEURS, mais le signale comme « hors langue chinoise » — un ensemble de langues différent, qui ne se place donc pas sur la même ligne que les autres.

Voici la partie intéressante. Gemma 4 E2B améliore la moyenne sur 12 langues par rapport à Gemma 3n E2B, de 10,8 % à 9,0 % — mais son WER en anglais évolue dans l’autre sens, de 7,6 % à 8,0 %. Un modèle peut s’améliorer en moyenne et se dégrader sur la langue que vous dictez réellement. Si votre usage est la dictée en anglais, la moyenne n’a jamais été le chiffre qu’il vous fallait.

C’est l’argument en faveur d’un benchmark sur votre propre audio, dans votre propre langue, plutôt que de choisir un modèle sur la ligne d’un classement.

Quel modèle choisir pour la dictée on-device ?

Choisissez en fonction de la sortie dont vous avez besoin, pas du titre qui vous a impressionné.

Choisissez un modèle ASR dédié comme Whisper quand :

Choisissez un modèle multimodal comme Gemma 4 quand :

Il existe une troisième réponse, souvent la bonne : les deux, à des moments différents. Transcrivez avec le modèle dédié, puis transmettez le texte à un modèle de langage s’il a besoin d’être retravaillé. C’est un pipeline plus simple que de demander à un seul modèle d’exceller dans deux tâches, et chaque étape reste testable indépendamment.

Où se situe Weesper Neon Flow

Weesper Neon Flow exécute Whisper localement via whisper.cpp sur macOS et Windows, avec plus de 50 langues, aucun appel réseau et un essai gratuit de 15 jours. Ce choix n’est pas une affirmation selon laquelle Whisper serait le meilleur modèle vocal qui existe — c’est une affirmation sur l’adéquation.

La dictée est une boucle sensible à la latence qui se déroule dans l’application où vous vous trouvez déjà : un e-mail, un éditeur de code, une note clinique. Ce dont elle a besoin, c’est d’une transcription, rapide, encore et encore, sans que rien ne quitte la machine. Un modèle ASR dédié produit exactement cette sortie, si bien que le budget d’ingénierie va dans l’expérience de dictée — raccourcis clavier, insertion de texte, vocabulaire personnalisé. La documentation d’aide couvre les modèles, les langues et les autorisations.

Nous suivons attentivement l’approche alternative. Notre test de l’application de dictée Eloquent de Google examine la dictée on-device basée sur Gemma dans un produit grand public commercialisé, et notre comparaison entre Voxtral et Whisper couvre le versant ASR dédié du même marché. Pour la question de savoir où l’inférence devrait avoir lieu, consultez notre comparaison entre transcription locale et transcription cloud.

Questions fréquentes

Gemma 4 est-il plus précis que Whisper pour la dictée ?

Il n’existe aucune réponse publiée comparant directement les deux modèles. Le Technical Report de Gemma 4 de Google évalue la reconnaissance vocale de Gemma 4 sur FLEURS face à son propre prédécesseur, Gemma 3n, et n’inclut pas Whisper comme référence. Les évaluations de Whisper par OpenAI utilisent des jeux de test différents et une liste de langues différente. Tout chiffre unique affirmant qu’un modèle devance l’autre d’une marge donnée assemble deux mesures qui n’ont jamais été réalisées dans les mêmes conditions.

Gemma 4 dispose-t-il d’un encodeur audio ?

Cela dépend de la taille. Le Technical Report décrit des encodeurs audio améliorés pour les tailles de modèle en général, et une architecture distincte, unifiée et sans encodeur pour le 12B, qui ingère directement l’audio brut et les patches d’image. La fiche Hugging Face de gemma-4-E4B-it indique un encodeur audio d’environ 300 M de paramètres. E2B et E4B utilisent donc un encodeur audio dédié ; le 12B projette le signal brut dans le même espace que les tokens de texte.

Qu’est-ce que le taux d’erreur sur les mots (WER), et pourquoi les chiffres de WER publiés diffèrent-ils ?

Le taux d’erreur sur les mots (Word Error Rate, WER) est la proportion de mots qu’un système restitue de façon erronée, en comptant les substitutions, les suppressions et les insertions par rapport à une transcription de référence. C’est un ratio, pas une propriété d’un modèle. Changez le jeu de données, la langue, les conditions d’enregistrement, les règles de normalisation ou la transcription de référence, et les mêmes poids produiront un WER différent. Un chiffre n’a de sens qu’avec son périmètre précisé.

Gemma 4 peut-il transcrire un audio de plus de 30 secondes ?

La documentation audio de Google précise que l’audio prend en charge une durée maximale de 30 secondes. Whisper présente une contrainte de même nature, mais abordée dans l’autre sens : la documentation d’OpenAI décrit un champ récepteur de 30 secondes, et sa méthode transcribe traite les fichiers longs via une fenêtre glissante de 30 secondes. Dans les deux cas, les enregistrements plus longs nécessitent une logique de découpage autour du modèle plutôt qu’un passage unique.

Quel modèle utilise Weesper Neon Flow, et pourquoi ?

Weesper Neon Flow exécute Whisper localement via whisper.cpp sur macOS et Windows. La raison tient au périmètre : la dictée a besoin d’une seule chose faite bien et de façon répétée — transformer la parole en texte avec une faible latence, dans l’application où vous vous trouvez. Un modèle de reconnaissance vocale dédié produit exactement cette sortie et dispose d’un runtime on-device mature, si bien que l’effort d’ingénierie se concentre sur l’expérience de dictée plutôt que sur la contrainte d’un modèle généraliste à une seule tâche.

Les développeurs qui construisent une fonctionnalité de dictée doivent-ils choisir un modèle ASR ou un LLM multimodal ?

Choisissez en fonction de la sortie attendue, pas du titre qui a retenu votre attention. Si vous avez besoin d’une transcription qui arrive dans un champ de texte, un modèle ASR dédié est le chemin le plus court. Si vous avez besoin que l’audio soit compris plutôt que retranscrit — résumé, interrogé, classé —, un modèle multimodal fait en une étape ce qui nécessiterait sinon une transcription suivie d’un second modèle. De nombreux produits veulent les deux, à différents moments du flux de travail.

Le point à retenir

Gemma 4 est un travail significatif : une famille open weights où trois tailles sur cinq acceptent l’audio nativement, et où le 12B abandonne entièrement l’encodeur audio. Elle ne constitue pas, sur la base de ce qui est publié, un remplacement mesuré d’un modèle ASR dédié dans un produit de dictée — car personne n’a publié cette mesure.

Tant que personne n’aura exécuté les deux modèles sur le même jeu de test avec la même normalisation, la comparaison honnête reste architecturale plutôt que numérique. Une application de dictée a besoin d’une transcription, rapide, en contexte, sans que rien ne quitte l’appareil. Un modèle multimodal a besoin de comprendre l’audio. Ce sont des tâches différentes — et la seconde n’englobe pas automatiquement la première.

Envie de tester l’approche ASR dédiée sur votre propre voix ? Essayez Weesper Neon Flow gratuitement pendant 15 jours sur macOS ou Windows — Whisper qui s’exécute localement, sans compte, sans envoi de fichier, sans compteur à la minute.