Réponse directe — Faut-il choisir Whisper large-v3 Turbo ou Distil-Whisper en 2026 ? Choisissez Whisper large-v3 Turbo si vous dictez dans plusieurs langues : il conserve les 99 langues en 809 M de paramètres. Choisissez Distil-Whisper (distil-large-v3, 756 M) uniquement pour l’anglais, où sa fiche modèle annonce une latence relative de 6,3x par rapport à large-v3. Les deux peuvent tourner sous whisper.cpp. Les écarts de précision entre les deux familles sont faibles ; la couverture linguistique, elle, ne l’est pas.

Choisir le meilleur modèle Whisper en 2026 commence par une comparaison de modèles vocaux locaux, pas par un tableau de tailles. Le large-v3 Turbo d’OpenAI et le Distil-Whisper de Hugging Face compressent tous deux le large-v3, à 1 550 M de paramètres, à environ la moitié de sa taille, et les deux existent pour la même raison : le décodage était trop lent pour une dictée en temps réel confortable.

Ils ont emprunté des chemins différents pour y parvenir, et ces chemins produisent des compromis réellement différents. Cette comparaison couvre ce que chaque modèle change architecturalement, ce que mesurent réellement les taux d’erreur sur les mots publiés, comment les deux se comportent au sein de whisper.cpp, et lequel a sa place dans un flux de dictée.

Si vous êtes encore en train d’assembler votre environnement d’exécution, commencez par notre guide d’installation de whisper.cpp.

Qu’est-ce que Whisper large-v3 Turbo ?

Whisper large-v3 Turbo est une version élaguée et affinée de large-v3, comptant 809 M de paramètres. La fiche modèle d’OpenAI le décrit comme « une version fine-tunée d’un large-v3 élagué » dans laquelle « le nombre de couches de décodage est passé de 32 à 4 ».

L’élagage (pruning) consiste à retirer des composants entiers d’un réseau entraîné — ici, 28 des 32 couches du décodeur — puis à affiner ce qui reste pour qu’il retrouve la majeure partie du comportement perdu. L’encodeur, qui transforme l’audio en représentation interne, n’est pas modifié.

Cette asymétrie constitue toute la conception. Dans Whisper, l’encodeur s’exécute une fois par fenêtre de 30 secondes tandis que le décodeur s’exécute une fois par token généré, si bien que le décodeur domine la latence sur les transcriptions longues.

Point important, Turbo conserve la tête multilingue. La fiche modèle liste les mêmes 99 langues que large-v3, ce qui en fait un remplacement direct plutôt qu’une variante spécialisée.

Qu’est-ce que Distil-Whisper, et pourquoi est-il réservé à l’anglais ?

Distil-Whisper est une famille de modèles réservés à l’anglais, entraînés par distillation de connaissances à partir de Whisper large-v2 et large-v3. La distillation de connaissances entraîne un modèle « élève » plus petit à reproduire les sorties d’un modèle « enseignant » plus grand, plutôt que d’apprendre uniquement à partir d’étiquettes de vérité terrain.

L’article Distil-Whisper (arXiv:2311.00430) rapporte un élève comptant « 51 % de paramètres en moins » et « 5,8 fois plus rapide », tout en restant « à moins de 1 % de WER sur des données de test hors distribution » dans un scénario de transfert zero-shot. Ces chiffres décrivent distil-large-v2.

Comme Turbo, Distil-Whisper conserve l’encodeur : la fiche modèle précise qu’il « est entièrement copié de l’enseignant vers l’élève et figé pendant l’entraînement ». Les gains proviennent là aussi d’un décodeur drastiquement raccourci.

La limitation linguistique n’est pas un oubli mais une contrainte liée aux données d’entraînement. Le dépôt Distil-Whisper indique clairement que la série « n’est disponible que pour la reconnaissance vocale en anglais » et recommande « d’utiliser le checkpoint Whisper Turbo » pour les usages multilingues.

La famille Distil-Whisper publiée

ModèleParamètresLatence relativeWER forme courteWER forme longue
distil-large-v3756 M6,3x9,7 %10,8 %
distil-large-v2756 M5,8x10,1 %11,6 %
distil-medium.en394 M6,8x11,1 %12,4 %
distil-small.en166 M5,6x12,1 %12,8 %

Chiffres tels que publiés dans le dépôt Distil-Whisper. Les quatre modèles sont réservés à l’anglais ; la latence est relative à Whisper large-v3, fixée à 1,0.

Whisper V3 Turbo vs Distil-Whisper : spécifications comparées

Les deux modèles sont proches en taille et très éloignés en portée. Voici ce que publient les fiches modèles officielles.

AttributWhisper large-v3large-v3 Turbodistil-large-v3
Paramètres1 550 M809 M756 M
Langues9999Anglais uniquement
Couches du décodeur324Raccourci (encodeur figé)
Facteur de vitesse publiéréférenceaucun publiélatence relative de 6,3x
Méthodeélagage + fine-tuningdistillation de connaissances
Cible de téléchargement whisper.cpp❌ conversion requise

Une ligne mérite l’attention : OpenAI ne publie aucun facteur de vitesse chiffré pour Turbo. La fiche modèle indique seulement que « le modèle est beaucoup plus rapide, au prix d’une légère dégradation de la qualité ». Tout multiplicateur précis que vous voyez cité pour Turbo provient de tests tiers, pas d’OpenAI.

Quel modèle est le plus précis en 2026 ?

Les deux perdent en précision par rapport à large-v3, et les deux perdent moins que ne le laisserait supposer leur réduction de taille. Mais les deux familles publient leurs chiffres sur des benchmarks différents, donc les chiffres phares ne sont pas directement comparables.

Les résultats d’évaluation publiés sur les fiches modèles d’OpenAI indiquent un taux d’erreur moyen sur les mots de 7,83 pour large-v3-turbo contre 7,44 pour large-v3, sur la suite English Open ASR Leaderboard — un écart d’environ 0,4 point.

L’équipe Distil-Whisper évalue sur sa propre suite anglaise, où distil-large-v3 enregistre un WER de 9,7 % en forme courte contre 8,4 % pour large-v3, et 10,8 % sur de l’audio long séquentiel contre 10,0 % pour large-v3. Sur du long format découpé (chunked), le modèle distillé passe même légèrement devant : 10,9 % contre 11,0 %.

Ne soustrayez pas 7,83 à 9,7. Des jeux de données différents, des algorithmes de décodage différents et des durées d’audio différentes produisent des WER absolus différents pour un même modèle. Chaque chiffre n’a de sens que rapporté à sa propre référence.

Le résumé honnête : par rapport à large-v3, Turbo perd environ un demi-point de WER sur le leaderboard anglais, et distil-large-v3 perd environ 1,3 point en forme courte et 0,8 point en forme longue séquentielle sur la suite Distil-Whisper. Pour la dictée, les deux se situent largement dans la plage où la qualité du microphone et le bruit de fond dominent le résultat.

Nous avons expliqué comment lire des chiffres de benchmark vocal sans les sur-interpréter dans notre comparatif Voxtral et Whisper.

Quel est le modèle Whisper le plus rapide en pratique ?

Pour des usages exclusivement en anglais sur une machine locale, Distil-Whisper dispose de la preuve publiée la plus solide. Sa fiche modèle inclut une mesure spécifique à whisper.cpp : « Dans un benchmark provisoire sur Mac M1, distil-large-v3 est plus de 5x plus rapide que Whisper large-v3. »

C’est une affirmation cadrée et reproductible — un runtime nommé, un matériel nommé, une comparaison nommée — et c’est le genre de chiffre digne de confiance. Elle est aussi explicitement qualifiée de provisoire.

L’avantage de Turbo est plus difficile à quantifier car OpenAI a choisi de ne pas en publier un. Structurellement, réduire le décodeur de 32 à 4 couches supprime le même goulot d’étranglement que vise Distil-Whisper, donc les deux devraient se situer dans une plage globalement similaire sur le même matériel.

Trois variables font davantage bouger le débit réel que le choix du checkpoint :

Comment les deux modèles se comportent-ils au sein de whisper.cpp ?

Turbo est plus simple à adopter. Le dépôt whisper.cpp liste large-v3-turbo parmi ses modèles téléchargeables, aux côtés des autres checkpoints officiels, si bien que récupérer le fichier ggml tient en une seule commande.

Distil-Whisper ne fait pas partie de ces cibles de téléchargement. La fiche modèle de distil-large-v3 documente son exécution « avec le paquet Whisper.cpp, avec l’algorithme de transcription séquentielle en forme longue d’origine », ce qui implique une étape de conversion avant d’obtenir un fichier ggml utilisable.

Cette différence compte plus qu’il n’y paraît. Un modèle que vous pouvez récupérer directement reste à jour avec les publications en amont ; un modèle que vous convertissez vous-même est une étape que vous devez maintenir.

La mémoire est l’autre contrainte pratique. whisper.cpp documente environ 3,9 Go pour un modèle de classe large, si bien qu’un checkpoint de taille moitié moindre est ce qui rend la dictée locale viable sur une machine à 8 Go de RAM.

Quel modèle choisir ?

Parcourez cette liste et arrêtez-vous à la première ligne qui correspond à votre cas.

  1. Vous dictez dans plusieurs langues. Prenez large-v3 Turbo. Distil-Whisper ne peut pas vous servir, et le projet Distil-Whisper le dit lui-même.
  2. Anglais uniquement, et la latence est votre contrainte principale. Prenez distil-large-v3, acceptez l’étape de conversion, et validez sur votre propre audio.
  3. Anglais uniquement, et vous voulez le chemin de maintenance le plus simple. Prenez quand même large-v3 Turbo. La tête multilingue ne vous coûte rien au moment de l’inférence.
  4. La précision avant tout, la vitesse en second. Restez sur le large-v3 complet.
  5. Vous voulez de la dictée, pas un pipeline de modèles. Utilisez une application qui gère le checkpoint à votre place.

Cette dernière ligne est celle sur laquelle atterrit la plupart des gens. Compiler un environnement d’exécution, convertir des checkpoints et régler la quantisation, c’est un après-midi réellement intéressant — et un engagement hebdomadaire médiocre.

Weesper Neon Flow est construit sur whisper.cpp, fonctionne entièrement hors ligne sans qu’aucun audio ne quitte l’appareil, prend en charge plus de 55 langues, et utilise l’accélération Metal sur Apple Silicon. Essayez Weesper gratuitement pendant 15 jours si vous préférez dicter plutôt que benchmarker.

En résumé : Whisper V3 Turbo vs Distil-Whisper

Ces deux modèles résolvent le même problème — un décodeur trop lent pour un usage en temps réel — avec des outils différents, et ils atterrissent dans une classe de taille similaire : 809 M contre 756 M de paramètres, tous deux environ moitié moins que large-v3.

L’écart de précision entre eux est assez faible pour que votre microphone compte davantage. L’écart de langues, lui, est absolu : 99 langues contre une seule. Pour quiconque ne travaille pas exclusivement en anglais, cette seule ligne tranche la comparaison avant même que la vitesse n’entre en jeu.

Si vous voulez voir comment ces modèles locaux se comparent aux moteurs intégrés à votre système d’exploitation, lisez notre analyse d’Apple Dictation et OpenAI Whisper.

Prêt à dicter hors ligne ? Installez Weesper Neon Flow sur macOS ou Windows, ou parcourez le Centre d’aide pour la configuration et les réglages de langue.