Réponse directe — Parakeet ou Whisper, lequel est le meilleur pour la transcription de fichiers ? Sur la précision, Parakeet devance de peu sur les deux classements anglais de l’Open ASR Leaderboard 2026 : un taux d’erreur mot (WER) moyen de 6,32 % contre 7,44 % pour Whisper large-v3 sur les extraits courts, et 10,7 % contre 11,2 % sur les enregistrements longs. Sur les cinq langues européennes où les deux modèles sont mesurés, ils font jeu égal à 4,81 %. La différence décisive, c’est la couverture linguistique : Whisper gère 99 langues, Parakeet 25.
Toutes les comparaisons transcription parakeet vs whisper publiées cette année reprennent le même titre choc : le modèle de NVIDIA serait plus précis et bien plus rapide que celui d’OpenAI. Cette affirmation se vérifie — et elle tranche beaucoup moins de choses qu’il n’y paraît.
Le papier de l’Open ASR Leaderboard qui est à l’origine de ce chiffre comporte plusieurs classements distincts, et l’écart de précision parakeet vs whisper ne se comporte pas de la même façon sur chacun. En les lisant tous, la décision pour une véritable archive ne dépend plus du tout de la première décimale.
Ce guide les aborde dans l’ordre qui compte au moment de choisir le meilleur modèle de transcription locale 2026 pour des entretiens, des cours ou des fichiers vidéo : ce qu’est chaque modèle, ce que mesure l’écart sur les extraits courts, ce qu’il devient sur des enregistrements d’une heure, où la couverture linguistique trace une frontière nette, et ce qui subsiste une fois que le modèle quitte le GPU d’un datacentre pour atterrir sur votre Mac.
Parakeet et Whisper : que sont ces modèles et en quoi diffèrent-ils ?
Deux familles de modèles de reconnaissance vocale ouverts, construites sur des architectures différentes pour des priorités différentes. Aucun des deux n’est un produit : ce sont des poids de modèle que l’on exécute à l’intérieur d’autre chose.
Parakeet TDT 0.6B v3 est le modèle multilingue de NVIDIA, décrit sur sa fiche comme un système de 600 millions de paramètres à architecture FastConformer-TDT, publié sous licence CC-BY-4.0. TDT signifie token-and-duration transducer : au lieu d’évaluer chaque frame audio, le décodeur prédit de combien avancer, ce qui explique son débit.
Whisper large-v3 est le transformeur encodeur-décodeur d’OpenAI, entraîné sur ce que sa fiche décrit comme « 1 million d’heures d’audio faiblement étiqueté et 4 millions d’heures d’audio pseudo-étiqueté collecté à l’aide de Whisper large-v2 », avec une réduction d’erreurs annoncée de « 10 % à 20 % par rapport à Whisper large-v2 ».
Whisper large-v3-turbo est la variante que la plupart des apps Mac utilisent réellement. Sa fiche est directe sur le compromis : « c’est exactement le même modèle, sauf que le nombre de couches de décodage est passé de 32 à 4 », si bien que « le modèle est bien plus rapide, au prix d’une légère dégradation de la qualité ».
| Parakeet TDT 0.6B v3 | Whisper large-v3 | Whisper large-v3-turbo | |
|---|---|---|---|
| Éditeur | NVIDIA | OpenAI | OpenAI |
| Architecture | FastConformer-TDT | Transformeur encodeur-décodeur | Identique, décodeur réduit à 4 couches |
| Paramètres | 600 millions | 1 550 M | 809 M |
| Langues | 25 (toutes européennes) | 99 | 99 |
| Ponctuation et casse | Automatique | Automatique | Automatique |
| Horodatage | Au mot et au segment | Au segment et au mot | Au segment et au mot |
| Licence indiquée sur la fiche | CC-BY-4.0 | Apache 2.0 | MIT |
Parakeet bat-il Whisper sur la précision ?
Sur le classement anglais des extraits courts, oui, avec 1,12 point d’écart. Le papier de l’Open ASR Leaderboard — qui compare 86 systèmes open source et propriétaires sur 12 jeux de données — indique un taux d’erreur mot moyen de 6,32 % pour Parakeet TDT 0.6B v3 contre 7,44 % pour Whisper large-v3.
Le contexte compte plus que l’écart lui-même. Cette moyenne est calculée sur les jeux de données anglais à extraits courts du classement — dont AMI, GigaSpeech, LibriSpeech clean et other, SPGISpeech, VoxPopuli et un sous-ensemble de cinq heures d’Earnings22 — qui sont en grande majorité des extraits pré-segmentés plutôt que des enregistrements continus d’une heure.
Les chiffres de vitesse proviennent de la même campagne de mesure. Le facteur temps réel inverse (RTFx), défini dans le papier comme la durée audio totale divisée par le temps de transcription, a été mesuré sur un GPU NVIDIA A100-SXM4-80GB avec une taille de batch de 64.
| Classement anglais, extraits courts | WER moyen | RTFx (A100, batch 64) |
|---|---|---|
| NVIDIA Parakeet TDT 0.6B v2 | 6,05 % | 3 390 |
| NVIDIA Parakeet TDT 0.6B v3 | 6,32 % | 3 330 |
| NVIDIA Parakeet CTC 1.1B | 7,40 % | 2 730 |
| OpenAI Whisper large-v3 | 7,44 % | 146 |
Lisez la colonne de droite avant de la répéter : elle décrit un GPU de datacentre qui traite 64 fichiers à la fois, pas un ordinateur portable qui traite un enregistrement après l’autre. Presque toutes les affirmations publiées sur la précision parakeet vs whisper s’arrêtent à ce tableau.
Cet écart tient-il sur des enregistrements d’une heure ?
Le classement tient. Les chiffres, non. Le leaderboard fait tourner un classement anglais distinct pour les enregistrements longs, sur CORAAL, Earnings21, l’intégralité d’Earnings22 et TED-LIUM v3 — des enregistrements continus plutôt que des extraits — et c’est ce tableau qui correspond à ce que vous déposez réellement dans une app de transcription.
Parakeet TDT 0.6B v3 y devance encore les deux versions de Whisper, avec un taux d’erreur mot moyen de 10,7 % contre 11,0 % pour large-v3-turbo et 11,2 % pour large-v3. Mais son avance de 1,12 point sur les extraits courts se réduit à un demi-point, et chaque modèle ouvert du tableau voit son taux d’erreur à peu près doubler par rapport aux extraits.
| Classement enregistrements longs (modèles ouverts) | WER moyen | RTFx (A100, batch 64) |
|---|---|---|
| Cohere Labs Transcribe | 9,73 % | 418 |
| NVIDIA Parakeet TDT 0.6B v3 | 10,7 % | 1 000 |
| OpenAI Whisper large-v3-turbo | 11,0 % | 148 |
| OpenAI Whisper large-v3 | 11,2 % | 68,6 |
| Distil-Whisper large-v3.5 | 11,7 % | 156 |
| NVIDIA Parakeet CTC 1.1B | 12,9 % | 2 790 |
Trois enseignements à en retenir. Aucune des deux familles n’arrive en tête du classement — Cohere Labs Transcribe devance les modèles ouverts, et quatre systèmes propriétaires accessibles par API se placent au-dessus de tous, entre 7,32 % et 9,54 %. Parakeet reste très nettement plus rapide sur toute la ligne, donc son avantage de débit est réel même là où son avance en précision est marginale. Et l’audio continu est simplement plus difficile pour tout le monde : un modèle à 6 % sur le benchmark devient un modèle à 11 % sur un enregistrement de deux heures, quelle que soit l’étiquette qu’il porte.
Le corpus Earnings22 illustre bien le phénomène : le classement à extraits courts n’en utilise qu’un sous-ensemble de cinq heures, tandis que le classement des enregistrements longs utilise l’intégralité des 119 heures, et les taux d’erreur évoluent en conséquence.
La raison architecturale est visible sur la fiche même de NVIDIA. Parakeet prend en charge « des fichiers audio jusqu’à 24 minutes avec attention complète (sur A100 80 Go) ou jusqu’à 3 heures avec attention locale » — un plafond documenté qu’un entretien de deux heures peut atteindre, et un changement de mode qu’une app de transcription doit gérer à votre place.
Quel modèle couvre le plus de langues pour la transcription de fichiers ?
Whisper, avec un facteur d’environ quatre, et c’est le seul endroit où les deux modèles se distinguent vraiment. Parakeet TDT 0.6B v3 prend en charge 25 langues, toutes européennes ; les fiches d’OpenAI pour large-v3 et large-v3-turbo indiquent toutes les deux 99 langues.
Dans la zone de recoupement, ils sont indissociables. Le classement multilingue du leaderboard évalue cinq langues — l’allemand, le français, l’italien, l’espagnol et le portugais, sur les jeux de données CoVoST-2 et FLEURS — et les deux modèles atterrissent exactement sur la même moyenne.
| WER moyen, classement multilingue | Whisper large-v3 | Parakeet TDT 0.6B v3 |
|---|---|---|
| Allemand | 4,26 % | 4,20 % |
| Français | 6,36 % | 5,42 % |
| Italien | 4,69 % | 4,81 % |
| Espagnol | 3,65 % | 3,73 % |
| Portugais | 4,96 % | 6,16 % |
| Moyenne des cinq | 4,81 % | 4,81 % |
Une égalité, répartie différemment selon les langues : Parakeet l’emporte en allemand et en français, Whisper en italien, en espagnol et en portugais. Au-delà de ces cinq langues, il n’y a plus de comparaison possible. Le japonais, l’arabe, l’hindi, le mandarin, le coréen, le turc et l’hébreu n’ont aucun jeton de langue chez Parakeet, et aucun débit ne compense une langue que le modèle n’a jamais appris à produire.
C’est cette frontière, et non un demi-point de taux d’erreur mot, qui explique pourquoi Weesper Transcribe s’appuie sur Whisper plutôt que sur le modèle le plus rapide : ce sont les 57 langues de transcription qui décident si un fichier d’une archive multilingue est transcrit ou non.
Qu’est-ce qui change quand le modèle quitte l’A100 pour tourner sur votre Mac ?
Presque tout, côté vitesse, et très peu, côté précision. C’est l’étape où les chiffres du leaderboard cessent d’être prédictifs.
Trois changements interviennent en même temps :
- Le batching disparaît. Un RTFx de 3 330 suppose 64 fichiers traités en parallèle sur un GPU de datacentre de 80 Go. Vous transcrivez un fichier à la fois, sur un ordinateur portable.
- Les poids sont quantifiés. Les apps Mac embarquent des modèles compressés pour tenir dans les budgets de mémoire et de batterie, ce qui modifie à la fois la vitesse et le taux d’erreur par rapport au chiffre publié.
- Le runtime fixe le plafond. whisper.cpp, l’implémentation C/C++ de Whisper, embarque le support de Core ML et de Metal ainsi que des fichiers de modèles quantifiés — c’est précisément pour cela qu’une grande partie de l’outillage Mac s’appuie sur Whisper plutôt que sur le modèle le plus rapide.
Weesper Transcribe prend cette voie : Whisper exécuté sur l’appareil via whisper.cpp, un modèle turbo quantifié aux côtés d’un modèle de base plus léger, avec accélération Metal sur Apple Silicon et prise en charge des Mac Intel avec AVX2, sous macOS 13 ou version ultérieure. Rien n’est envoyé en ligne : un entretien sous embargo reste sur la machine qui l’a enregistré.
Pour le détail au niveau des modèles derrière ce choix, notre comparaison turbo face à Distil-Whisper détaille le coût respectif de l’élagage et de la distillation, et notre panorama plus large des modèles vocaux open source les confronte tous les deux aux nouveaux arrivants.
Comment choisir entre les deux pour vos fichiers ?
Répondez à quatre questions dans l’ordre, et le meilleur modèle de transcription locale 2026 pour vos propres fichiers s’impose généralement de lui-même.
- Dans quelle langue est l’enregistrement ? En dehors des 25 langues européennes de Parakeet, la comparaison s’arrête là. Whisper est le seul des deux à disposer d’un jeton pour cette langue.
- Quelle est la durée des fichiers ? Les deux familles perdent environ quatre points de précision sur des enregistrements continus par rapport aux extraits segmentés : prévoyez donc du temps de correction sur un fichier de deux heures, quel que soit le modèle qui l’a produit.
- Sur quel matériel tourne-t-il ? Le débit de Parakeet a été mesuré sur un A100 avec un batch de 64. Si votre usage consiste à traiter un fichier à la fois sur un Mac, le ratio publié n’est pas celui que vous obtiendrez.
- De quoi avez-vous besoin après la transcription ? Horodatage, sous-titres, files de traitement par lot, corrections et recherche sont des propriétés de l’application, pas des poids du modèle.
Ce dernier point est celui que les tableaux de benchmark ne peuvent pas exprimer. Sur l’audio long, les deux familles ne sont séparées que d’un demi-point, alors que l’écart entre traiter un enregistrement de deux heures en une seule passe et le découper à la main fait toute la différence entre un travail terminé et un après-midi perdu.
En pratique, c’est le workflow qui tranche : traitement par lot sur tout un dossier, neuf formats d’export dont les SRT et VTT horodatés, édition en ligne avec horodatages cliquables, une API d’automatisation locale, et un historique que vous pouvez rechercher par sens plutôt que par mot-clé.
Conclusion
Parakeet TDT 0.6B v3 remporte le benchmark que la plupart des articles citent, et il remporte aussi celui qu’ils passent sous silence : devant Whisper à la fois sur les extraits anglais courts et sur les enregistrements d’une heure, avec un débit dont aucun modèle encodeur-décodeur ne s’approche. Sur les cinq langues européennes où les deux sont mesurés, ils font exactement match nul à 4,81 %.
Ce qui laisse le choix là où les tableaux ne peuvent pas trancher. Un demi-point de taux d’erreur mot sur de l’audio long ne fait pas une décision ; 99 langues prises en charge contre 25, si. Au-delà de l’ensemble européen de Parakeet, il n’y a pas de second candidat, et sur un Mac, c’est le runtime, la file de traitement par lot et la gestion des fichiers longs qui règlent le reste.
Envie de le tester sur votre propre enregistrement ? Découvrez comment fonctionne la transcription de fichiers sur l’appareil, ou téléchargez l’app depuis le Mac App Store — gratuite au téléchargement, macOS 13 ou version ultérieure, fichiers jusqu’à 15 minutes en pleine qualité, avec une mise à niveau Pro à l’achat unique plutôt qu’un abonnement.