Réponse directe — en quoi Apple Dictation et OpenAI Whisper diffèrent-ils ? Apple Dictation est une fonctionnalité système de macOS : Apple documente son comportement et sa liste de locales, pas son architecture ni ses taux d’erreur. Whisper est un modèle encodeur-décodeur à poids ouverts d’OpenAI, entraîné sur 680 000 heures d’audio faiblement supervisé et publié en six tailles que vous pouvez inspecter et exécuter vous-même. L’un est une surface produit finie ; l’autre, un modèle sur lequel des produits se construisent.
Cherchez Apple Dictation vs OpenAI Whisper et la plupart des résultats répondent à une autre question : quelle application installer. Cette décision mérite d’être prise avec soin, et nous la traitons séparément dans un article sur si l’outil intégré suffit pour votre usage quotidien.
Cet article répond à la question plus étroite qui se cache dessous. En quoi les deux moteurs de reconnaissance diffèrent-ils réellement — dans leur architecture, leurs données d’entraînement, leur façon de compter la couverture linguistique, les tailles de modèle qu’ils exposent, et ce qu’un chiffre de précision publié signifie ou ne signifie pas ?
Que sont exactement Apple Dictation et Whisper ?
Ce ne sont pas des objets de même nature, ce qui explique pourquoi la comparaison directe est plus difficile qu’il n’y paraît. L’un est une fonctionnalité ; l’autre, un modèle.
Apple Dictation est la fonction de reconnaissance vocale intégrée à macOS. Vous appuyez sur une touche, vous parlez, et le texte apparaît dans le champ où vous étiez en train de taper. La documentation d’assistance d’Apple décrit ce que la fonction fait pour vous et où elle est disponible, et renvoie à la page de disponibilité des fonctionnalités de macOS pour la liste des langues.
OpenAI Whisper est un modèle de reconnaissance vocale. C’est un unique transformeur encodeur-décodeur qui effectue l’identification de la langue, la transcription et la traduction vers l’anglais, publié avec des poids ouverts et un code d’inférence. Il n’a ni interface, ni raccourci clavier, ni comportement de presse-papiers. Cela appartient à l’application qui l’encapsule.
Cette asymétrie traverse chaque comparaison ci-dessous. Vous utilisez Apple Dictation. Vous construisez sur Whisper.
En quoi les deux moteurs diffèrent-ils sous le capot ?
La différence la plus nette ne porte pas sur la précision — c’est la transparence. L’architecture de Whisper, le volume de ses données d’entraînement, ses tailles de modèle et ses résultats de benchmark sont publiés ; ceux d’Apple ne le sont pas.
L’article de Whisper décrit un modèle entraîné sur « 680 000 heures de supervision multilingue et multitâche », utilisant une supervision faible plutôt qu’un corpus soigneusement constitué à la main. Apple ne publie aucun chiffre équivalent pour Dictation, aucune description d’architecture et aucun tableau de benchmark.
| Axe technique | Apple Dictation (macOS) | OpenAI Whisper |
|---|---|---|
| Ce que c’est | Une fonctionnalité système intégrée à macOS | Un modèle de reconnaissance vocale à poids ouverts |
| Architecture publiée | ❌ Non documentée publiquement | ✅ Transformeur encodeur-décodeur (arXiv:2212.04356) |
| Volume de données d’entraînement communiqué | ❌ Non publié | ✅ 680 000 heures d’audio faiblement supervisé |
| Couverture comptée en | Locales — 63 entrées de dictée sur macOS Tahoe | Langues — 99 listées pour large-v3 |
| Tailles de modèle sélectionnables | ❌ Aucune exposée | ✅ Six, de 39 M à 1 550 M de paramètres |
| Taux d’erreur publiés | ❌ Aucun | ✅ Par benchmark nommé, avec conditions précisées |
| Traitement de l’audio | Non documenté | Champ récepteur de 30 secondes, fenêtre glissante |
| Limites connues documentées | ❌ Non publiées | ✅ Hallucination et disparité selon les accents mentionnées dans la fiche modèle |
| Qui fournit l’interface | Apple | Qui que ce soit qui construit l’application |
Rien de tout cela ne rend un moteur meilleur que l’autre. Cela les rend simplement connaissables différemment. Si vous devez justifier un choix d’outil auprès d’un responsable conformité, d’une revue de sécurité ou de vous-même dans six mois, cette asymétrie est toute l’histoire.
Pourquoi Apple Dictation et Whisper ne peuvent-ils pas être comparés sur la précision ?
Parce qu’un seul des deux camps publie des chiffres, et que les chiffres qui existent appartiennent à des benchmarks précis plutôt qu’au modèle en général. Toute comparaison de la précision Apple Dictation vs Whisper exprimée sous forme de deux pourcentages bien nets en a inventé au moins un.
Les auteurs de Whisper eux-mêmes sont inhabituellement francs à ce sujet. L’article note que « le meilleur modèle Whisper en zero-shot affiche un WER LibriSpeech clean-test relativement banal de 2,5 » — et il le dit pour faire valoir un point : un benchmark de parole lue, propre, en anglais uniquement, n’est pas là où la valeur du modèle se révèle. C’est la robustesse face à l’audio réel et désordonné qui compte.
Lisez ce chiffre avec tout son périmètre attaché : un taux d’erreur sur les mots de 2,5 %, sur LibriSpeech test-clean, en anglais, en parole lue, sur audio propre, en zero-shot sans fine-tuning sur ce benchmark. Changez une seule de ces cinq conditions, et le chiffre bouge.
La fiche modèle de large-v3 documente aussi les modes d’échec. Elle indique que les prédictions « peuvent inclure des textes qui ne sont pas réellement prononcés dans l’audio d’entrée (c’est-à-dire une hallucination) », et que les modèles « présentent des performances disparates selon les accents et dialectes de certaines langues ». C’est un éditeur qui publie lui-même ses propres points faibles.
La documentation de Dictation chez Apple ne comporte rien de comparable — pas de WER, pas de benchmark, aucune limite mentionnée au-delà de la disponibilité. Cette absence n’est pas la preuve d’une précision médiocre. C’est la preuve que personne en dehors d’Apple ne peut citer un chiffre honnêtement. Si vous voulez la méthode sous-jacente plutôt que le marketing, nous couvrons comment la précision de la reconnaissance vocale est mesurée en pratique, y compris comment faire vous-même un test de taux d’erreur sur votre propre dictée.
En quoi la couverture linguistique diffère-t-elle — 99 langues ou 63 locales ?
Les deux systèmes comptent dans des unités différentes, si bien que les chiffres phares ne sont pas comparables. La fiche modèle de large-v3 liste 99 langues. La page de disponibilité des fonctionnalités de macOS Tahoe d’Apple liste Dictation par locale.
Consultée en août 2026, cette page Apple compte 63 entrées de dictée. En regroupant les variantes régionales — quinze entrées en anglais, cinq en espagnol, quatre en français, trois en allemand — on arrive à environ 34 langues distinctes. Apple précise aussi que Dictation « n’est pas disponible dans toutes les langues ou régions, et les fonctionnalités peuvent varier », et que la dictée on-device et sans mode couvre un sous-ensemble encore plus restreint, après téléchargement d’un modèle vocal.
Plus important que l’un ou l’autre de ces comptages : aucune des deux listes ne promet une qualité égale sur toutes ses entrées. L’article de Whisper quantifie précisément à quel point c’est inégal, ce qui est rare. Il indique que sur les 680 000 heures d’audio d’entraînement, « 117 000 heures couvrent 96 autres langues », et qu’on y ajoute « 125 000 heures de données de traduction X→anglais ».
| Audio d’entraînement de Whisper (680 000 heures au total) | Heures |
|---|---|
| Reconnaissance vocale en anglais | ~438 000 |
| 96 autres langues | 117 000 |
| Traduction X→anglais | 125 000 |
L’article indique directement les deux derniers chiffres ; le premier n’est que ce qui reste du total (680 000 − 117 000 − 125 000 = 438 000). L’audio d’entraînement est anglais aux deux tiers environ.
Ce déséquilibre a une conséquence mesurée. L’article rapporte « un coefficient de corrélation au carré élevé de 0,83 entre le logarithme du taux d’erreur sur les mots et le logarithme de la quantité de données d’entraînement par langue », et estime à partir de cet ajustement que « le WER est divisé par deux à chaque multiplication par 16 de la quantité de données d’entraînement ».
Une langue située dans la queue fine de la distribution d’entraînement est donc mesurablement moins bien servie, et l’article le dit sans détour. Apple vous donne une liste de coches et de croix ; Whisper vous donne une courbe. Aucun des deux ne vous garantit que votre langue précise fonctionnera bien — mais un seul vous permet de comprendre pourquoi elle pourrait ne pas bien fonctionner.
Pourquoi Whisper vous laisse-t-il choisir une taille de modèle ?
Parce que Whisper n’est pas un modèle unique mais une famille, et que l’arbitrage précision/latence est laissé à qui le déploie. Le README d’openai/whisper publie six tailles, de tiny à 39 M de paramètres à large à 1 550 M, chacune avec son propre besoin en mémoire et une vitesse relative exprimée par rapport au modèle large.
L’écart est large. Le dépôt situe tiny à environ dix fois la vitesse de large ; la variante turbo se situe à 809 M de paramètres et environ huit fois la vitesse de large, ce qui explique pourquoi elle revient si souvent dans les outils de dictée, où la latence se ressent à chaque phrase plutôt qu’une seule fois par fichier.
macOS n’expose aucun réglage de ce type pour Dictation. Vous obtenez ce qu’Apple livre pour votre locale, calibré selon l’équilibre vitesse/qualité propre à Apple, sans aucun paramètre permettant d’arbitrer entre les deux.
Aucune des deux approches n’est automatiquement la bonne. Une configuration fixe et bien calibrée évite une décision que la plupart des gens ne veulent pas prendre ; un réglage exposé compte quand votre matériel ou votre tolérance à l’attente sortent de l’ordinaire. Si vous voulez le sélecteur complet avec les chiffres de mémoire par taille, notre guide pas à pas de compilation de whisper.cpp couvre la compilation du runtime et le téléchargement des poids par vous-même.
Que signifie la fenêtre de 30 secondes de Whisper en pratique ?
Whisper n’ingère pas un audio de longueur arbitraire en un seul passage. Il possède un champ récepteur de 30 secondes, et l’implémentation de référence traite les enregistrements plus longs en déplaçant une fenêtre sur le fichier.
Le dépôt le dit directement : la méthode transcribe() « lit le fichier entier et traite l’audio avec une fenêtre glissante de 30 secondes, en effectuant des prédictions autorégressives séquence-à-séquence sur chaque fenêtre ».
Pour la transcription par lots d’un fichier terminé, c’est un détail d’implémentation. Pour la dictée en direct, c’est le problème d’ingénierie central, car tout ce que le modèle ne fait pas doit être construit autour :
- Décider quand une phrase prononcée est terminée et qu’un segment doit être envoyé.
- Recoller les fenêtres consécutives sans perdre ni dupliquer de mots aux jointures.
- Décider s’il faut afficher un texte provisoire ou attendre un résultat stabilisé.
- Garder un aller-retour assez court pour que parler ressemble à taper plutôt qu’à attendre.
C’est pourquoi deux applications exécutant des poids Whisper strictement identiques peuvent donner des sensations totalement différentes. Les poids fixent le plafond de précision. L’enveloppe applicative décide si vous l’atteignez un jour.
Qu’est-ce qu’une application basée sur Whisper ajoute au modèle ?
Tout ce qui figure dans la section précédente, et ce n’est pas une liste courte. Weesper Neon Flow exécute Whisper localement via whisper.cpp sur macOS et Windows, avec accélération Metal sur Mac — le moteur est celui, ouvert, décrit ci-dessus, et le produit est l’enveloppe qui l’entoure.
En pratique, cela signifie pas de compilateur, pas de fichiers de modèle à gérer à la main, pas de code de découpage ou de recollage à écrire : un raccourci clavier, la parole, et le texte dans l’application où vous étiez déjà, sans que l’audio ne quitte jamais la machine. La couverture va jusqu’à 55+ langues, et la tarification est de 5 €/mois, 45 €/an, ou 99 € en achat unique, avec un essai gratuit de 15 jours.
Si vous voulez la qualité de reconnaissance d’un modèle ouvert et documenté sans passer un week-end à en assembler un, téléchargez Weesper Neon Flow et testez-le sur votre propre voix, votre propre accent et votre propre vocabulaire. Les questions d’installation trouvent leur réponse dans le Centre d’aide.
Ce que ce comparatif tranche réellement
Apple Dictation et Whisper ne sont pas deux produits qui s’affrontent sur un score de précision unique. Ce sont une fonctionnalité fermée et un modèle ouvert, et presque chaque différence pratique en découle : ce que vous pouvez mesurer, ce que vous pouvez choisir, ce que vous pouvez vérifier avant de lui confier un enregistrement confidentiel.
Si votre travail a besoin d’un moteur documenté, d’une taille de modèle que vous contrôlez et d’un audio qui reste sur votre machine, la voie ouverte est celle qui répond aux questions. Démarrez l’essai gratuit de 15 jours et jugez le moteur sur vos propres enregistrements plutôt que sur le tableau de benchmark de qui que ce soit.