Direkte Antwort — Sollten Sie 2026 Whisper large-v3 Turbo oder Distil-Whisper wählen? Wählen Sie Whisper large-v3 Turbo, wenn Sie in mehr als einer Sprache diktieren: Es behält alle 99 Sprachen in 809 Mio. Parametern. Wählen Sie Distil-Whisper (distil-large-v3, 756 Mio.) nur für Englisch, wo die Model Card eine relative Latenz von 6,3x gegenüber large-v3 nennt. Beide lassen sich in whisper.cpp betreiben. Die Genauigkeitsunterschiede zwischen den beiden Familien sind gering; die Sprachabdeckung ist es nicht.
Die Wahl des besten Whisper-Modells 2026 beginnt mit einem lokalen Sprachmodell-Vergleich, nicht mit einer Größentabelle. Sowohl OpenAIs large-v3 Turbo als auch Hugging Faces Distil-Whisper komprimieren das 1.550-Mio.-Parameter-Modell large-v3 auf etwa die Hälfte seiner Größe, und beide existieren aus demselben Grund: Das Decoding war für komfortables Echtzeit-Diktat schlicht zu langsam.
Sie haben dafür unterschiedliche Wege gewählt, und diese Wege erzeugen wirklich unterschiedliche Kompromisse. Dieser Vergleich zeigt, was jedes Modell architektonisch verändert, was die veröffentlichten Wortfehlerraten tatsächlich messen, wie sich beide innerhalb von whisper.cpp verhalten und welches Modell in einen Diktier-Workflow gehört.
Wenn Sie Ihre Laufzeitumgebung noch aufbauen, starten Sie mit unserer Anleitung zur whisper.cpp-Einrichtung.
Was ist Whisper large-v3 Turbo?
Whisper large-v3 Turbo ist eine beschnittene und feinabgestimmte Version von large-v3 mit 809 Mio. Parametern. OpenAIs Model Card beschreibt es als „eine feinabgestimmte Version eines beschnittenen Whisper large-v3”, bei der „die Anzahl der Decoding-Layer von 32 auf 4 reduziert wurde”.
Pruning bedeutet, ganze Komponenten aus einem trainierten Netzwerk zu entfernen — hier 28 der 32 Decoder-Layer — und anschließend das verbleibende Modell so feinabzustimmen, dass es den Großteil des verlorenen Verhaltens zurückgewinnt. Der Encoder, der Audio in eine interne Repräsentation umwandelt, bleibt unangetastet.
Diese Asymmetrie ist die gesamte Designidee. Bei Whisper läuft der Encoder einmal pro 30-Sekunden-Fenster, während der Decoder einmal pro erzeugtem Token läuft — bei langen Transkriptionen dominiert der Decoder also die Latenz.
Entscheidend ist: Turbo behält den mehrsprachigen Kopf. Die Model Card listet dieselben 99 Sprachen wie large-v3, was das Modell zu einem direkten Ersatz macht und nicht zu einer spezialisierten Variante.
Was ist Distil-Whisper, und warum ist es nur für Englisch verfügbar?
Distil-Whisper ist eine Familie rein englischer Modelle, trainiert per Wissensdestillation aus Whisper large-v2 und large-v3. Wissensdestillation trainiert ein kleineres „Schüler”-Modell darauf, die Ausgaben eines größeren „Lehrer”-Modells zu reproduzieren, statt allein aus Ground-Truth-Labels zu lernen.
Das Distil-Whisper-Paper (arXiv:2311.00430) beschreibt einen Schüler mit „51 % weniger Parametern”, der „5,8-mal schneller” ist und dabei in einem Zero-Shot-Transfer-Setting „innerhalb von 1 % WER auf Out-of-Distribution-Testdaten” bleibt. Diese Zahlen beziehen sich auf distil-large-v2.
Wie Turbo behält auch Distil-Whisper den Encoder: Die Model Card merkt an, dass er „vollständig vom Lehrer zum Schüler übernommen und während des Trainings eingefroren” wird. Die Einsparungen kommen erneut aus einem drastisch verkürzten Decoder.
Die Sprachbeschränkung ist kein Versehen, sondern eine Beschränkung durch die Trainingsdaten. Das Distil-Whisper-Repository stellt unmissverständlich klar, dass die Reihe „nur für die englische Spracherkennung verfügbar” ist, und empfiehlt für mehrsprachige Aufgaben „den Whisper-Turbo-Checkpoint zu verwenden”.
Die veröffentlichte Distil-Whisper-Familie
| Modell | Parameter | Relative Latenz | Short-Form-WER | Long-Form-WER |
|---|---|---|---|---|
| distil-large-v3 | 756 Mio. | 6,3x | 9,7 % | 10,8 % |
| distil-large-v2 | 756 Mio. | 5,8x | 10,1 % | 11,6 % |
| distil-medium.en | 394 Mio. | 6,8x | 11,1 % | 12,4 % |
| distil-small.en | 166 Mio. | 5,6x | 12,1 % | 12,8 % |
Werte wie im Distil-Whisper-Repository veröffentlicht. Alle vier sind nur für Englisch; die Latenz ist relativ zu Whisper large-v3 bei 1,0 angegeben.
Whisper V3 Turbo vs. Distil-Whisper: Spezifikationen im Vergleich
Die beiden Modelle liegen bei der Größe nah beieinander und beim Umfang weit auseinander. Hier, was die offiziellen Model Cards veröffentlichen.
| Merkmal | Whisper large-v3 | large-v3 Turbo | distil-large-v3 |
|---|---|---|---|
| Parameter | 1.550 Mio. | 809 Mio. | 756 Mio. |
| Sprachen | 99 | 99 | Nur Englisch |
| Decoder-Layer | 32 | 4 | Verkürzt (Encoder eingefroren) |
| Veröffentlichter Geschwindigkeitsfaktor | Baseline | nicht veröffentlicht | 6,3x relative Latenz |
| Methode | — | Pruning + Feinabstimmung | Wissensdestillation |
| whisper.cpp-Download-Ziel | ✅ | ✅ | ❌ Konvertierung erforderlich |
Eine Zeile verdient besondere Aufmerksamkeit: OpenAI veröffentlicht keinen numerischen Geschwindigkeitsfaktor für Turbo. Die Model Card sagt lediglich, dass „das Modell deutlich schneller ist, auf Kosten einer geringfügigen Qualitätseinbuße”. Jeder konkrete Multiplikator, den Sie für Turbo zitiert sehen, stammt aus Tests Dritter, nicht von OpenAI.
Welches Modell ist 2026 genauer?
Beide büßen Genauigkeit gegenüber large-v3 ein, und beide büßen weniger ein, als es ihre Größenreduktion vermuten ließe. Doch die beiden Modellfamilien veröffentlichen ihre Zahlen auf unterschiedlichen Benchmarks, sodass die Kopfzahlen nicht direkt vergleichbar sind.
Die Auswertungen auf den OpenAI-Model-Cards nennen eine mittlere Wortfehlerrate von 7,83 für large-v3-turbo gegenüber 7,44 für large-v3 auf der englischen Open-ASR-Leaderboard-Suite — eine Differenz von rund 0,4 Punkten.
Das Distil-Whisper-Team wertet auf einer eigenen englischen Suite aus, auf der distil-large-v3 9,7 % Short-Form-WER gegenüber 8,4 % bei large-v3 verzeichnet, sowie 10,8 % bei sequenziellem Long-Form-Audio gegenüber 10,0 % bei large-v3. Bei chunked Long-Form liegt das destillierte Modell sogar knapp vorn: 10,9 % gegenüber 11,0 %.
Ziehen Sie 7,83 nicht einfach von 9,7 ab. Unterschiedliche Datensätze, unterschiedliche Decoding-Algorithmen und unterschiedliche Audiolängen erzeugen für dasselbe Modell unterschiedliche absolute WER-Werte. Jede Zahl ist nur im Vergleich zu ihrer eigenen Baseline aussagekräftig.
Die ehrliche Zusammenfassung: Gegenüber large-v3 verliert Turbo auf dem englischen Leaderboard rund einen halben WER-Punkt, und distil-large-v3 verliert auf der Distil-Whisper-Suite rund 1,3 Punkte Short-Form und 0,8 Punkte bei sequenziellem Long-Form. Für Diktat liegen beide Modelle bequem in dem Bereich, in dem Mikrofonqualität und Hintergrundgeräusche das Ergebnis dominieren.
Wie man Sprachbenchmark-Zahlen liest, ohne sie überzuinterpretieren, haben wir in unserem Voxtral-vs.-Whisper-Benchmark-Vergleich behandelt.
Welches ist in der Praxis das schnellste Whisper-Modell?
Für rein englische Workloads auf einem lokalen Rechner hat Distil-Whisper die stärkere veröffentlichte Evidenz. Seine Model Card enthält eine whisper.cpp-spezifische Messung: „In einem vorläufigen Benchmark auf einem Mac M1 ist distil-large-v3 über 5-mal schneller als Whisper large-v3.”
Das ist eine klar abgegrenzte, reproduzierbare Aussage — eine benannte Laufzeitumgebung, benannte Hardware, ein benannter Vergleich —, und genau diese Art von Zahl verdient Vertrauen. Sie ist zugleich ausdrücklich als vorläufig gekennzeichnet.
Turbos Vorteil lässt sich schwerer beziffern, weil OpenAI keine Zahl veröffentlicht hat. Strukturell entfernt das Kürzen des Decoders von 32 auf 4 Layer denselben Engpass, den auch Distil-Whisper angeht — beide sollten sich also auf derselben Hardware in einem grob ähnlichen Bereich bewegen.
Drei Variablen beeinflussen den tatsächlichen Durchsatz stärker als der Checkpoint selbst:
- Quantisierung. whisper.cpp unterstützt quantisierte ggml-Dateien (unter anderem Q5_0), die den Speicherbedarf verringern und die Inferenz beschleunigen — auf Kosten etwas Genauigkeit.
- Hardwarebeschleunigung. Auf Apple Silicon kann whisper.cpp die Encoder-Inferenz über Core ML an die Neural Engine auslagern und die Inferenz per Metal auf der GPU ausführen.
- Audiolänge und Algorithmus. Sequenzielle und chunked Long-Form-Strategien erzeugen für dasselbe Modell unterschiedliche Geschwindigkeits- und Genauigkeitsprofile.
Wie verhalten sich beide Modelle innerhalb von whisper.cpp?
Turbo lässt sich leichter einsetzen. Das whisper.cpp-Repository führt large-v3-turbo unter seinen herunterladbaren Modellen neben den anderen offiziellen Checkpoints — die ggml-Datei zu holen ist ein einziger Befehl.
Distil-Whisper gehört nicht zu diesen Download-Zielen. Die Model Card von distil-large-v3 dokumentiert den Einsatz „mit dem Whisper.cpp-Paket über den ursprünglichen sequenziellen Long-Form-Transkriptionsalgorithmus”, was einen Konvertierungsschritt bedeutet, bevor eine nutzbare ggml-Datei vorliegt.
Dieser Unterschied wiegt mehr, als er zunächst scheint. Ein Modell, das man direkt herunterladen kann, bleibt mit den Upstream-Releases aktuell; ein Modell, das man selbst konvertiert, ist ein Schritt, den man dauerhaft pflegen muss.
Der Arbeitsspeicher ist die andere praktische Grenze. whisper.cpp dokumentiert rund 3,9 GB für ein Modell der large-Klasse — erst ein halb so großer Checkpoint macht lokales Diktat auf einem 8-GB-Rechner überhaupt praktikabel.
Welches Modell sollten Sie wählen?
Gehen Sie diese Liste durch und stoppen Sie bei der ersten zutreffenden Zeile.
- Sie diktieren in mehr als einer Sprache. Nehmen Sie large-v3 Turbo. Distil-Whisper kann Ihnen nicht dienen, und das Distil-Whisper-Projekt sagt das selbst so.
- Nur Englisch, und Latenz ist Ihre bindende Einschränkung. Nehmen Sie distil-large-v3, akzeptieren Sie den Konvertierungsschritt und validieren Sie mit Ihrem eigenen Audiomaterial.
- Nur Englisch, und Sie wollen den einfachsten Wartungsweg. Nehmen Sie trotzdem large-v3 Turbo. Der mehrsprachige Kopf kostet Sie bei der Inferenz nichts.
- Genauigkeit über alles, Geschwindigkeit zweitrangig. Bleiben Sie beim vollständigen large-v3.
- Sie wollen Diktat, keine Modell-Pipeline. Nutzen Sie eine Anwendung, die den Checkpoint für Sie verwaltet.
Bei dieser letzten Zeile landen die meisten. Eine Laufzeitumgebung zu kompilieren, Checkpoints zu konvertieren und die Quantisierung zu justieren, ist ein durchaus interessanter Nachmittag — und eine schlechte wöchentliche Verpflichtung.
Weesper Neon Flow basiert auf whisper.cpp, läuft vollständig offline, ohne dass Audio das Gerät verlässt, unterstützt über 55 Sprachen und nutzt Metal-Beschleunigung auf Apple Silicon. Testen Sie Weesper 15 Tage kostenlos, wenn Sie lieber diktieren als benchmarken möchten.
Fazit zu Whisper V3 Turbo vs. Distil-Whisper
Diese beiden Modelle lösen dasselbe Problem — ein für Echtzeitnutzung zu langsamer Decoder — mit unterschiedlichen Mitteln und landen dabei in einer ähnlichen Größenklasse: 809 Mio. gegenüber 756 Mio. Parametern, beide etwa halb so groß wie large-v3.
Die Genauigkeitslücke zwischen ihnen ist klein genug, dass Ihr Mikrofon mehr zählt. Die Sprachlücke ist absolut: 99 Sprachen gegenüber einer einzigen. Für alle, deren Arbeit nicht ausschließlich auf Englisch stattfindet, entscheidet diese eine Zeile den Vergleich, noch bevor Geschwindigkeit überhaupt zur Sprache kommt.
Wenn Sie sehen möchten, wie diese lokalen Modelle im Vergleich zu den in Ihr Betriebssystem eingebauten Engines abschneiden, lesen Sie unsere Gegenüberstellung von Apple Diktat und OpenAI Whisper.
Bereit, offline zu diktieren? Installieren Sie Weesper Neon Flow auf macOS oder Windows, oder durchstöbern Sie das Hilfe-Center für Einrichtung und Sprachkonfiguration.