Direkte Antwort — Ist Parakeet oder Whisper die bessere Wahl für die Dateitranskription? Bei der Genauigkeit liegt Parakeet in beiden englischen Kategorien des 2026 Open ASR Leaderboard knapp vorn: 6,32 % durchschnittliche Wortfehlerrate gegenüber 7,44 % für Whisper large-v3 bei Short-Form-Clips und 10,7 % gegenüber 11,2 % bei Long-Form-Aufnahmen. Bei den fünf europäischen Sprachen, in denen beide Modelle benchmarkt werden, liegen sie mit 4,81 % gleichauf. Der entscheidende Unterschied ist die Abdeckung: Whisper deckt 99 Sprachen ab, Parakeet 25.
Jeder in diesem Jahr veröffentlichte Vergleich zu Parakeet vs. Whisper Transkription zitiert dieselbe Kernaussage: Das Modell von NVIDIA ist genauer und weitaus schneller als das von OpenAI. Diese Aussage stimmt — und sie klärt deutlich weniger, als es zunächst scheint.
Das zugrunde liegende Open-ASR-Leaderboard-Paper führt mehrere getrennte Kategorien, und der Abstand bei Parakeet vs. Whisper Genauigkeit verhält sich in jeder davon anders. Betrachtet man alle zusammen, hängt die Entscheidung für ein echtes Archiv am Ende gar nicht mehr an der ersten Nachkommastelle.
Dieser Leitfaden geht sie in der Reihenfolge durch, die zählt, wenn Sie das beste lokale Transkriptionsmodell 2026 für Interviews, Vorlesungen und Videodateien auswählen: was jedes Modell ist, was der Short-Form-Abstand tatsächlich misst, was mit ihm bei stundenlangen Aufnahmen passiert, wo die Sprachabdeckung eine harte Grenze zieht, und was übrig bleibt, sobald das Modell die Rechenzentrums-GPU verlässt und auf Ihrem Mac läuft.
Was sind Parakeet und Whisper, und wie unterscheiden sie sich?
Zwei Familien offener Spracherkennungsmodelle, mit unterschiedlichen Architekturen für unterschiedliche Prioritäten gebaut. Keines der beiden ist ein Produkt — beide sind Gewichte, die Sie innerhalb einer anderen Anwendung ausführen.
Parakeet TDT 0.6B v3 ist NVIDIAs mehrsprachiges Modell, auf seiner Model Card als System mit 600 Millionen Parametern und einer FastConformer-TDT-Architektur beschrieben, veröffentlicht unter der CC-BY-4.0-Lizenz. TDT steht für Token-and-Duration-Transducer: Statt jeden Audio-Frame zu bewerten, sagt der Decoder voraus, wie weit er vorausspringen kann — daher stammt sein Durchsatzvorteil.
Whisper large-v3 ist OpenAIs Encoder-Decoder-Transformer, trainiert auf dem, was seine Model Card als „1 Million Stunden schwach gelabelter Audiodaten und 4 Millionen Stunden pseudogelabelter Audiodaten, gesammelt mit Whisper large-v2” bezeichnet, und soll laut Angabe eine „Reduktion der Fehler um 10 % bis 20 % gegenüber Whisper large-v2” liefern.
Whisper large-v3-turbo ist die Variante, die die meisten Mac-Apps tatsächlich ausliefern. Die Model Card ist unmissverständlich, was den Kompromiss angeht: „es ist genau dasselbe Modell, nur dass die Anzahl der Decoding-Layer von 32 auf 4 reduziert wurde”, weshalb „das Modell deutlich schneller ist, auf Kosten einer geringfügigen Qualitätseinbuße”.
| Parakeet TDT 0.6B v3 | Whisper large-v3 | Whisper large-v3-turbo | |
|---|---|---|---|
| Anbieter | NVIDIA | OpenAI | OpenAI |
| Architektur | FastConformer-TDT | Encoder-Decoder-Transformer | Gleich, Decoder auf 4 Schichten reduziert |
| Parameter | 600 Mio. | 1.550 Mio. | 809 Mio. |
| Sprachen | 25 (alle europäisch) | 99 | 99 |
| Zeichensetzung und Groß-/Kleinschreibung | Automatisch | Automatisch | Automatisch |
| Zeitstempel | Wort- und Segmentebene | Segment- und Wortebene | Segment- und Wortebene |
| Auf der Model Card genannte Lizenz | CC-BY-4.0 | Apache 2.0 | MIT |
Schlägt Parakeet Whisper bei der Genauigkeit?
In der englischen Short-Form-Kategorie: ja, um 1,12 Punkte. Das Open-ASR-Leaderboard-Paper — das 86 Open-Source- und proprietäre Systeme über 12 Datensätze hinweg vergleicht — weist eine durchschnittliche Wortfehlerrate von 6,32 % für Parakeet TDT 0.6B v3 gegenüber 7,44 % für Whisper large-v3 aus.
Der Rahmen zählt mehr als der Abstand. Dieser Durchschnitt wird über die englischen Short-Form-Datensätze des Leaderboards berechnet — darunter AMI, GigaSpeech, LibriSpeech clean und other, SPGISpeech, VoxPopuli sowie eine fünfstündige Teilmenge von Earnings22 — die größtenteils bereits segmentierte Clips sind und keine durchgehenden, stundenlangen Aufnahmen.
Die Geschwindigkeitswerte stammen aus demselben Durchlauf. Der inverse Echtzeitfaktor, im Paper definiert als Gesamtdauer des Audiomaterials geteilt durch die Transkriptionszeit, wurde auf einer NVIDIA A100-SXM4-80GB-GPU bei einer Batch-Größe von 64 gemessen.
| Englische Short-Form-Kategorie | Durchschnittliche WER | RTFx (A100, Batch 64) |
|---|---|---|
| NVIDIA Parakeet TDT 0.6B v2 | 6,05 % | 3.390 |
| NVIDIA Parakeet TDT 0.6B v3 | 6,32 % | 3.330 |
| NVIDIA Parakeet CTC 1.1B | 7,40 % | 2.730 |
| OpenAI Whisper large-v3 | 7,44 % | 146 |
Lesen Sie die rechte Spalte, bevor Sie sie zitieren: Sie beschreibt eine Rechenzentrums-GPU, die 64 Dateien gleichzeitig verarbeitet, keinen Laptop, der eine Aufnahme nach der anderen abarbeitet. Fast jede veröffentlichte Aussage zu Parakeet vs. Whisper Genauigkeit endet bei dieser Tabelle.
Hält dieser Abstand auch bei stundenlangen Aufnahmen?
Die Reihenfolge bleibt bestehen. Die Zahlen nicht. Das Leaderboard führt eine eigene englische Long-Form-Kategorie über CORAAL, Earnings21, das vollständige Earnings22 und TED-LIUM v3 — durchgehende Aufnahmen statt Clips — und das ist die Tabelle, die dem entspricht, was Sie tatsächlich in eine Transkriptions-App laden.
Parakeet TDT 0.6B v3 liegt dort weiterhin vor beiden Whisper-Varianten, mit einer durchschnittlichen Wortfehlerrate von 10,7 % gegenüber 11,0 % für large-v3-turbo und 11,2 % für large-v3. Doch sein Vorsprung von 1,12 Punkten aus der Short-Form-Kategorie schrumpft auf einen halben Punkt, und jedes offene Modell in der Tabelle verdoppelt nahezu die Fehlerrate, die es bei Clips erzielt hat.
| Long-Form-Kategorie (offene Modelle) | Durchschnittliche WER | RTFx (A100, Batch 64) |
|---|---|---|
| Cohere Labs Transcribe | 9,73 % | 418 |
| NVIDIA Parakeet TDT 0.6B v3 | 10,7 % | 1.000 |
| OpenAI Whisper large-v3-turbo | 11,0 % | 148 |
| OpenAI Whisper large-v3 | 11,2 % | 68,6 |
| Distil-Whisper large-v3.5 | 11,7 % | 156 |
| NVIDIA Parakeet CTC 1.1B | 12,9 % | 2.790 |
Drei Dinge sind daraus mitzunehmen. Keine der beiden Familien führt diese Kategorie an — Cohere Labs Transcribe liegt vor den offenen Modellen, und vier proprietäre API-Systeme liegen über ihnen allen, von 7,32 % bis 9,54 %. Parakeet bleibt durchgehend deutlich schneller, sein Durchsatzvorteil ist also real, selbst wo sein Genauigkeitsvorsprung nur marginal ist. Und durchgehendes Audiomaterial ist für alle schlicht schwieriger: Ein Modell mit 6 % im Benchmark wird bei einer zweistündigen Aufnahme zu einem Modell mit 11 %, ganz egal, welches Label es trägt.
Derselbe Earnings22-Korpus verdeutlicht das. Die Short-Form-Kategorie nutzt eine fünfstündige Teilmenge davon; die Long-Form-Kategorie nutzt alle 119 Stunden, und die Fehlerraten verändern sich entsprechend.
Der architektonische Grund ist auf NVIDIAs eigener Model Card ersichtlich. Parakeet unterstützt „Audio bis zu 24 Minuten Länge mit voller Attention (auf einer A100 80GB) oder bis zu 3 Stunden mit lokaler Attention” — eine dokumentierte Obergrenze, an die ein zweistündiges Interview stoßen kann, und ein Moduswechsel, den eine Transkriptions-App für Sie übernehmen muss.
Welches Modell deckt mehr Sprachen für die Dateitranskription ab?
Whisper, um etwa den Faktor vier, und genau hier trennen sich die beiden Modelle wirklich. Parakeet TDT 0.6B v3 unterstützt 25 Sprachen, alle europäisch; OpenAIs Model Cards für large-v3 und large-v3-turbo nennen beide 99.
Innerhalb der Überschneidung sind sie nicht zu unterscheiden. Die mehrsprachige Kategorie des Leaderboards benchmarkt fünf Sprachen — Deutsch, Französisch, Italienisch, Spanisch und Portugiesisch, über die Datensätze CoVoST-2 und FLEURS — und beide Modelle landen exakt beim gleichen Durchschnitt.
| Durchschnittliche WER, mehrsprachige Kategorie | Whisper large-v3 | Parakeet TDT 0.6B v3 |
|---|---|---|
| Deutsch | 4,26 % | 4,20 % |
| Französisch | 6,36 % | 5,42 % |
| Italienisch | 4,69 % | 4,81 % |
| Spanisch | 3,65 % | 3,73 % |
| Portugiesisch | 4,96 % | 6,16 % |
| Durchschnitt der fünf | 4,81 % | 4,81 % |
Ein Gleichstand, aufgeteilt über die Sprachen: Parakeet gewinnt bei Deutsch und Französisch, Whisper bei Italienisch, Spanisch und Portugiesisch. Außerhalb dieser fünf Sprachen ist es überhaupt kein Vergleich mehr. Für Japanisch, Arabisch, Hindi, Mandarin, Koreanisch, Türkisch und Hebräisch gibt es bei Parakeet kein Sprachtoken, und kein noch so hoher Durchsatz gleicht eine Sprache aus, für die das Modell nie trainiert wurde.
Diese Grenze, nicht ein halber Punkt Wortfehlerrate, ist der Grund, warum Weesper Transcribe auf Whisper aufbaut und nicht auf das schnellere Modell: 57 Transkriptionssprachen entscheiden darüber, ob eine Datei in einem gemischten Archiv überhaupt transkribiert werden kann.
Was ändert sich, wenn das Modell die A100 verlässt und auf Ihrem Mac läuft?
Fast alles bei der Geschwindigkeit, und sehr wenig bei der Genauigkeit. Das ist der Schritt, an dem die Leaderboard-Zahlen ihre Aussagekraft verlieren.
Drei Veränderungen passieren gleichzeitig:
- Batching entfällt. Ein RTFx von 3.330 setzt 64 parallel verarbeitete Dateien auf einer 80-GB-Rechenzentrums-GPU voraus. Sie transkribieren eine Datei, auf einem Laptop.
- Die Gewichte werden quantisiert. Mac-Apps liefern komprimierte Modelle aus, um Speicher- und Akkubudgets einzuhalten, was sowohl die Geschwindigkeit als auch die Fehlerrate von den veröffentlichten Werten abweichen lässt.
- Die Runtime bestimmt die Obergrenze. whisper.cpp, die reine C/C++-Implementierung von Whisper, bringt Core ML- und Metal-Unterstützung sowie quantisierte Modelldateien mit — genau deshalb baut so viel Mac-Tooling auf Whisper und nicht auf das schnellere Modell.
Weesper Transcribe geht diesen Weg: Whisper On-Device über whisper.cpp, ein quantisiertes Turbo-Modell neben einem leichteren Base-Modell, mit Metal-Beschleunigung auf Apple Silicon und Unterstützung für Intel-Macs mit AVX2, ab macOS 13. Nichts wird hochgeladen, sodass ein Interview unter Sperrfrist auf dem Gerät bleibt, das es aufgenommen hat.
Für die Details auf Modellebene hinter dieser Wahl geht unser Vergleich von Turbo gegen Distil-Whisper darauf ein, was Pruning und Distillation jeweils kosten, und der breitere Überblick über Open-Source-Sprachmodelle stellt beide den neueren Modellen gegenüber.
Wie sollten Sie sich bei Dateien zwischen den beiden entscheiden?
Beantworten Sie vier Fragen in dieser Reihenfolge, und das beste lokale Transkriptionsmodell 2026 für Ihr eigenes Material ergibt sich meist von selbst.
- In welcher Sprache liegt die Aufnahme vor? Außerhalb der 25 europäischen Sprachen von Parakeet endet der Vergleich hier. Whisper ist von beiden das einzige Modell, das ein Token für die Sprache hat.
- Wie lang sind die Dateien? Beide Modellfamilien verlieren bei durchgehenden Aufnahmen im Vergleich zu segmentierten Clips rund vier Punkte an Genauigkeit, kalkulieren Sie also bei einer zweistündigen Datei Korrekturzeit ein, unabhängig davon, welches Modell sie erzeugt hat.
- Welche Hardware führt es aus? Der Durchsatz von Parakeet wurde auf einer A100 bei Batch 64 gemessen. Wenn Ihre Arbeitslast auf einem Mac eine Datei nach der anderen umfasst, ist das veröffentlichte Verhältnis nicht das Verhältnis, das Sie erleben werden.
- Was brauchen Sie nach dem Transkript? Zeitstempel, Untertitel, Batch-Warteschlangen, Korrekturen und Suche sind Eigenschaften der Anwendung, nicht der Gewichte.
Dieser letzte Punkt ist der eine, den Benchmark-Tabellen nicht ausdrücken können. Bei Long-Form-Audio liegen die beiden Modellfamilien einen halben Punkt voneinander entfernt, während der Unterschied zwischen der Verarbeitung einer zweistündigen Aufnahme in einem Durchgang und dem manuellen Zerschneiden über den Unterschied zwischen einem erledigten Auftrag und einem verlorenen Nachmittag entscheidet.
In der Praxis entscheidet der Workflow: Batch-Verarbeitung über einen ganzen Ordner, neun Exportformate einschließlich zeitcodiertem SRT und VTT, Inline-Bearbeitung mit anklickbaren Zeitstempeln, eine lokale Automatisierungs-API und ein Verlauf, den Sie nach Bedeutung statt nach Schlagwort durchsuchen können.
Fazit
Parakeet TDT 0.6B v3 gewinnt den Benchmark, den die meisten Artikel zitieren, und auch den, den sie meist auslassen: vorn gegenüber Whisper sowohl bei kurzen englischen Clips als auch bei stundenlangen Aufnahmen, mit einem Durchsatz, an den kein Encoder-Decoder-Modell heranreicht. Bei den fünf europäischen Sprachen, in denen beide gemessen werden, liegen beide exakt gleichauf bei 4,81 %.
Das lässt die Entscheidung dort, wo die Tabellen nicht mehr hinreichen. Ein halber Punkt Wortfehlerrate bei Long-Form-Audio ist keine Entscheidung; 99 unterstützte Sprachen gegenüber 25 sind es. Jenseits von Parakeets europäischem Sprachumfang gibt es keinen zweiten Kandidaten, und auf einem Mac entscheiden Runtime, Batch-Warteschlange und die Handhabung langer Dateien den Rest.
Möchten Sie das mit Ihrer eigenen Aufnahme testen? Sehen Sie, wie On-Device-Dateitranskription funktioniert, oder laden Sie die App aus dem Mac App Store herunter — kostenlos, ab macOS 13, Dateien bis zu 15 Minuten in voller Qualität, mit einem einmaligen Pro-Upgrade statt einem Abonnement.