Risposta diretta — Parakeet o Whisper è meglio per la trascrizione di file? In termini di precisione, Parakeet è leggermente avanti su entrambe le tracce in inglese dell’Open ASR Leaderboard 2026: tasso di errore medio sulle parole del 6,32% contro il 7,44% di Whisper large-v3 sulle clip short-form, e 10,7% contro 11,2% sulle registrazioni long-form. Sulle cinque lingue europee su cui entrambi i modelli sono testati, pareggiano al 4,81%. La differenza decisiva è la copertura: Whisper gestisce 99 lingue, Parakeet 25.
Ogni confronto parakeet vs whisper trascrizione pubblicato quest’anno cita lo stesso titolo: il modello di NVIDIA è più preciso e enormemente più rapido di quello di OpenAI. L’affermazione è fondata — e risolve molto meno di quanto sembri risolvere.
Il paper dell’Open ASR Leaderboard alla base di questo esegue diverse tracce separate, e il divario di parakeet vs whisper precisione si comporta diversamente in ciascuna. Leggile tutte e la decisione per un archivio reale smette del tutto di dipendere dal primo decimale.
Questa guida le affronta nell’ordine che conta quando devi scegliere il miglior modello di trascrizione locale 2026 per interviste, lezioni e file video: cosa è ciascun modello, cosa misura il divario short-form, cosa gli succede sulle registrazioni di un’ora, dove la copertura linguistica traccia un confine netto, e cosa resta valido quando il modello lascia la GPU da data center per il tuo Mac.
Cosa sono Parakeet e Whisper, e in cosa differiscono?
Due famiglie di modelli open di riconoscimento vocale, costruite su architetture diverse per priorità diverse. Nessuna delle due è un prodotto: entrambe sono pesi che esegui all’interno di qualcos’altro.
Parakeet TDT 0.6B v3 è il modello multilingue di NVIDIA, descritto nella sua card come un sistema da 600 milioni di parametri con architettura FastConformer-TDT, rilasciato con licenza CC-BY-4.0. TDT sta per token-and-duration transducer: invece di valutare ogni frame audio, il decoder predice quanto avanzare, ed è da qui che deriva il suo throughput.
Whisper large-v3 è il transformer encoder-decoder di OpenAI, addestrato su quello che la sua card definisce «1 milione di ore di audio debolmente etichettato e 4 milioni di ore di audio pseudo-etichettato raccolto usando Whisper large-v2», e indicato come capace di offrire una «riduzione degli errori dal 10% al 20% rispetto a Whisper large-v2».
Whisper large-v3-turbo è la variante che la maggior parte delle app Mac utilizza davvero. La sua card è chiara sul compromesso: «è esattamente lo stesso modello, con la differenza che il numero di layer di decoding è stato ridotto da 32 a 4», quindi «il modello è molto più rapido, al costo di un leggero degrado della qualità».
| Parakeet TDT 0.6B v3 | Whisper large-v3 | Whisper large-v3-turbo | |
|---|---|---|---|
| Editore | NVIDIA | OpenAI | OpenAI |
| Architettura | FastConformer-TDT | Transformer encoder-decoder | Uguale, decoder ridotto a 4 layer |
| Parametri | 600 milioni | 1.550 M | 809 M |
| Lingue | 25 (tutte europee) | 99 | 99 |
| Punteggiatura e maiuscole | Automatica | Automatica | Automatica |
| Timestamp | A livello di parola e segmento | A livello di segmento e parola | A livello di segmento e parola |
| Licenza indicata sulla card | CC-BY-4.0 | Apache 2.0 | MIT |
Parakeet supera Whisper in precisione?
Sulla traccia inglese short-form, sì, di 1,12 punti. Il paper dell’Open ASR Leaderboard — che confronta 86 sistemi open-source e proprietari su 12 dataset — riporta un tasso di errore medio sulle parole del 6,32% per Parakeet TDT 0.6B v3 contro il 7,44% di Whisper large-v3.
Il contesto conta più del divario. Questa media è calcolata sui dataset inglesi short-form della classifica — tra cui AMI, GigaSpeech, LibriSpeech clean e other, SPGISpeech, VoxPopuli e un sottoinsieme di cinque ore di Earnings22 — che sono in gran parte clip pre-segmentate piuttosto che registrazioni continue di un’ora.
I dati sulla velocità provengono dalla stessa run. Il fattore inverse real-time, definito nel paper come la durata totale dell’audio divisa per il tempo di trascrizione, è stato misurato su una GPU NVIDIA A100-SXM4-80GB con batch size 64.
| Traccia inglese short-form | WER medio | RTFx (A100, batch 64) |
|---|---|---|
| NVIDIA Parakeet TDT 0.6B v2 | 6,05% | 3.390 |
| NVIDIA Parakeet TDT 0.6B v3 | 6,32% | 3.330 |
| NVIDIA Parakeet CTC 1.1B | 7,40% | 2.730 |
| OpenAI Whisper large-v3 | 7,44% | 146 |
Leggi la colonna di destra prima di ripeterla: descrive una GPU da data center che elabora 64 file contemporaneamente, non un laptop che lavora su una singola registrazione. Quasi ogni affermazione pubblicata su parakeet vs whisper precisione si ferma a questa tabella.
Quel divario si mantiene sulle registrazioni di un’ora?
L’ordine si mantiene. I numeri no. La classifica esegue una traccia inglese long-form separata su CORAAL, Earnings21, l’intero Earnings22 e TED-LIUM v3 — registrazioni continue piuttosto che clip — e questa è la tabella che corrisponde a ciò che carichi in un’app di trascrizione.
Lì Parakeet TDT 0.6B v3 resta comunque davanti a entrambe le versioni di Whisper, con un tasso di errore medio sulle parole del 10,7% contro l’11,0% di large-v3-turbo e l’11,2% di large-v3. Ma il suo vantaggio di 1,12 punti sulla traccia short-form si riduce a mezzo punto, e ogni modello open nella tabella raddoppia circa il tasso di errore registrato sulle clip.
| Traccia long-form (modelli open) | WER medio | RTFx (A100, batch 64) |
|---|---|---|
| Cohere Labs Transcribe | 9,73% | 418 |
| NVIDIA Parakeet TDT 0.6B v3 | 10,7% | 1.000 |
| OpenAI Whisper large-v3-turbo | 11,0% | 148 |
| OpenAI Whisper large-v3 | 11,2% | 68,6 |
| Distil-Whisper large-v3.5 | 11,7% | 156 |
| NVIDIA Parakeet CTC 1.1B | 12,9% | 2.790 |
Ci sono tre cose da trarne. Nessuna delle due famiglie è in testa alla traccia — Cohere Labs Transcribe guida tra i modelli open, e quattro sistemi API proprietari si posizionano sopra tutti loro, dal 7,32% al 9,54%. Parakeet resta drasticamente più rapido in ogni caso, quindi il suo vantaggio in termini di throughput è reale anche dove il suo vantaggio in precisione è marginale. E l’audio continuo è semplicemente più difficile per tutti: un modello al 6% nel benchmark diventa un modello all’11% su una registrazione di due ore, qualunque sia l’etichetta che porta.
Lo stesso corpus Earnings22 lo dimostra. La traccia short-form ne usa un sottoinsieme di cinque ore; la traccia long-form usa tutte le 119 ore, e i tassi di errore si muovono di conseguenza.
La ragione architetturale è visibile direttamente sulla card di NVIDIA. Parakeet supporta «audio fino a 24 minuti con full attention (su A100 80GB) o fino a 3 ore con local attention» — un limite documentato che un’intervista di due ore può raggiungere, e un cambio di modalità che un’app di trascrizione deve gestire per te.
Quale modello copre più lingue per la trascrizione di file?
Whisper, con un fattore di circa quattro, e questo è l’unico punto in cui i due modelli si separano davvero. Parakeet TDT 0.6B v3 supporta 25 lingue, tutte europee; le card di OpenAI per large-v3 e large-v3-turbo indicano entrambe 99.
All’interno della sovrapposizione sono indistinguibili. La traccia multilingue della classifica valuta cinque lingue — tedesco, francese, italiano, spagnolo e portoghese, sui dataset CoVoST-2 e FLEURS — ed entrambi i modelli raggiungono esattamente la stessa media.
| WER medio, traccia multilingue | Whisper large-v3 | Parakeet TDT 0.6B v3 |
|---|---|---|
| Tedesco | 4,26% | 4,20% |
| Francese | 6,36% | 5,42% |
| Italiano | 4,69% | 4,81% |
| Spagnolo | 3,65% | 3,73% |
| Portoghese | 4,96% | 6,16% |
| Media delle cinque | 4,81% | 4,81% |
Un pareggio, distribuito tra le lingue: Parakeet vince su tedesco e francese, Whisper su italiano, spagnolo e portoghese. Fuori da queste cinque non c’è alcun confronto. Giapponese, arabo, hindi, mandarino, coreano, turco ed ebraico non hanno alcun token linguistico su Parakeet, e nessuna quantità di throughput compensa una lingua che il modello non è mai stato addestrato a produrre.
È quel confine, non mezzo punto di tasso di errore sulle parole, il motivo per cui Weesper Transcribe è costruito su Whisper piuttosto che sul modello più rapido: 57 lingue di trascrizione decidono se un file in un archivio misto viene trascritto o no.
Cosa cambia quando il modello lascia l’A100 e viene eseguito sul tuo Mac?
Quasi tutto quanto riguarda la velocità, e molto poco quanto riguarda la precisione. È il passaggio in cui i numeri della classifica smettono di essere predittivi.
Avvengono tre cambiamenti contemporaneamente:
- Il batching scompare. Un RTFx di 3.330 presuppone 64 file elaborati in parallelo su una GPU da data center da 80 GB. Tu trascrivi un file, su un laptop.
- I pesi vengono quantizzati. Le app Mac distribuiscono modelli compressi per rispettare i budget di memoria e batteria, il che cambia sia la velocità che il tasso di errore rispetto al dato pubblicato.
- Il runtime decide il limite. whisper.cpp, l’implementazione C/C++ pura di Whisper, integra supporto Core ML e Metal e file di modello quantizzati — motivo esatto per cui tanto tooling per Mac si basa su Whisper piuttosto che sul modello più rapido.
Weesper Transcribe segue questa strada: Whisper on-device tramite whisper.cpp, un modello turbo quantizzato insieme a un modello base più leggero, con accelerazione Metal su Apple Silicon e supporto per Mac Intel con AVX2, su macOS 13 o versioni successive. Niente viene caricato online, quindi un’intervista sotto embargo resta sulla macchina che l’ha registrata.
Per i dettagli a livello di modello dietro questa scelta, il nostro confronto tra turbo e Distil-Whisper illustra cosa costano pruning e distillazione, e la panoramica più ampia sui modelli vocali open-source confronta entrambi con i nuovi arrivati.
Come scegliere tra i due per i file?
Rispondi a quattro domande in ordine e il miglior modello di trascrizione locale 2026 per il tuo materiale di solito si sceglie da solo.
- In quale lingua è la registrazione? Fuori dalle 25 lingue europee di Parakeet, il confronto finisce qui. Whisper è l’unico dei due ad avere un token per quella lingua.
- Quanto sono lunghi i file? Entrambe le famiglie perdono circa quattro punti di precisione sulle registrazioni continue rispetto alle clip segmentate, quindi prevedi un tempo di correzione su un file di due ore, indipendentemente dal modello che lo ha prodotto.
- Quale hardware lo esegue? Il throughput di Parakeet è stato misurato su un A100 con batch 64. Se il tuo carico di lavoro è un file alla volta su un Mac, il rapporto pubblicato non è quello che vedrai.
- Di cosa hai bisogno dopo la trascrizione? Timestamp, sottotitoli, code batch, correzioni e ricerca sono proprietà dell’applicazione, non dei pesi del modello.
Quest’ultimo punto è quello che le tabelle di benchmark non possono esprimere. Sull’audio long-form le due famiglie si trovano a mezzo punto di distanza, mentre lo scarto tra elaborare una registrazione di due ore in un solo passaggio e affettarla a mano è la differenza tra un lavoro finito e un pomeriggio perso.
In pratica è il workflow a decidere: elaborazione batch su un’intera cartella, nove formati di esportazione tra cui SRT e VTT con codice temporale, editing inline con timestamp cliccabili, una API di automazione locale, e una cronologia in cui puoi cercare per significato piuttosto che per parola chiave.
Conclusione
Parakeet TDT 0.6B v3 vince il benchmark che la maggior parte degli articoli cita, e vince anche quello che tendono a saltare: davanti a Whisper sia sulle clip brevi in inglese che sulle registrazioni di un’ora, con un throughput a cui nessun modello encoder-decoder si avvicina. Sulle cinque lingue europee su cui entrambi sono valutati, pareggiano esattamente al 4,81%.
Il che lascia la scelta esattamente dove le tabelle non possono arrivare. Mezzo punto di tasso di errore sull’audio long-form non è una decisione; 99 lingue supportate contro 25 lo è. Oltre l’insieme europeo di Parakeet non c’è un secondo candidato, e su un Mac il runtime, la coda batch e la gestione dei file lunghi risolvono il resto.
Vuoi provarlo su una tua registrazione? Scopri come funziona la trascrizione dei file on-device, oppure scarica l’app dal Mac App Store — gratuita da scaricare, macOS 13 o versioni successive, file fino a 15 minuti a piena qualità, con un upgrade Pro a pagamento unico invece di un abbonamento.