Risposta diretta — Meglio scegliere Whisper large-v3 Turbo o Distil-Whisper nel 2026? Scegli Whisper large-v3 Turbo se detti in più di una lingua: mantiene tutte le 99 lingue in 809M di parametri. Scegli Distil-Whisper (distil-large-v3, 756M) solo per l’inglese, dove la sua model card dichiara una latenza relativa di 6,3x rispetto a large-v3. Entrambi possono girare in whisper.cpp. Le differenze di precisione tra le due famiglie sono minime; la copertura linguistica no.
Scegliere il miglior modello Whisper nel 2026 parte da un confronto tra modelli vocali locali, non da una tabella di dimensioni. Il large-v3 Turbo di OpenAI e il Distil-Whisper di Hugging Face comprimono entrambi i 1.550M di parametri di large-v3 a circa la metà, e nascono entrambi per lo stesso motivo: il decoding era troppo lento per una dettatura in tempo reale confortevole.
Hanno preso strade diverse per arrivarci, e quelle strade producono compromessi genuinamente diversi. Questo confronto copre cosa cambia architetturalmente in ciascun modello, cosa misurano davvero i tassi di errore sulle parole pubblicati, come si comportano entrambi dentro whisper.cpp, e quale ha senso in un flusso di dettatura.
Se stai ancora assemblando il runtime, parti dalla nostra guida all’installazione di whisper.cpp.
Cos’è Whisper large-v3 Turbo?
Whisper large-v3 Turbo è una versione sfoltita e messa a punto di large-v3 con 809M di parametri. La model card di OpenAI lo descrive come “una versione affinata di un large-v3 Whisper sfoltito” in cui “il numero di layer di decoding è passato da 32 a 4”.
Il pruning (sfoltimento) significa rimuovere interi componenti da una rete addestrata — qui, 28 dei 32 layer del decoder — e poi mettere a punto ciò che resta affinché recuperi la maggior parte del comportamento perduto. L’encoder, che trasforma l’audio in una rappresentazione interna, resta intoccato.
Quell’asimmetria è tutto il design. In Whisper, l’encoder gira una volta per finestra di 30 secondi mentre il decoder gira una volta per ogni token generato, quindi il decoder domina la latenza sulle trascrizioni lunghe.
In modo cruciale, Turbo mantiene la testa multilingue. La model card elenca le stesse 99 lingue di large-v3, ed è ciò che lo rende un sostituto diretto piuttosto che una variante specializzata.
Cos’è Distil-Whisper, e perché è solo in inglese?
Distil-Whisper è una famiglia di modelli solo in inglese addestrati tramite distillazione della conoscenza da Whisper large-v2 e large-v3. La distillazione della conoscenza addestra un modello “studente” più piccolo a riprodurre gli output di un modello “insegnante” più grande, invece di imparare soltanto da etichette di riferimento (ground truth).
Il paper Distil-Whisper (arXiv:2311.00430) riporta uno studente con “il 51% di parametri in meno” che è “5,8 volte più veloce” pur restando “entro l’1% di WER su dati di test fuori distribuzione” in un contesto di trasferimento zero-shot. Queste cifre descrivono distil-large-v2.
Come Turbo, Distil-Whisper mantiene l’encoder: la model card nota che è “interamente copiato dall’insegnante allo studente e congelato durante l’addestramento”. I risparmi derivano di nuovo da un decoder drasticamente accorciato.
Il limite linguistico non è una svista ma un vincolo dei dati di addestramento. Il repository Distil-Whisper dichiara esplicitamente che la serie “è disponibile solo per il riconoscimento vocale in inglese” e raccomanda “l’uso del checkpoint Whisper Turbo” per il lavoro multilingue.
La famiglia Distil-Whisper pubblicata
| Modello | Parametri | Latenza relativa | WER short-form | WER long-form |
|---|---|---|---|---|
| distil-large-v3 | 756M | 6,3x | 9,7% | 10,8% |
| distil-large-v2 | 756M | 5,8x | 10,1% | 11,6% |
| distil-medium.en | 394M | 6,8x | 11,1% | 12,4% |
| distil-small.en | 166M | 5,6x | 12,1% | 12,8% |
Cifre come pubblicate nel repository Distil-Whisper. Tutti e quattro sono solo in inglese; la latenza è relativa a Whisper large-v3 a 1,0.
Whisper V3 Turbo vs Distil-Whisper: specifiche a confronto
I due modelli sono vicini per dimensioni e lontani per ambito. Ecco cosa pubblicano le model card ufficiali.
| Attributo | Whisper large-v3 | large-v3 Turbo | distil-large-v3 |
|---|---|---|---|
| Parametri | 1.550M | 809M | 756M |
| Lingue | 99 | 99 | Solo inglese |
| Layer del decoder | 32 | 4 | Accorciato (encoder congelato) |
| Fattore di velocità pubblicato | baseline | nessuno pubblicato | 6,3x latenza relativa |
| Metodo | — | pruning + fine-tuning | distillazione della conoscenza |
| Target di download whisper.cpp | ✅ | ✅ | ❌ richiede conversione |
Una riga merita attenzione: OpenAI non pubblica alcun fattore di velocità numerico per Turbo. La model card dice solo che “il modello è molto più veloce, a costo di un lieve degrado della qualità”. Qualsiasi moltiplicatore specifico citato per Turbo che potresti leggere in giro proviene da test di terze parti, non da OpenAI.
Quale modello è più preciso nel 2026?
Entrambi cedono precisione rispetto a large-v3, ed entrambi cedono meno di quanto la loro riduzione di dimensioni farebbe pensare. Ma le due famiglie pubblicano i loro numeri su benchmark diversi, quindi le cifre principali non sono direttamente confrontabili.
I risultati di valutazione sulle model card OpenAI riportano un tasso di errore sulle parole medio di 7,83 per large-v3-turbo contro 7,44 per large-v3 sulla suite English Open ASR Leaderboard — un divario di circa 0,4 punti.
Il team Distil-Whisper valuta sulla propria suite in inglese, dove distil-large-v3 registra un WER short-form del 9,7% contro l’8,4% di large-v3, e del 10,8% su audio long-form sequenziale contro il 10,0% di large-v3. Sul long-form chunked il modello distillato è addirittura leggermente avanti: 10,9% contro 11,0%.
Non sottrarre 7,83 da 9,7. Dataset diversi, algoritmi di decoding diversi e lunghezze audio diverse producono WER assoluti diversi per lo stesso modello. Ogni numero ha significato solo rispetto alla propria baseline.
Il riepilogo onesto: rispetto a large-v3, Turbo perde circa mezzo punto di WER sulla classifica inglese, e distil-large-v3 perde circa 1,3 punti in short-form e 0,8 punti in long-form sequenziale sulla suite Distil-Whisper. Per la dettatura, entrambi restano ben dentro l’intervallo in cui la qualità del microfono e il rumore di fondo dominano il risultato.
Abbiamo trattato come leggere i numeri dei benchmark vocali senza sopravvalutarli nel nostro confronto tra Voxtral e Whisper.
Qual è il modello Whisper più veloce nella pratica?
Per i carichi di lavoro solo in inglese su una macchina locale, Distil-Whisper ha l’evidenza pubblicata più solida. La sua model card include una misurazione specifica per whisper.cpp: “In un benchmark provvisorio su Mac M1, distil-large-v3 è oltre 5 volte più veloce di Whisper large-v3.”
È un’affermazione circoscritta e riproducibile — un runtime nominato, un hardware nominato, un confronto nominato — ed è il tipo di cifra che vale la pena considerare attendibile. È anche esplicitamente etichettata come provvisoria.
Il vantaggio di Turbo è più difficile da quantificare perché OpenAI ha scelto di non pubblicarne uno. Strutturalmente, tagliare il decoder da 32 layer a 4 rimuove lo stesso collo di bottiglia che Distil-Whisper prende di mira, quindi i due dovrebbero collocarsi in un intervallo ampiamente simile sullo stesso hardware.
Tre variabili spostano il throughput nel mondo reale più del checkpoint stesso:
- Quantizzazione. whisper.cpp supporta file ggml quantizzati (tra gli altri, Q5_0), che riducono l’ingombro in memoria e velocizzano l’inferenza a fronte di un certo costo in precisione.
- Accelerazione hardware. Su Apple Silicon, whisper.cpp può spostare l’inferenza dell’encoder sul Neural Engine tramite Core ML, ed eseguire l’inferenza sulla GPU tramite Metal.
- Lunghezza dell’audio e algoritmo. Le strategie long-form sequenziali e chunked producono profili di velocità e precisione diversi per lo stesso modello.
Come si comportano entrambi i modelli dentro whisper.cpp?
Turbo è più facile da adottare. Il repository whisper.cpp elenca large-v3-turbo tra i suoi modelli scaricabili insieme agli altri checkpoint ufficiali, quindi recuperare il file ggml è un singolo comando.
Distil-Whisper non è tra quei target di download. La model card di distil-large-v3 documenta come eseguirlo “con il pacchetto Whisper.cpp usando l’algoritmo di trascrizione long-form sequenziale originale”, il che significa un passaggio di conversione prima di avere un file ggml utilizzabile.
Quella differenza conta più di quanto sembri. Un modello che puoi scaricare direttamente resta allineato alle release upstream; un modello che converti tu stesso è un passaggio che devi mantenere.
La memoria è l’altro vincolo pratico. whisper.cpp documenta circa 3,9 GB per un modello di classe large, quindi un checkpoint di dimensione dimezzata è ciò che rende la dettatura locale praticabile su una macchina da 8 GB.
Quale modello dovresti scegliere?
Scorri questo elenco e fermati alla prima riga che corrisponde alla tua situazione.
- Detti in più di una lingua. Prendi large-v3 Turbo. Distil-Whisper non può servirti, e il progetto Distil-Whisper stesso lo dichiara.
- Solo inglese, e la latenza è il tuo vincolo principale. Prendi distil-large-v3, accetta il passaggio di conversione e valida sul tuo audio.
- Solo inglese, e vuoi il percorso di manutenzione più semplice. Prendi comunque large-v3 Turbo. La testa multilingue non ti costa nulla in fase di inferenza.
- Precisione sopra ogni cosa, velocità secondaria. Resta su large-v3 completo.
- Vuoi la dettatura, non una pipeline di modelli. Usa un’applicazione che gestisce il checkpoint al posto tuo.
Quest’ultima riga è quella su cui atterra la maggior parte delle persone. Compilare un runtime, convertire checkpoint e mettere a punto la quantizzazione è un pomeriggio genuinamente interessante — e un impegno settimanale scadente.
Weesper Neon Flow è costruito su whisper.cpp, funziona interamente offline senza che alcun audio lasci il dispositivo, supporta oltre 55 lingue e usa l’accelerazione Metal su Apple Silicon. Prova Weesper gratis per 15 giorni se preferisci dettare piuttosto che fare benchmark.
In sintesi: Whisper V3 Turbo vs Distil-Whisper
Questi due modelli risolvono lo stesso problema — un decoder troppo lento per l’uso in tempo reale — con strumenti diversi, e atterrano in una classe di dimensioni simile: 809M contro 756M di parametri, entrambi circa la metà di large-v3.
Il divario di precisione tra loro è abbastanza piccolo da far contare di più il tuo microfono. Il divario linguistico è assoluto: 99 lingue contro una sola. Per chiunque lavori non esclusivamente in inglese, quella singola riga decide il confronto prima ancora che la velocità entri in discussione.
Se vuoi vedere come questi modelli locali si confrontano con i motori integrati nel tuo sistema operativo, leggi il nostro approfondimento su Apple Dictation e OpenAI Whisper.
Pronto a dettare offline? Installa Weesper Neon Flow su macOS o Windows, oppure esplora il Centro Assistenza per la configurazione e le impostazioni linguistiche.