Risposta diretta — Whisper o Gemma 4: quale è meglio per la dettatura on-device? Sono costruiti per compiti diversi. Whisper è un modello di riconoscimento vocale dedicato il cui unico output è una trascrizione. Gemma 4 è un modello linguistico multimodale che accetta audio tra i suoi vari input e può ragionarci sopra. Nessun benchmark pubblico valuta i due modelli sullo stesso set di test vocali, quindi chiunque citi una cifra di precisione testa a testa sta confrontando misurazioni diverse. Per la dettatura, il modello dedicato resta la scelta di ingegneria più sicura.
Da quando Google ha pubblicato Gemma 4, la stessa domanda continua a tornare da parte di sviluppatori e utenti tecnici: se un modello multimodale generico può ora trascrivere audio su un laptop, un modello di riconoscimento vocale dedicato come Whisper è ancora il motore giusto per la precisione della dettatura on-device?
È una buona domanda, e la maggior parte delle risposte in circolazione si basa su numeri che non resistono a una verifica delle fonti primarie. Questo articolo confronta i due modelli di riconoscimento vocale on-device su ciò che è effettivamente documentato — architettura, valutazioni pubblicate, vincoli — ed è onesto su dove si ferma la documentazione disponibile.
Cosa sono Whisper e Gemma 4?
Appartengono a due famiglie di modelli diverse, con obiettivi di design diversi.
Whisper è un modello di riconoscimento vocale automatico rilasciato da OpenAI. L’articolo che lo descrive, Robust Speech Recognition via Large-Scale Weak Supervision, è stato sottomesso nel dicembre 2022 e riporta un addestramento su 680.000 ore di supervisione multilingue e multitask, con i modelli che raggiungono prestazioni competitive nei benchmark in un contesto di trasferimento zero-shot. L’attuale checkpoint di punta, large-v3, è documentato nella sua scheda modello come un Transformer encoder-decoder da 1.550M di parametri, addestrato su 1 milione di ore di audio con etichettatura debole e 4 milioni di ore di audio con pseudo-etichettatura, e OpenAI riporta una “riduzione degli errori dal 10% al 20% rispetto a Whisper large-v2”. Il suo output è una trascrizione. Questa è tutta la sua superficie funzionale.
Gemma 4 è la famiglia di modelli open weights di Google. Google ha annunciato Gemma 4 12B il 3 giugno 2026 definendolo, con le sue stesse parole, “il nostro primo modello di dimensioni medie con input audio nativi”. La scheda modello di Gemma 4 elenca cinque dimensioni — E2B, E4B, 12B Unified, 26B A4B (Mixture-of-Experts) e 31B Dense — delle quali solo E2B, E4B e 12B accettano audio. Il suo output è testo di qualsiasi tipo tu richieda: una trascrizione, una traduzione, un riassunto, una risposta.
Il percorso audio di Gemma 4 non è un design unico
Il Gemma 4 Technical Report descrive “encoder di visione e audio migliorati per tutte le dimensioni dei modelli”, insieme a “un’architettura unificata e priva di encoder per il nostro modello 12B, che riceve audio grezzo e patch di immagine”. Il post di lancio di Google formula la seconda metà in modo più diretto: per il 12B, “ha rimosso completamente l’encoder audio e proiettato il segnale audio grezzo nello stesso spazio dimensionale dei token di testo”.
Quindi “l’audio di Gemma 4” significa due cose diverse in base alla dimensione. Le varianti E2B e E4B dispongono di un encoder audio dedicato — la scheda Hugging Face per gemma-4-E4B-it lo indica a circa 300M di parametri. Il 12B no.
Come differiscono le due architetture per la dettatura?
La differenza che conta per la dettatura è ciò che si trova tra il microfono e il campo di testo.
Il decoder di Whisper esiste per produrre una trascrizione, e nulla altro. Il decoder di Gemma 4 è un modello linguistico che esegue generazione general-purpose, e la trascrizione è una istruzione fra tante. Questo è un vero vantaggio in termini di capacità quando vuoi che l’audio venga compreso, e una deviazione superflua quando vuoi solo che venga scritto.
| Whisper large-v3 | Gemma 4 E2B / E4B | Gemma 4 12B | |
|---|---|---|---|
| Tipo di modello | ASR dedicato | LLM multimodale | LLM multimodale |
| Parametri | 1.550M | 2,3B / 4,5B effettivi (5,1B / 8B con embedding) | 11,95B |
| Percorso audio | Encoder-decoder, audio in ingresso, testo in uscita | Encoder audio dedicato (~300M su E4B) | Privo di encoder: audio grezzo proiettato nello spazio di embedding del testo |
| Output | Solo trascrizione | Trascrizione, traduzione, riassunto, risposte | Trascrizione, traduzione, riassunto, risposte |
| Finestra audio documentata | Campo recettivo di 30 secondi; file lunghi tramite una finestra scorrevole di 30 secondi | 30 secondi | 30 secondi |
| Lingue documentate | 99 | 12 nella valutazione FLEURS pubblicata | 12 nella valutazione FLEURS pubblicata |
| Termini di licenza | Licenza MIT per codice e pesi del modello | Pesi aperti, “uso commerciale responsabile” secondo i termini di Gemma | Uguale |
Fonti per ogni cella: il repository openai/whisper e la sua scheda modello; la scheda modello di Gemma 4 di Google, la documentazione audio e il Technical Report.
Due righe meritano un secondo sguardo.
La finestra di 30 secondi è un vincolo condiviso, raggiunto da direzioni opposte. La documentazione di OpenAI descrive un campo recettivo di 30 secondi e spiega che il suo metodo transcribe() “elabora l’audio con una finestra scorrevole di 30 secondi”. La documentazione audio di Google afferma chiaramente che “L’audio supporta una lunghezza massima di 30 secondi”. Nessuno dei due modelli digerisce una registrazione di un’ora in un solo passaggio; entrambi necessitano di una logica di suddivisione in blocchi attorno a essi.
La riga delle lingue non è un confronto alla pari. Le 99 lingue di Whisper sono una dichiarazione di copertura documentata. Le 12 di Gemma 4 sono la dimensione del set di valutazione pubblicato da Google, non un limite massimo a ciò che il modello può tentare — ma fuori da quelle 12 lingue non hai alcuna misurazione pubblicata su cui ragionare.
Esiste un benchmark pubblicato che le confronta testa a testa?
No — ed è la cosa più importante da sapere prima di fidarsi di qualsiasi confronto che leggi.
Il Gemma 4 Technical Report di Google contiene una tabella di valutazione vocale, “FLEURS ASR (WER, più basso è meglio)”, che copre 12 lingue. Ogni modello in quella tabella è un modello Gemma: Gemma 4 E2B ed E4B misurati contro i loro predecessori Gemma 3n. Whisper non appare come baseline in nessun punto della valutazione audio. OpenAI, da parte sua, pubblica la ripartizione linguistica di Whisper su Common Voice e FLEURS, valutata secondo i propri criteri e il proprio elenco di lingue.
La conseguenza è inevitabile. Per produrre una frase del tipo “Whisper ottiene X% e Gemma ottiene Y%”, devi prendere un numero da una valutazione e metterlo accanto a un numero di un’altra — sottoinsiemi di lingue diversi, normalizzazione del testo diversa, trascrizioni di riferimento diverse, anni diversi. L’aritmetica funziona. Il confronto no.
Non è un problema specifico di Gemma. È lo stato normale del benchmarking ASR, ed è il motivo per cui la nostra guida alla precisione del riconoscimento vocale dedica più tempo a come è stata prodotta una cifra che alla cifra stessa. Il tasso di errore sulle parole (Word Error Rate, WER) è la proporzione di parole che un sistema sbaglia — sostituzioni, omissioni e inserimenti divisi per il numero di parole nel riferimento. Descrive una prova, non un modello.
Cambia uno qualsiasi dei seguenti elementi e gli stessi pesi produrranno un WER diverso:
- Il dataset. FLEURS è parlato letto: frasi preparate, registrate in condizioni pulite. La dettatura è spontanea, con falsi inizi, nomi di prodotto e un microfono da laptop.
- La lingua. I numeri stessi di Google variano di più di un fattore quattro tra le 12 lingue misurate.
- La convenzione di punteggio. Google segna alcune lingue nella sua tabella con il tasso di errore sui caratteri invece del tasso di errore sulle parole, perché i confini tra le parole non esistono nello stesso modo.
- Le condizioni audio. Il rumore di fondo, l’accento e i parlanti sovrapposti spostano il numero molto più di quanto faccia la scelta tra due modelli solidi.
Cosa mostrano davvero i numeri vocali pubblicati di Gemma 4?
Mostrano un chiaro miglioramento generazionale rispetto a Gemma 3n, e mostrano perché una media sia un pessimo riassunto.
Questi sono i valori della Tabella 7 del Gemma 4 Technical Report — FLEURS, parlato letto, WER dove un valore più basso è meglio, mediati sulle 12 lingue valutate da Google, convertiti qui dalle frazioni decimali del report in percentuali:
| Modello | Media, 12 lingue | Inglese | Tedesco | Francese | Spagnolo |
|---|---|---|---|---|---|
| Gemma 3n E2B | 10,8% | 7,6% | 7,9% | 13,0% | 5,1% |
| Gemma 3n E4B | 8,5% | 6,6% | 6,5% | 9,8% | 4,1% |
| Gemma 4 E2B | 9,0% | 8,0% | 7,6% | 10,1% | 4,2% |
| Gemma 4 E4B | 7,5% | 6,5% | 6,1% | 8,0% | 3,5% |
Due avvertenze accompagnano questa tabella e non vanno tralasciate. Primo, la media sulle 12 lingue mescola convenzioni di punteggio, perché Google riporta il tasso di errore sui caratteri invece del tasso di errore sulle parole per alcune lingue del set. Secondo, la scheda modello di Google elenca separatamente il 12B a 0,069 su FLEURS ma lo segnala come “Escludendo la lingua cinese” — un set di lingue diverso, quindi non si colloca sulla stessa riga degli altri.
Ora la parte interessante. Gemma 4 E2B migliora la media sulle 12 lingue rispetto a Gemma 3n E2B, passando dal 10,8% al 9,0% — ma il suo WER in inglese va nella direzione opposta, dal 7,6% all’8,0%. Un modello può migliorare in media e peggiorare sulla lingua in cui detti realmente. Se il tuo carico di lavoro è la dettatura in inglese, la media non è mai stata il numero di cui avevi bisogno.
Questo è l’argomento a favore di fare benchmark sul proprio audio, nella propria lingua, piuttosto che scegliere un modello da una riga di classifica.
Quale modello scegliere per la dettatura on-device?
Scegli in base all’output di cui hai bisogno, non al titolo che ti ha impressionato.
Scegli un modello ASR dedicato come Whisper quando:
- Il risultato richiesto è una trascrizione che finisce in un campo di testo, in un editor o in un file di sottotitoli
- Hai bisogno di un’ampia copertura linguistica — 99 lingue documentate sono una rete molto ampia
- Vuoi un runtime on-device maturo; whisper.cpp ha anni di ottimizzazione specifica per piattaforma dietro di sé, e la nostra guida all’installazione di whisper.cpp illustra passo per passo come eseguirlo tu stesso
- La latenza per singola frase pronunciata conta più della versatilità, perché la dettatura è un ciclo che ripeti centinaia di volte al giorno
Scegli un modello multimodale come Gemma 4 quando:
- Vuoi che la registrazione venga compresa, non solo scritta — riassunta, interrogata, classificata
- Stai già eseguendo un modello linguistico sul dispositivo e preferiresti non distribuirne un secondo
- La traduzione vocale fa parte del prodotto, e Google la misura separatamente su CoVoST
- L’impronta di memoria aggiuntiva è accettabile; Google presenta il 12B come eseguibile localmente “con appena 16 GB di VRAM”
C’è una terza risposta che spesso è quella giusta: entrambi, in punti diversi. Trascrivi con il modello dedicato, poi passa il testo a un modello linguistico se ha bisogno di ulteriore lavorazione. È una pipeline più semplice rispetto a chiedere a un solo modello di eccellere in due compiti, e ogni fase resta testabile in modo indipendente.
Dove si posiziona Weesper Neon Flow
Weesper Neon Flow esegue Whisper localmente tramite whisper.cpp su macOS e Windows, con oltre 50 lingue, nessuna chiamata di rete e una prova gratuita di 15 giorni. Questa scelta non è un’affermazione che Whisper sia il miglior modello vocale in assoluto — è un’affermazione sull’adeguatezza al compito.
La dettatura è un ciclo sensibile alla latenza che avviene all’interno di qualsiasi applicazione in cui ti trovi già: un’email, un editor di codice, una nota clinica. Ciò di cui ha bisogno è una trascrizione, rapida, ripetuta all’infinito, senza che nulla lasci la macchina. Un modello ASR dedicato produce esattamente quell’output, quindi il budget di ingegneria va nell’esperienza di dettatura — hotkey, inserimento del testo, vocabolario personalizzato. La documentazione di aiuto illustra modelli, lingue e permessi.
Seguiamo con attenzione l’approccio alternativo. La nostra recensione dell’app di dettatura Eloquent di Google analizza la dettatura on-device basata su Gemma in un prodotto di consumo già in commercio, e il nostro confronto tra Voxtral e Whisper copre il lato ASR dedicato dello stesso mercato. Per capire dove dovrebbe avvenire l’inferenza in generale, consulta il nostro confronto tra trascrizione on-device e cloud.
Domande frequenti
Gemma 4 è più preciso di Whisper per la dettatura?
Non esiste una risposta pubblicata testa a testa. Il Gemma 4 Technical Report di Google valuta il riconoscimento vocale di Gemma 4 su FLEURS confrontandolo con il suo predecessore, Gemma 3n, e non include Whisper come baseline. Le valutazioni di Whisper di OpenAI usano set di test diversi e un elenco di lingue diverso. Qualsiasi cifra unica che affermi che uno batte l’altro con un certo margine sta cucendo insieme due misurazioni che non sono mai state eseguite nelle stesse condizioni.
Gemma 4 ha un encoder audio?
Dipende dalla dimensione. Il Technical Report descrive encoder audio migliorati per le dimensioni dei modelli in generale, e un’architettura separata, unificata e priva di encoder per il 12B, che riceve direttamente audio grezzo e patch di immagine. La scheda Hugging Face per gemma-4-E4B-it indica un encoder audio di circa 300M di parametri. Quindi E2B e E4B usano un encoder audio dedicato; il 12B proietta il segnale grezzo nello stesso spazio dei token di testo.
Cos’è il tasso di errore sulle parole (Word Error Rate), e perché le cifre WER pubblicate non coincidono?
Il tasso di errore sulle parole (Word Error Rate, WER) è la quota di parole che un sistema sbaglia, contando sostituzioni, omissioni e inserimenti rispetto a una trascrizione di riferimento. È un rapporto, non una proprietà di un modello. Cambia il dataset, la lingua, le condizioni di registrazione, le regole di normalizzazione o la trascrizione di riferimento, e gli stessi pesi produrranno un WER diverso. Una cifra è significativa solo insieme al suo perimetro.
Gemma 4 può trascrivere audio più lunghi di 30 secondi?
La documentazione audio di Google afferma che l’audio supporta una lunghezza massima di 30 secondi. Whisper ha lo stesso tipo di vincolo, visto da una direzione diversa: la documentazione di OpenAI descrive un campo recettivo di 30 secondi, e il suo metodo transcribe gestisce i file lunghi con una finestra scorrevole di 30 secondi. In entrambi i casi, le registrazioni più lunghe richiedono una logica di suddivisione in blocchi attorno al modello, piuttosto che un unico passaggio al suo interno.
Quale modello usa Weesper Neon Flow, e perché?
Weesper Neon Flow esegue Whisper localmente tramite whisper.cpp su macOS e Windows. Il motivo è il perimetro applicativo: la dettatura richiede una cosa sola fatta bene e in modo ripetuto — trasformare il parlato in testo con bassa latenza, all’interno di qualsiasi applicazione in cui ti trovi. Un modello di riconoscimento vocale dedicato produce esattamente quell’output e dispone di un runtime on-device maturo, così lo sforzo di ingegneria va nell’esperienza di dettatura piuttosto che nel vincolare un modello generico a un unico compito.
Gli sviluppatori che costruiscono una funzione di dettatura dovrebbero scegliere un modello ASR o un LLM multimodale?
Scegli in base all’output, non al titolo che fa notizia. Se ti serve una trascrizione che finisca in un campo di testo, un modello ASR dedicato è la strada più breve. Se ti serve che l’audio venga compreso piuttosto che semplicemente scritto — riassunto, interrogato, classificato — un modello multimodale fa in un solo passaggio ciò che altrimenti richiederebbe una trascrizione seguita da un secondo modello. Molti prodotti vogliono entrambe le cose, in punti diversi del flusso di lavoro.
La conclusione pratica
Gemma 4 è un lavoro significativo: una famiglia open weights in cui tre delle cinque dimensioni gestiscono l’audio in modo nativo, e in cui il 12B elimina completamente l’encoder audio. Non è, sulla base della documentazione pubblicata, un sostituto misurato di un modello ASR dedicato in un prodotto di dettatura — perché nessuno ha pubblicato quella misurazione.
Finché qualcuno non eseguirà entrambi sullo stesso set di test con la stessa normalizzazione, il confronto onesto è architetturale piuttosto che numerico. Un’app di dettatura ha bisogno di una trascrizione, veloce, in contesto, senza che nulla lasci il dispositivo. Un modello multimodale ha bisogno di comprendere l’audio. Compiti diversi — e il secondo non include automaticamente il primo.
Vuoi testare la strada dell’ASR dedicato con la tua voce? Prova Weesper Neon Flow gratis per 15 giorni su macOS o Windows — Whisper in esecuzione locale, senza account, senza upload, senza conteggio a minuto.