Respuesta directa — Whisper o Gemma 4: ¿cuál es mejor para el dictado local? Están diseñados para trabajos diferentes. Whisper es un modelo de reconocimiento de voz dedicado cuya única salida es una transcripción. Gemma 4 es un modelo de lenguaje multimodal que acepta audio entre otras entradas y puede razonar sobre él. Ningún benchmark público evalúa a ambos en el mismo conjunto de pruebas de voz, por lo que cualquiera que cite una cifra de precisión comparativa está comparando mediciones distintas. Para el dictado, el modelo dedicado sigue siendo la opción de ingeniería más segura.
Desde que Google publicó Gemma 4, la misma pregunta sigue apareciendo entre desarrolladores y usuarios técnicos: si un modelo multimodal general ya puede transcribir audio en un portátil, ¿sigue siendo un modelo de reconocimiento de voz dedicado como Whisper el motor adecuado para la precisión del dictado local?
Es una buena pregunta, y la mayoría de las respuestas que circulan se basan en cifras que no resisten un vistazo a las fuentes primarias. Este artículo compara los dos modelos de reconocimiento de voz en el dispositivo en lo que realmente está documentado — arquitectura, evaluaciones publicadas, restricciones — y es honesto sobre dónde se detiene la evidencia.
¿Qué son Whisper y Gemma 4?
Pertenecen a dos familias de modelos distintas con objetivos de diseño diferentes.
Whisper es un modelo de reconocimiento automático de voz publicado por OpenAI. El artículo que lo describe, Robust Speech Recognition via Large-Scale Weak Supervision, se presentó en diciembre de 2022 y describe un entrenamiento sobre 680.000 horas de supervisión multilingüe y multitarea, con los modelos alcanzando un rendimiento competitivo en benchmarks en un entorno de transferencia zero-shot. El checkpoint insignia actual, large-v3, está documentado en su ficha de modelo como un codificador-decodificador Transformer de 1.550M de parámetros entrenado con 1 millón de horas de audio débilmente etiquetado y 4 millones de horas de audio pseudoetiquetado, y OpenAI señala una “reducción de errores del 10% al 20% en comparación con Whisper large-v2”. Su salida es una transcripción. Esa es toda su superficie.
Gemma 4 es la familia de modelos de pesos abiertos de Google. Google anunció Gemma 4 12B el 3 de junio de 2026 como, en sus propias palabras, “nuestro primer modelo de tamaño medio con entradas de audio nativas”. La ficha del modelo Gemma 4 enumera cinco tamaños — E2B, E4B, 12B Unified, 26B A4B (Mixture-of-Experts) y 31B Dense — de los cuales solo E2B, E4B y 12B aceptan audio. Su salida es texto del tipo que se le solicite: una transcripción, una traducción, un resumen, una respuesta.
La vía de audio de Gemma 4 no es un único diseño
El Technical Report de Gemma 4 describe “codificadores de visión y audio mejorados para todos los tamaños de modelo”, junto con “una arquitectura unificada y sin codificador para nuestro modelo de 12B, que ingiere audio y parches de imagen en bruto”. La publicación de lanzamiento de Google plantea la segunda mitad de forma más directa: para el 12B, “eliminó por completo el codificador de audio y proyectó la señal de audio en bruto en el mismo espacio dimensional que los tokens de texto”.
Así que “audio de Gemma 4” significa dos cosas distintas según el tamaño. Las variantes E2B y E4B incorporan un codificador de audio dedicado — la ficha de Hugging Face para gemma-4-E4B-it lo sitúa en aproximadamente 300M de parámetros. El 12B no lo tiene.
¿En qué se diferencian las dos arquitecturas para el dictado?
La diferencia que importa para el dictado es lo que se encuentra entre el micrófono y el campo de texto.
El decodificador de Whisper existe para emitir una transcripción, y nada más. El decodificador de Gemma 4 es un modelo de lenguaje que realiza generación de propósito general, y la transcripción es una instrucción entre muchas. Eso supone una ventaja real de capacidad cuando quieres que el audio se entienda, y un desvío innecesario cuando solo quieres que se escriba.
| Whisper large-v3 | Gemma 4 E2B / E4B | Gemma 4 12B | |
|---|---|---|---|
| Tipo de modelo | ASR dedicado | LLM multimodal | LLM multimodal |
| Parámetros | 1.550M | 2,3B / 4,5B efectivos (5,1B / 8B con embeddings) | 11,95B |
| Vía de audio | Codificador-decodificador, entrada de audio, salida de texto | Codificador de audio dedicado (~300M en E4B) | Sin codificador: audio en bruto proyectado en el espacio de embeddings de texto |
| Salida | Solo transcripción | Transcripción, traducción, resumen, respuestas | Transcripción, traducción, resumen, respuestas |
| Ventana de audio documentada | Campo receptivo de 30 segundos; archivos largos mediante ventana deslizante de 30 segundos | 30 segundos | 30 segundos |
| Idiomas documentados | 99 | 12 en la evaluación FLEURS publicada | 12 en la evaluación FLEURS publicada |
| Condiciones | Licencia MIT para el código y los pesos del modelo | Pesos abiertos, “uso comercial responsable” bajo los términos de Gemma | Igual |
Fuentes de cada celda: el repositorio openai/whisper y su ficha de modelo; la ficha del modelo Gemma 4 de Google, la documentación de audio y el Technical Report.
Dos filas merecen una segunda mirada.
La ventana de 30 segundos es una restricción compartida, alcanzada desde direcciones opuestas. La documentación de OpenAI describe un campo receptivo de 30 segundos y explica que su método transcribe() “procesa el audio con una ventana deslizante de 30 segundos”. La documentación de audio de Google indica claramente que “el audio admite una duración máxima de 30 segundos”. Ninguno de los dos modelos absorbe una grabación de una hora en un solo paso; ambos necesitan una lógica de fragmentación a su alrededor.
La fila de idiomas no es una comparación equivalente. Los 99 idiomas de Whisper son una afirmación de cobertura documentada. El 12 de Gemma 4 es el tamaño del conjunto de evaluación que Google publicó, no un límite de lo que el modelo intentará — pero fuera de esos 12 idiomas no dispones de ninguna medición publicada en la que basarte.
¿Existe un benchmark publicado que los compare directamente?
No — y esto es lo más importante que hay que saber antes de confiar en cualquier comparación que leas.
El Technical Report de Gemma 4 de Google contiene una tabla de evaluación de voz, “FLEURS ASR (WER, cuanto más bajo, mejor)”, que cubre 12 idiomas. Todos los modelos de esa tabla son modelos Gemma: Gemma 4 E2B y E4B medidos frente a sus predecesores Gemma 3n. Whisper no aparece como referencia en ningún punto de la evaluación de audio. OpenAI, por su parte, publica el desglose por idioma de Whisper en Common Voice y FLEURS, evaluado con sus propios criterios y su propia lista de idiomas.
La consecuencia es inevitable. Para producir una frase del tipo “Whisper obtiene X% y Gemma obtiene Y%”, hay que tomar una cifra de una evaluación y colocarla junto a una cifra de otra — subconjuntos de idiomas distintos, normalización de texto distinta, transcripciones de referencia distintas, años distintos. La aritmética funciona. La comparación no.
Esto no es un problema específico de Gemma. Es el estado normal de los benchmarks de ASR, y es la razón por la que nuestra guía sobre la precisión del reconocimiento de voz dedica más tiempo a cómo se produjo una cifra que a la cifra en sí. La tasa de error de palabras es la proporción de palabras que un sistema transcribe incorrectamente — sustituciones, eliminaciones e inserciones dividida por el número de palabras de la referencia. Describe una ejecución, no un modelo.
Cambia cualquiera de los siguientes factores y los mismos pesos producirán un WER diferente:
- El conjunto de datos. FLEURS es habla leída: frases preparadas, grabadas con limpieza. El dictado es espontáneo, con falsos comienzos, nombres de producto y un micrófono de portátil.
- El idioma. Las propias cifras de Google varían en más de un factor de cuatro entre los 12 idiomas que midió.
- La convención de puntuación. Google marca algunos idiomas de su tabla con tasa de error de caracteres en lugar de tasa de error de palabras, porque los límites de palabra no existen del mismo modo.
- Las condiciones del audio. El ruido de fondo, el acento y los hablantes superpuestos mueven la cifra mucho más que la elección entre dos modelos sólidos.
¿Qué muestran realmente las cifras de voz de Gemma 4 publicadas por Google?
Muestran una clara mejora generacional respecto a Gemma 3n, y muestran por qué una media es un resumen deficiente.
Estos son los valores de la Tabla 7 del Technical Report de Gemma 4 — FLEURS, habla leída, WER (cuanto más bajo, mejor), promediados sobre los 12 idiomas que evaluó Google, convertidos aquí de las fracciones decimales del informe a porcentajes:
| Modelo | Media, 12 idiomas | Inglés | Alemán | Francés | Español |
|---|---|---|---|---|---|
| Gemma 3n E2B | 10,8% | 7,6% | 7,9% | 13,0% | 5,1% |
| Gemma 3n E4B | 8,5% | 6,6% | 6,5% | 9,8% | 4,1% |
| Gemma 4 E2B | 9,0% | 8,0% | 7,6% | 10,1% | 4,2% |
| Gemma 4 E4B | 7,5% | 6,5% | 6,1% | 8,0% | 3,5% |
Dos advertencias acompañan a esta tabla y no deben omitirse. Primero, la media de los 12 idiomas mezcla convenciones de puntuación, porque Google reporta tasa de error de caracteres en lugar de tasa de error de palabras para algunos idiomas del conjunto. Segundo, la ficha del modelo de Google indica por separado que el 12B obtiene 0,069 en FLEURS, pero lo señala como “excluyendo el idioma chino” — un conjunto de idiomas diferente, por lo que no se sitúa en la misma fila que los demás.
Ahora la parte interesante. Gemma 4 E2B mejora la media de 12 idiomas respecto a Gemma 3n E2B, de 10,8% a 9,0% — pero su WER en inglés va en sentido contrario, de 7,6% a 8,0%. Un modelo puede mejorar en promedio y empeorar en el idioma en el que realmente dictas. Si tu carga de trabajo es dictado en inglés, la media nunca fue la cifra que necesitabas.
Ese es el argumento para hacer benchmarking con tu propio audio, en tu propio idioma, en lugar de elegir un modelo a partir de una fila de una tabla de clasificación.
¿Qué modelo deberías elegir para el dictado local?
Elige según el resultado que necesitas, no según el titular que te impresionó.
Elige un modelo ASR dedicado como Whisper cuando:
- El resultado final es una transcripción que llega a un campo de texto, un editor o un archivo de subtítulos
- Necesitas una amplia cobertura de idiomas — 99 idiomas documentados es una red muy amplia
- Quieres un runtime en el dispositivo maduro; whisper.cpp tiene años de optimización específica por plataforma detrás, y nuestra guía de instalación de whisper.cpp explica paso a paso cómo ejecutarlo tú mismo
- La latencia por enunciado importa más que la versatilidad, porque el dictado es un bucle que ejecutas cientos de veces al día
Elige un modelo multimodal como Gemma 4 cuando:
- Quieres que la grabación se entienda, no solo que se transcriba — resumida, consultada, clasificada
- Ya estás ejecutando un modelo de lenguaje en el dispositivo y prefieres no añadir un segundo
- La traducción de voz forma parte del producto, algo que Google mide por separado en CoVoST
- La huella de memoria adicional es aceptable; Google posiciona el 12B como capaz de ejecutarse localmente “con solo 16GB de VRAM”
Hay una tercera respuesta que a menudo es la correcta: ambos, en momentos distintos. Transcribe con el modelo dedicado, y luego pasa el texto a un modelo de lenguaje si necesita trabajo adicional. Eso es un pipeline más sencillo que pedirle a un solo modelo que destaque en dos trabajos, y cada etapa sigue siendo comprobable de forma independiente.
Dónde se sitúa Weesper Neon Flow
Weesper Neon Flow ejecuta Whisper localmente mediante whisper.cpp en macOS y Windows, con más de 50 idiomas, sin llamadas de red y una prueba gratuita de 15 días. Esa elección no es una afirmación de que Whisper sea el mejor modelo de voz que existe — es una afirmación sobre el ajuste al caso de uso.
El dictado es un bucle sensible a la latencia que ocurre dentro de la aplicación en la que ya te encuentres: un correo, un editor de código, una nota clínica. Lo que necesita es una transcripción, rápida, una y otra vez, sin que nada salga de la máquina. Un modelo ASR dedicado produce exactamente esa salida, por lo que el presupuesto de ingeniería se destina a la experiencia de dictado — atajos de teclado, inserción de texto, vocabulario personalizado. La documentación de ayuda cubre modelos, idiomas y permisos.
Seguimos de cerca el enfoque alternativo. Nuestra reseña de la app de dictado Eloquent de Google analiza el dictado local basado en Gemma en un producto de consumo ya lanzado, y nuestra comparación entre Voxtral y Whisper cubre el lado del ASR dedicado del mismo mercado. Para saber dónde debería ejecutarse la inferencia en primer lugar, consulta nuestra comparación entre transcripción local y en la nube.
Preguntas frecuentes
¿Es Gemma 4 más preciso que Whisper para el dictado?
No existe una respuesta comparativa publicada. El Technical Report de Gemma 4 de Google evalúa el reconocimiento de voz de Gemma 4 en FLEURS frente a su propio predecesor, Gemma 3n, y no incluye a Whisper como referencia. Las evaluaciones de Whisper de OpenAI usan conjuntos de prueba distintos y una lista de idiomas diferente. Cualquier cifra única que afirme que uno supera al otro por un margen determinado está combinando dos mediciones que nunca se realizaron bajo las mismas condiciones.
¿Tiene Gemma 4 un codificador de audio?
Depende del tamaño. El Technical Report describe codificadores de audio mejorados para los tamaños de modelo en general, y una arquitectura unificada y sin codificador independiente para el 12B, que ingiere directamente audio y parches de imagen en bruto. La ficha de Hugging Face para gemma-4-E4B-it indica un codificador de audio de aproximadamente 300M de parámetros. Así, E2B y E4B usan un codificador de audio dedicado; el 12B proyecta la señal en bruto en el mismo espacio que los tokens de texto.
¿Qué es la tasa de error de palabras y por qué las cifras de WER publicadas no coinciden?
La tasa de error de palabras (WER) es la proporción de palabras que un sistema transcribe incorrectamente, contando sustituciones, eliminaciones e inserciones respecto a una transcripción de referencia. Es una proporción, no una propiedad de un modelo. Si cambias el conjunto de datos, el idioma, las condiciones de grabación, las reglas de normalización o la transcripción de referencia, los mismos pesos producen un WER diferente. Una cifra solo tiene sentido si se conoce su alcance.
¿Puede Gemma 4 transcribir audio de más de 30 segundos?
La documentación de audio de Google indica que el audio admite una duración máxima de 30 segundos. Whisper tiene el mismo tipo de restricción desde otro ángulo: la documentación de OpenAI describe un campo receptivo de 30 segundos, y su método transcribe gestiona archivos largos mediante una ventana deslizante de 30 segundos. En ambos casos, las grabaciones más largas necesitan una lógica de fragmentación alrededor del modelo en lugar de un único paso a través de él.
¿Qué modelo utiliza Weesper Neon Flow, y por qué?
Weesper Neon Flow ejecuta Whisper localmente mediante whisper.cpp en macOS y Windows. El motivo es el alcance: el dictado necesita una sola cosa bien hecha y repetida — convertir voz en texto con baja latencia, dentro de la aplicación en la que te encuentres. Un modelo de reconocimiento de voz dedicado tiene exactamente esa salida y un runtime en el dispositivo maduro, de modo que el esfuerzo de ingeniería se dedica a la experiencia de dictado en lugar de a limitar un modelo general a una única tarea.
¿Deberían los desarrolladores que crean una función de dictado elegir un modelo ASR o un LLM multimodal?
Elige según el resultado que necesitas, no según el titular. Si necesitas una transcripción que llegue a un campo de texto, un modelo ASR dedicado es el camino más corto. Si necesitas que el audio se entienda en lugar de que se escriba — resumido, consultado, clasificado — un modelo multimodal hace en un solo paso lo que de otro modo requeriría una transcripción seguida de un segundo modelo. Muchos productos quieren ambas cosas, en distintos puntos del flujo de trabajo.
La conclusión práctica
Gemma 4 es un trabajo significativo: una familia de pesos abiertos en la que tres de los cinco tamaños aceptan audio de forma nativa, y en la que el 12B elimina por completo el codificador de audio. No es, según el registro publicado, un sustituto medido de un modelo ASR dedicado en un producto de dictado — porque nadie ha publicado esa medición.
Hasta que alguien ejecute ambos en el mismo conjunto de pruebas con la misma normalización, la comparación honesta es arquitectónica y no numérica. Una app de dictado necesita una transcripción, rápida, en contexto, sin que nada salga del dispositivo. Un modelo multimodal necesita entender el audio. Trabajos diferentes — y el segundo no engloba automáticamente al primero.
¿Quieres probar la vía del ASR dedicado con tu propia voz? Prueba Weesper Neon Flow gratis durante 15 días en macOS o Windows — Whisper ejecutándose localmente, sin cuenta, sin subida de archivos, sin medidor por minuto.