Respuesta directa — ¿en qué se diferencian el Dictado de Apple y OpenAI Whisper? El Dictado de Apple es una función del sistema de macOS: Apple documenta su comportamiento y su lista de configuraciones regionales, no su arquitectura ni sus tasas de error. Whisper es un modelo codificador-decodificador de pesos abiertos de OpenAI, entrenado con 680.000 horas de audio débilmente supervisado y publicado en seis tamaños que puedes inspeccionar y ejecutar tú mismo. Uno es la superficie de un producto terminado; el otro es un modelo sobre el que se construyen productos.
Busca Dictado de Apple vs OpenAI Whisper y la mayoría de los resultados responden a una pregunta distinta: qué aplicación deberías instalar. Esa decisión merece tomarse con cuidado, y la tratamos por separado en un artículo sobre si la herramienta integrada es suficiente para tu flujo de trabajo diario.
Este artículo responde a la pregunta más concreta que hay debajo. ¿En qué se diferencian realmente los dos motores de reconocimiento — en arquitectura, en datos de entrenamiento, en la forma de contar la cobertura de idiomas, en los tamaños de modelo que exponen, y en lo que una cifra de precisión publicada significa y no significa?
¿Qué es exactamente el Dictado de Apple, y qué es Whisper?
No pertenecen a la misma categoría, por eso la comparación directa es más difícil de lo que parece. Uno es una función; el otro es un modelo.
El Dictado de Apple es la conversión de voz a texto integrada en macOS. Pulsas una tecla, hablas, y el texto aparece en el campo en el que estabas escribiendo. La documentación de soporte de Apple describe qué hace por ti y dónde está disponible, y remite a la página de disponibilidad de funciones de macOS para la lista de idiomas.
OpenAI Whisper es un modelo de reconocimiento de voz. Es un único Transformer codificador-decodificador que realiza identificación de idioma, transcripción y traducción al inglés, publicado con pesos y código de inferencia abiertos. No tiene interfaz, ni atajo de teclado, ni comportamiento de portapapeles. Eso pertenece a la aplicación que lo envuelva.
Esa asimetría recorre cada comparación que sigue. Tú usas el Dictado de Apple. Tú construyes sobre Whisper.
¿En qué se diferencian los dos motores por dentro?
La diferencia más clara no es la precisión, sino la divulgación. La arquitectura de Whisper, el volumen de datos de entrenamiento, los tamaños de modelo y los resultados de los benchmarks están publicados; los de Apple no.
El artículo de Whisper describe un modelo entrenado con “680.000 horas de supervisión multilingüe y multitarea”, usando supervisión débil en lugar de un corpus curado a mano. Apple no publica ninguna cifra equivalente para el Dictado, ninguna descripción de arquitectura ni ninguna tabla de benchmarks.
| Eje técnico | Dictado de Apple (macOS) | OpenAI Whisper |
|---|---|---|
| Qué es | Una función del sistema dentro de macOS | Un modelo de reconocimiento de voz de pesos abiertos |
| Arquitectura publicada | ❌ No documentada públicamente | ✅ Transformer codificador-decodificador (arXiv:2212.04356) |
| Volumen de datos de entrenamiento divulgado | ❌ No publicado | ✅ 680.000 horas de audio débilmente supervisado |
| Cobertura contada en | Configuraciones regionales — 63 entradas de dictado en macOS Tahoe | Idiomas — 99 enumerados para large-v3 |
| Tamaños de modelo seleccionables | ❌ Ninguno expuesto | ✅ Seis, de 39 M a 1.550 M de parámetros |
| Tasas de error publicadas | ❌ Ninguna | ✅ Por benchmark nombrado, con las condiciones indicadas |
| Gestión del audio | No documentada | Campo receptivo de 30 segundos, ventana deslizante |
| Limitaciones conocidas documentadas | ❌ No publicadas | ✅ Alucinación y disparidad entre acentos indicadas en la ficha del modelo |
| Quién distribuye la interfaz | Apple | Quien construya la aplicación |
Nada de esto hace que un motor sea mejor. Los hace conocibles de forma distinta. Si necesitas justificar la elección de una herramienta ante un responsable de cumplimiento, una revisión de seguridad o tu propio yo futuro, esa asimetría lo es todo.
¿Por qué no se pueden comparar el Dictado de Apple y Whisper en precisión?
Porque solo una de las partes publica cifras, y las cifras que existen pertenecen a benchmarks concretos, no al modelo en general. Cualquier comparación de la precisión del Dictado de Apple frente a Whisper expresada como dos porcentajes ordenados se ha inventado al menos uno de ellos.
Los propios autores de Whisper son inusualmente directos al respecto. El artículo señala que “el mejor modelo Whisper en zero-shot tiene un WER relativamente poco destacable de 2,5 en LibriSpeech test-clean” — y lo dice para remarcar algo: un benchmark de habla leída, limpio y solo en inglés no es donde se manifiesta el valor del modelo. Lo que importa es la robustez frente al audio real y desordenado.
Lee esa cifra con todo su alcance: 2,5% de tasa de error de palabras, en LibriSpeech test-clean, habla leída en inglés, audio limpio, en zero-shot sin ajuste fino en ese benchmark. Cambia cualquiera de esas cinco condiciones y la cifra se mueve.
La ficha del modelo large-v3 también documenta los modos de fallo. Indica que las predicciones “pueden incluir textos que en realidad no se pronunciaron en la entrada de audio (es decir, alucinación)”, y que los modelos “muestran un rendimiento dispar entre distintos acentos y dialectos de idiomas concretos”. Eso es un fabricante publicando sus propios puntos débiles.
La documentación del Dictado de Apple no contiene material comparable — ni WER, ni benchmark, ni ninguna limitación declarada más allá de la disponibilidad. Su ausencia no es evidencia de mala precisión. Es evidencia de que nadie fuera de Apple puede citar una cifra con honestidad. Si quieres el método subyacente en lugar del marketing, cubrimos cómo se mide en la práctica la precisión del reconocimiento de voz, incluido cómo ejecutar una prueba de tasa de error de palabras sobre tu propio dictado.
¿En qué se diferencia la cobertura de idiomas — 99 idiomas o 63 configuraciones regionales?
Los dos sistemas cuentan en unidades distintas, así que las cifras destacadas no son comparables. La ficha del modelo large-v3 enumera 99 idiomas. La página de disponibilidad de funciones de macOS Tahoe de Apple enumera el Dictado por configuración regional.
Leída en agosto de 2026, esa página de Apple contiene 63 entradas de dictado. Al fusionar las variantes regionales — quince entradas en inglés, cinco en español, cuatro en francés, tres en alemán — se llega a unos 34 idiomas distintos. Apple también indica que el Dictado “no está disponible en todos los idiomas o regiones, y las funciones pueden variar”, y que el dictado en el dispositivo y sin modo cubre un subconjunto todavía más reducido, tras descargar un modelo de voz.
Más importante que cualquiera de los dos recuentos: ninguna de las dos listas promete la misma calidad en todas sus entradas. El artículo de Whisper cuantifica exactamente esa desigualdad, algo poco habitual. Indica que, de las 680.000 horas de audio de entrenamiento, “117.000 horas cubren otros 96 idiomas”, y que además se incluyen “125.000 horas de datos de traducción X→en”.
| Audio de entrenamiento de Whisper (680.000 horas en total) | Horas |
|---|---|
| Reconocimiento de voz en inglés | ~438.000 |
| Otros 96 idiomas | 117.000 |
| Traducción X→inglés | 125.000 |
El artículo indica directamente las dos últimas cifras; la primera es simplemente lo que queda del total (680.000 − 117.000 − 125.000 = 438.000). Aproximadamente dos tercios del audio de entrenamiento son en inglés.
Ese desequilibrio tiene una consecuencia medida. El artículo reporta “un coeficiente de correlación al cuadrado sólido de 0,83 entre el logaritmo de la tasa de error de palabras y el logaritmo de la cantidad de datos de entrenamiento por idioma”, y a partir de ese ajuste estima que “el WER se reduce a la mitad por cada incremento de 16x en los datos de entrenamiento”.
Así que un idioma situado en la cola delgada de la distribución de entrenamiento está mensurablemente peor servido, y el artículo lo dice sin rodeos. Apple te da una lista de marcas y cruces; Whisper te da una curva. Ninguno de los dos te dice si tu idioma concreto funcionará bien — pero solo uno te permite razonar por qué podría no hacerlo.
¿Por qué Whisper te deja elegir un tamaño de modelo?
Porque Whisper no es un modelo, sino una familia, y el equilibrio entre precisión y latencia se deja en manos de quien lo despliegue. El README de openai/whisper publica seis tamaños, desde tiny con 39 M de parámetros hasta large con 1.550 M, cada uno con su propio requisito de memoria y una velocidad relativa expresada frente al modelo large.
El rango es amplio. El repositorio sitúa a tiny en aproximadamente diez veces la velocidad de large; la variante turbo se sitúa en 809 M de parámetros y aproximadamente ocho veces la velocidad de large, razón por la que aparece tan a menudo en herramientas de dictado, donde la latencia se percibe en cada frase y no una sola vez por archivo.
macOS no expone ningún ajuste equivalente para el Dictado. Obtienes lo que Apple distribuya para tu configuración regional, calibrado según el propio equilibrio de Apple entre velocidad y calidad, y no hay ninguna opción que intercambie una cosa por la otra.
Ninguno de los dos enfoques es automáticamente el correcto. Una configuración fija y bien calibrada elimina una decisión que la mayoría de la gente no quiere tomar; un ajuste expuesto importa cuando tu hardware o tu tolerancia a la espera son poco habituales. Si quieres el selector completo con las cifras de memoria por tamaño, nuestra guía paso a paso para compilar whisper.cpp explica cómo compilar el runtime y descargar los pesos tú mismo.
¿Qué significa en la práctica la ventana de 30 segundos de Whisper?
Whisper no consume audio de duración arbitraria en un único paso. Tiene un campo receptivo de 30 segundos, y la implementación de referencia gestiona las grabaciones más largas desplazando una ventana a lo largo del archivo.
El repositorio lo indica directamente: el método transcribe() “lee el archivo completo y procesa el audio con una ventana deslizante de 30 segundos, realizando predicciones autorregresivas de secuencia a secuencia en cada ventana”.
Para la transcripción por lotes de un archivo terminado, eso es un detalle de implementación. Para el dictado en vivo es el problema de ingeniería central, porque todo lo que el modelo no hace tiene que construirse a su alrededor:
- Decidir cuándo ha terminado una frase hablada y debe enviarse un fragmento.
- Ensamblar ventanas consecutivas sin perder ni duplicar palabras en las uniones.
- Decidir si mostrar texto provisional o esperar a un resultado definitivo.
- Mantener el tiempo de ida y vuelta lo bastante corto para que hablar se sienta como escribir en lugar de como esperar.
Por eso dos aplicaciones que ejecutan pesos de Whisper idénticos byte a byte pueden sentirse completamente distintas. Los pesos fijan el techo de precisión. El envoltorio decide si alguna vez lo alcanzas.
¿Qué añade una aplicación basada en Whisper al modelo?
Todo lo de la sección anterior, y no es una lista corta. Weesper Neon Flow ejecuta Whisper localmente mediante whisper.cpp en macOS y Windows, con aceleración Metal en Mac: el motor es el abierto descrito más arriba, y el producto es el envoltorio que lo rodea.
En la práctica eso significa sin compilador, sin archivos de modelo que gestionar a mano, sin código de fragmentación o ensamblado que escribir: un atajo de teclado, tu voz, y texto en la aplicación en la que ya estabas, sin que el audio salga nunca de la máquina. La cobertura llega a más de 55 idiomas, y el precio es de 5 €/mes, 45 €/año o 99 € de pago único, con una prueba gratuita de 15 días.
Si quieres la calidad de reconocimiento de un modelo abierto y documentado sin pasarte un fin de semana montándolo, descarga Weesper Neon Flow y ponlo a prueba con tu propia voz, tu propio acento y tu propio vocabulario. Las preguntas de configuración se responden en el Centro de ayuda.
Lo que esta comparación realmente resuelve
El Dictado de Apple y Whisper no son dos productos que compiten por una única puntuación de precisión. Son una función cerrada y un modelo abierto, y casi cada diferencia práctica se deriva de ahí: lo que puedes medir, lo que puedes elegir, lo que puedes verificar antes de confiarle una grabación confidencial.
Si tu trabajo necesita un motor documentado, un tamaño de modelo que controlas y audio que se queda en tu máquina, la vía abierta es la que responde preguntas. Empieza la prueba gratuita de 15 días y juzga el motor con tus propias grabaciones en lugar de con la tabla de benchmarks de nadie.