Respuesta directa — ¿Cómo se transcribe un podcast en un Mac y se convierte en notas del episodio? Suelta el archivo del episodio terminado en una app de transcripción en el dispositivo, deja que tu Mac produzca una transcripción con marcas de tiempo, corrige nombres y jerga sobre la marcha, y luego exporta el formato que necesite cada destino: Markdown para las notas del episodio, SRT o VTT para subtítulos y subidas a plataformas, texto plano para la búsqueda. Todo se ejecuta en local, así que un episodio no publicado sigue sin publicarse.
Todo episodio terminado ya contiene sus propias notas del episodio, citas destacadas e índice de búsqueda, encerrados dentro de un archivo de audio. El software de transcripción de podcasts en un Mac los desbloquea.
La pregunta en 2026 no es si una máquina puede transcribir tu episodio —eso quedó resuelto hace años—, sino si la transcripción vuelve como un archivo que te pertenece, en los formatos que consume tu cadena de publicación, y si puedes transcribir un podcast sin conexión en lugar de subir un episodio inédito al servidor de otro.
Esta guía cubre las vías para convertir el audio de un podcast en texto en un Mac, por qué sigue importando tu propia transcripción aunque Apple y Spotify generen una, el proceso desde el archivo del episodio hasta las notas del episodio, y qué esperar de la precisión en entrevistas con varios hablantes. Da por hecho que la grabación ya está terminada: esto es posproducción, no dictado en directo.
¿Por qué conservar tu propia transcripción cuando Apple y Spotify ya hacen una?
Porque una transcripción de plataforma es una función para el oyente, no un archivo de producción. Se muestra dentro de una sola app, en los términos de esa plataforma, y no es el documento que pegas en tu CMS.
El anuncio de Apple sobre las transcripciones para Apple Podcasts afirma que «estarán disponibles automáticamente para los episodios nuevos poco después de su publicación» —y deja la puerta abierta a los productores: «los creadores que prefieran aportar sus propias transcripciones pueden hacerlo mediante etiquetas RSS o en Apple Podcasts Connect para episodios de suscriptores».
La documentación para creadores de Spotify es más explícita sobre los límites. Las transcripciones «no están disponibles para todos los creadores ni en la app móvil de Spotify for Creators». Una transcripción subida «tiene que ser un archivo VTT o SRT», con un tamaño máximo de 5 MB. Y, de forma crucial: «no puedes editar las transcripciones directamente en Spotify for Creators» —el flujo de trabajo documentado consiste en descargar el archivo VTT, «hacer los cambios en el archivo en tu dispositivo» y luego volver a subirlo.
Leído en conjunto, la conclusión es la misma: las plataformas esperan una transcripción corregida y producida en otro sitio. La transcripción local se sitúa antes de su pipeline, en vez de duplicarlo.
Cuatro razones para conservar tú mismo el archivo maestro:
- Las notas del episodio viven en tu sitio. Una transcripción de plataforma no hace nada por una página que tú controlas.
- Un episodio, muchos materiales derivados. Las citas para redes sociales, un extracto para la newsletter, las descripciones de capítulos y la selección de clips salen todos del mismo texto.
- La etiqueta RSS es tuya para rellenar. El espacio de nombres de podcast define una etiqueta de transcripción que «se usa para enlazar a un archivo de transcripción o de subtítulos», con atributos
urlytype, y señala que «pueden estar presentes varias etiquetas para varios formatos de transcripción». - Privacidad antes de la publicación. Los invitados bajo embargo y las menciones de patrocinadores sin aprobar no tienen sitio en la cuenta de un tercero.
¿Qué vías existen para pasar del audio de un podcast a texto en un Mac?
Cuatro, y se diferencian menos en la calidad de la transcripción que en a dónde va tu audio y cuánta herramienta tienes que mantener.
| Vía | A dónde va el audio | Qué obtienes | Mejor para |
|---|---|---|---|
| Servicio de transcripción en la nube | Se sube al proveedor | Editor web, las exportaciones varían según el plan | Equipos que ya trabajan dentro de esa herramienta |
| Transcripción automática de la plataforma | Ya está en la plataforma | Se muestra dentro de la app; Spotify permite descargar un VTT | Oyentes, no productores |
| Motor de línea de comandos (Whisper, whisper.cpp) | Se queda en tu Mac | Texto que tú mismo das forma con scripts | Gente a la que le gusta mantener un pipeline |
| App de Mac en el dispositivo | Se queda en tu Mac | Transcripción editable más exportaciones | Un flujo de trabajo semanal y repetible por episodio |
La vía con scripts merece reconocimiento: los motores locales son gratuitos, excelentes y están bajo tu control. También te convierten en el mantenedor de un paso de conversión, de una descarga de modelo y de un bucle, cada semana, mientras dure el programa.
El Mac tiene un campo abarrotado de apps de transcripción en el dispositivo, entre ellas MacWhisper, Aiko, Audido y Whisper Notes. Se diferencian menos en el motor que en el flujo de trabajo: el comportamiento con archivos largos, si existe una cola, y si las transcripciones del mes pasado siguen siendo localizables.
¿Cómo conviertes un episodio en notas del episodio, paso a paso?
Seis pasos, y solo dos de ellos son la transcripción propiamente dicha. El resto consiste en decidir qué necesita cada destino antes de exportar nada.
Weesper Transcribe es una app de la Mac App Store pensada exactamente para esta etapa: entran archivos de audio y vídeo ya existentes, sale texto editable, y no se sube nada.
- Parte del corte terminado, no de la sesión en bruto, para que las marcas de tiempo coincidan con la línea temporal publicada. Se aceptan MP3, WAV, M4A, MP4, MOV y cualquier otro archivo que macOS pueda leer.
- Suelta el archivo. La transcripción se ejecuta en tu Mac, con aceleración Metal en Apple Silicon. Sin cuenta, sin subida, sin idas y vueltas.
- Fija el idioma de origen. La transcripción cubre unos 57 idiomas con detección automática; fijar el idioma de forma explícita le gana a dejar que la detección adivine en una introducción bilingüe.
- Corrige los nombres sobre la marcha. Los nombres de invitados, patrocinadores, productos y las bromas internas son las palabras que ningún modelo general ha visto antes. Las marcas de tiempo interactivas y un reproductor de audio integrado te permiten saltar directamente al momento en lugar de buscarlo a tientas.
- Exporta Markdown para las notas del episodio. Lo que obtienes es una transcripción limpia y corregida —la materia prima para el resumen, la lista de capítulos y las citas. No es un resumen automático ni pretende serlo: el criterio sobre qué fue lo importante sigue siendo tuyo.
- Exporta SRT o VTT para todo lo que se reproduce. Es lo que aceptan las plataformas y lo que espera tu editor de vídeo.
Dos límites que conviene conocer antes. El nivel gratuito usa el mismo motor que Pro, pero, según la ficha de la App Store, «transcribe archivos de hasta 15 minutos, de uno en uno, a texto plano» —suficiente para probar el motor con un archivo real, no suficiente para un episodio completo. Una compra Pro de pago único «desbloquea duración ilimitada, procesamiento por lotes, exportaciones de subtítulos y documentos (SRT/VTT/DOCX/PDF), edición de transcripciones, búsqueda de texto completo y semántica, marcas de tiempo interactivas, y una API de automatización local para flujos de trabajo con scripts». La app requiere macOS 13 o posterior, en Apple Silicon o en Mac con Intel con soporte AVX2.
Si el propio modelo de pago único es la razón por la que estás mirando esto, ya cubrimos aparte por qué el precio de por vida se está extendiendo entre las apps de transcripción.
¿Qué formato de exportación necesita cada destino?
Una transcripción, varios archivos. Cada destino quiere un formato específico, y exportar el correcto elimina un paso de conversión más adelante.
| Destino | Formato | Por qué |
|---|---|---|
| Página de notas del episodio en tu sitio | Markdown | Los encabezados y los enlaces sobreviven al pegado en cualquier CMS |
| Subida de transcripción a Spotify | VTT o SRT | Spotify exige «un archivo VTT o SRT», máximo 5 MB |
| Etiqueta de transcripción RSS | VTT, SRT, TXT, HTML o JSON | El espacio de nombres documenta text/vtt, application/x-subrip, text/plain, text/html y application/json |
| Versión en vídeo del episodio | SRT o VTT | Con código de tiempo, entra directamente en el editor |
| Entregable para patrocinador o cliente | DOCX o PDF | Un documento, no un archivo de datos |
| Tu propio archivo o análisis | TXT, CSV o JSON | Legible por máquina, fácil de grep o parsear |
Vale la pena definir WebVTT, porque la mayor parte de esta cadena termina apoyándose en él. La especificación del W3C describe «el formato Web Video Text Tracks», cuyo «uso principal es marcar recursos externos de pistas de texto en conexión con el elemento HTML <track>» —subtítulos, leyendas, capítulos y metadatos alineados con el tiempo. SubRip (SRT) es el hermano más antiguo y sencillo, con código de tiempo, que el espacio de nombres de podcast recoge como application/x-subrip.
Weesper Transcribe exporta a nueve formatos: TXT, Markdown, SRT, VTT, DOCX, PDF, HTML, CSV y JSON. Elige los formatos de exportación una vez por programa, no una vez por episodio.
¿Por qué importa más un archivo buscable que cualquier transcripción individual?
Porque el valor de un archivo de podcast se acumula, y un archivo que no se puede buscar no acumula nada. Para cuando llegas al episodio cincuenta, la pregunta nunca es «qué dijimos en el episodio cincuenta» —es «en qué episodio fue eso».
Dos tipos de búsqueda responden a dos preguntas distintas:
- La búsqueda por palabra clave encuentra la cadena exacta: el apellido de un invitado, la mención de un patrocinador, una frase que sabes que usaste.
- La búsqueda semántica encuentra un pasaje cuando recuerdas la idea pero no las palabras exactas, que es como cualquiera recuerda en realidad una conversación de hace ocho meses —consulta cómo encontrar un pasaje describiéndolo en lugar de citarlo textualmente.
Un catálogo histórico es un trabajo puntual, no semanal. Pon en cola toda la carpeta de episodios pasados, el mismo enfoque que poner en cola una carpeta de grabaciones en un solo lote, y cada búsqueda futura cubrirá el programa entero en lugar de solo los últimos meses.
¿Qué precisión deberías esperar en una entrevista de podcast?
Más baja que en una lectura en solitario y con audio limpio, y la diferencia es mayor de lo que la mayoría espera. La grabación determina la transcripción mucho más que la app.
La ficha de modelo de NVIDIA para parakeet-tdt-0.6b-v3 concreta el tamaño de este efecto. En conjuntos de evaluación solo en inglés, el mismo modelo reporta:
| Conjunto de prueba (inglés) | Tasa de error de palabras | Qué contiene |
|---|---|---|
| LibriSpeech test-clean | 1,93 % | Habla leída, audio limpio |
| AMI | 11,31 % | Grabaciones de reuniones con varios hablantes |
| Earnings-22 | 11,42 % | Llamadas de resultados financieros |
Son cifras solo en inglés, de un único modelo, medidas en conjuntos de referencia estándar y no en tu propio episodio. Describen el material, no la app: un monólogo en solitario con un buen micrófono se comporta como la primera fila, una conversación remota con dos invitados y solapamientos de voz como la segunda.
Tres hábitos que mueven la precisión más que cambiar de herramienta:
- Graba a cada hablante en una pista separada y transcribe las pistas por separado cuando la atribución importe. Nada en una transcripción automática etiqueta de forma fiable quién habló.
- Corrige el vocabulario una vez por programa, no una vez por episodio. Los mismos nombres recurrentes fallan de la misma forma cada semana.
- Reserva tiempo para la pasada de edición. La transcripción de una entrevista es un primer borrador; tratarla como terminada es lo que hace que las transcripciones parezcan poco fiables.
Preguntas frecuentes
¿Cuál es la mejor forma de transcribir un podcast en un Mac?
Entrega el archivo del episodio terminado a una app de transcripción en el dispositivo y conserva la transcripción como archivo de trabajo. Eso evita una subida, devuelve una transcripción que puedes editar antes de que nadie la lea, y exporta a los formatos que consume tu cadena de publicación. Un motor local como Whisper o whisper.cpp llega a la misma transcripción, pero tú te encargas del paso de conversión, de la descarga del modelo y del bucle.
¿Puedo transcribir un podcast sin conexión, sin subir el audio?
Sí, siempre que el motor se ejecute en tu equipo y no detrás de una API. Un modelo local transcribe un episodio sin que intervenga la red, algo que importa sobre todo antes de la publicación: episodios aún no publicados, invitados bajo embargo y menciones de patrocinadores sin aprobar. Weesper Transcribe se ejecuta en tu Mac y no sube nada.
¿Sigo necesitando mi propia transcripción si Apple Podcasts genera una?
Casi siempre sí, porque una transcripción de plataforma es una función para el oyente, no un archivo de producción. Apple indica que los creadores «que prefieran aportar sus propias transcripciones pueden hacerlo mediante etiquetas RSS o en Apple Podcasts Connect para episodios de suscriptores», y Spotify dice directamente que «no puedes editar las transcripciones directamente en Spotify for Creators».
¿En qué formato debe estar una transcripción de podcast para las notas del episodio?
Markdown para las notas del episodio, y un archivo de subtítulos con código de tiempo para todo lo que se reproduce. El espacio de nombres de podcast documenta una etiqueta de transcripción que admite tipos MIME como text/plain, text/html, text/vtt, application/json y application/x-subrip, mientras que Spotify especifica que una transcripción subida «tiene que ser un archivo VTT o SRT» con un tamaño máximo de 5 MB.
¿Cuánta precisión tiene la transcripción automática en una entrevista de podcast con varios hablantes?
Notablemente menos precisa que en una lectura en solitario y con audio limpio. La ficha de modelo de NVIDIA para parakeet-tdt-0.6b-v3 reporta, en conjuntos de evaluación en inglés, una tasa de error de palabras del 1,93 % en LibriSpeech test-clean —habla leída en condiciones limpias— frente al 11,31 % en AMI, que son grabaciones de reuniones con varios hablantes. Esa variación la impulsa la grabación, no el software.
¿Cómo hago que un catálogo histórico de episodios sea buscable?
Transcribe el catálogo una sola vez, por lotes, y luego busca en las transcripciones en lugar de en el audio. Poner en cola una carpeta convierte cien trabajos separados en una sola ejecución sin supervisión, y el resultado es un archivo de texto que puedes consultar por palabra clave o por significado.
Conclusión
La transcripción de podcasts dejó de ser un problema de transcripción hace tiempo. Es un problema de flujo de trabajo: a dónde va el audio, quién es dueño del archivo corregido, y qué formatos salen al otro lado.
Las plataformas generan algo útil para los oyentes, pero eso no sustituye a una transcripción maestra que puedas editar, reaprovechar y publicar en tus propias páginas —que es exactamente lo que Apple y Spotify dan por hecho que tú les vas a aportar. Mantén la transcripción en local, corrígela una vez, exporta a los formatos que espera cada destino, y deja que el archivo se acumule.
¿Tienes un episodio esperando a ser transcrito? Consulta la lista completa de funciones y los límites del nivel gratuito, o consigue la app en la Mac App Store —gratis para descargar, con una actualización Pro de pago único y sin suscripción. Las dudas de configuración se responden en la documentación de soporte.