Réponse directe — Comment transcrire un podcast sur Mac et le transformer en show notes ? Dépose le fichier de l’épisode terminé dans une app de transcription embarquée, laisse ton Mac produire une transcription horodatée, corrige les noms et le jargon directement dans le texte, puis exporte le format dont chaque destination a besoin : Markdown pour les show notes, SRT ou VTT pour les sous-titres et les envois vers les plateformes, texte brut pour la recherche. Tout s’exécute en local, donc un épisode non publié le reste.
Chaque épisode terminé contient déjà ses propres show notes, ses citations à mettre en avant et son index de recherche, enfermés dans un fichier audio. Un logiciel de transcription de podcast sur Mac les libère.
La question en 2026 n’est pas de savoir si une machine peut transcrire ton épisode — c’est réglé depuis des années — mais si la transcription revient sous forme d’un fichier que tu possèdes, dans les formats que ta chaîne de publication consomme, et si tu peux transcrire un podcast hors ligne plutôt que de déposer un épisode non publié sur le serveur de quelqu’un d’autre.
Ce guide couvre les voies pour transformer l’audio d’un podcast en texte sur Mac, pourquoi ta propre transcription compte encore quand Apple et Spotify en génèrent une, le passage du fichier de l’épisode aux show notes, et ce à quoi t’attendre en matière de précision sur des interviews à plusieurs voix. Il part du principe que l’enregistrement est terminé : il s’agit de post-production, pas de dictée en direct.
Pourquoi garder ta propre transcription quand Apple et Spotify en font déjà une ?
Parce qu’une transcription de plateforme est une fonctionnalité pour l’auditeur, pas un fichier de production. Elle s’affiche dans une seule app, selon les conditions de cette plateforme, et ce n’est pas le document que tu colles dans ton CMS.
L’annonce d’Apple sur les transcriptions pour Apple Podcasts précise qu’elles « will automatically be available for new episodes shortly after episodes are published » (seront automatiquement disponibles pour les nouveaux épisodes peu après leur publication) — et laisse la porte ouverte aux producteurs : « creators who prefer to provide their own transcripts can do so through RSS tags or in Apple Podcasts Connect for subscriber episodes » (les créateurs qui préfèrent fournir leurs propres transcriptions peuvent le faire via des balises RSS ou dans Apple Podcasts Connect pour les épisodes réservés aux abonnés).
La documentation de Spotify pour les créateurs est plus explicite sur les limites. Les transcriptions « aren’t available to all creators or in the Spotify for Creators mobile app » (ne sont pas disponibles pour tous les créateurs ni dans l’app mobile Spotify for Creators). Une transcription importée « needs to be a VTT or SRT file » (doit être un fichier VTT ou SRT), avec une taille maximale de 5 Mo. Et surtout : « you can’t edit transcripts directly in Spotify for Creators » (tu ne peux pas modifier les transcriptions directement dans Spotify for Creators) — le workflow documenté consiste à télécharger le fichier VTT, « make edits to the file on your device » (à modifier le fichier sur ton appareil), puis à le réimporter.
Mis bout à bout, la conclusion est la même : les plateformes attendent une transcription corrigée, produite ailleurs. La transcription locale se place en amont de leur pipeline plutôt que de le dupliquer.
Quatre raisons de conserver toi-même le fichier maître :
- Les show notes vivent sur ton site. Une transcription de plateforme ne sert à rien pour une page que tu contrôles.
- Un épisode, de nombreux artefacts. Citations pour les réseaux sociaux, extrait pour la newsletter, descriptions de chapitres et sélection de clips proviennent tous du même texte.
- La balise RSS, c’est à toi de la remplir. Le podcast namespace définit une balise transcript qui « is used to link to a transcript or closed captions file » (sert à lier un fichier de transcription ou de sous-titres codés), avec des attributs
urlettype, et précise que « multiple tags can be present for multiple transcript formats » (plusieurs balises peuvent être présentes pour plusieurs formats de transcription). - Confidentialité avant publication. Les invités sous embargo et les lectures de sponsors pas encore validées n’ont rien à faire dans un compte tiers.
Quelles sont les voies pour passer de l’audio d’un podcast au texte sur Mac ?
Quatre, et elles diffèrent moins par la qualité de la transcription que par l’endroit où va ton audio et la quantité d’outillage que tu dois maintenir.
| Voie | Où va l’audio | Ce que tu récupères | Adapté à |
|---|---|---|---|
| Service de transcription cloud | Envoyé au fournisseur | Éditeur web, exports variables selon le forfait | Équipes déjà installées dans cet outil |
| Transcription automatique de plateforme | Déjà sur la plateforme | Affichage dans l’app ; Spotify permet un téléchargement VTT | Les auditeurs, pas les producteurs |
| Moteur en ligne de commande (Whisper, whisper.cpp) | Reste sur ton Mac | Texte que tu mets en forme toi-même par script | Celles et ceux qui aiment maintenir un pipeline |
| App Mac embarquée | Reste sur ton Mac | Transcription modifiable plus exports | Un workflow d’épisode hebdomadaire reproductible |
La voie scriptée mérite d’être saluée : les moteurs locaux sont gratuits, excellents et sous ton contrôle. Ils font aussi de toi le mainteneur d’une étape de conversion, d’un téléchargement de modèle et d’une boucle, chaque semaine, aussi longtemps que dure l’émission.
Le Mac compte un grand nombre d’apps de transcription embarquées, parmi lesquelles MacWhisper, Aiko, Audido et Whisper Notes. Elles diffèrent moins par le moteur que par le workflow : comportement sur les fichiers longs, présence ou non d’une file d’attente, et facilité à retrouver les transcriptions du mois dernier.
Comment transformer un épisode en show notes, étape par étape ?
Six étapes, dont seulement deux concernent la transcription elle-même. Le reste consiste à décider ce dont chaque destination a besoin avant d’exporter quoi que ce soit.
Weesper Transcribe est une app du Mac App Store conçue exactement pour cette étape : des fichiers audio et vidéo déjà existants en entrée, du texte modifiable en sortie, sans rien envoyer en ligne.
- Pars du montage final, pas de la session brute, pour que les horodatages correspondent à la chronologie publiée. MP3, WAV, M4A, MP4, MOV et tout autre fichier que macOS sait lire sont acceptés.
- Dépose le fichier. La transcription s’exécute sur ton Mac, avec accélération Metal sur Apple Silicon. Aucun compte, aucun envoi en ligne, aucun aller-retour.
- Définis la langue source. La transcription couvre environ 57 langues avec détection automatique ; fixer la langue explicitement vaut mieux que de laisser la détection deviner sur une intro bilingue.
- Corrige les noms directement dans le texte. Les noms d’invités, les sponsors, les noms de produits et les private jokes sont les mots qu’aucun modèle généraliste n’a jamais vus. Des horodatages cliquables et un lecteur audio intégré te permettent de sauter directement au bon moment plutôt que de chercher en avançant à l’aveugle.
- Exporte en Markdown pour les show notes. Ce que tu obtiens, c’est une transcription propre et corrigée — la matière première pour le résumé, la liste des chapitres et les citations. Ce n’est pas un résumé automatique et ça ne prétend pas l’être : le jugement sur ce qui compte reste le tien.
- Exporte en SRT ou VTT pour tout ce qui se lit. C’est ce qu’acceptent les plateformes et ce qu’attend ton logiciel de montage vidéo.
Deux limites à connaître d’abord
Le palier gratuit utilise le même moteur que la version Pro mais, selon la fiche App Store, « transcribes files up to 15 minutes, one at a time, to plain text » (transcrit des fichiers jusqu’à 15 minutes, un par un, en texte brut) — suffisant pour tester le moteur sur un fichier réel, pas assez pour un épisode complet. Un achat Pro en paiement unique « unlocks unlimited length, batch processing, subtitle and document exports (SRT/VTT/DOCX/PDF), transcript editing, full-text and semantic search, clickable timestamps, and a local automation API for scripted workflows » (débloque la durée illimitée, le traitement par lot, les exports de sous-titres et de documents (SRT/VTT/DOCX/PDF), la modification de la transcription, la recherche en texte intégral et sémantique, les horodatages cliquables, et une API d’automatisation locale pour les workflows scriptés). L’app nécessite macOS 13 ou ultérieur, sur Apple Silicon ou sur des Mac Intel avec support AVX2.
Si le modèle en paiement unique est justement la raison de ta recherche, nous avons couvert séparément pourquoi le tarif à vie se généralise dans les apps de transcription.
De quel format d’export chaque destination a-t-elle besoin ?
Une transcription, plusieurs fichiers. Chaque destination veut un format spécifique, et exporter le bon supprime une étape de conversion plus tard.
| Destination | Format | Pourquoi |
|---|---|---|
| Page de show notes sur ton site | Markdown | Les titres et les liens survivent au collage dans n’importe quel CMS |
| Import de transcription sur Spotify | VTT ou SRT | Spotify exige un « VTT or SRT file » (fichier VTT ou SRT), maximum 5 Mo |
| Balise transcript RSS | VTT, SRT, TXT, HTML ou JSON | Le namespace documente text/vtt, application/x-subrip, text/plain, text/html et application/json |
| Version vidéo de l’épisode | SRT ou VTT | Horodaté, s’intègre directement au logiciel de montage |
| Livrable pour sponsor ou client | DOCX ou PDF | Un document, pas un fichier de données |
| Ton archive ou analyse personnelle | TXT, CSV ou JSON | Lisible par machine, facile à parcourir avec grep ou à parser |
WebVTT mérite d’être défini, parce que la majeure partie de cette chaîne s’appuie dessus. La spécification W3C décrit « the Web Video Text Tracks format » (le format Web Video Text Tracks), dont « main use is for marking up external text track resources in connection with the HTML <track> element » (l’usage principal est de baliser des ressources de piste de texte externes en lien avec l’élément HTML <track>) — sous-titres, légendes, chapitres et métadonnées horodatées. SubRip (SRT) est le cousin plus ancien et plus simple, horodaté lui aussi, porté dans le podcast namespace sous le type application/x-subrip.
Weesper Transcribe exporte neuf formats : TXT, Markdown, SRT, VTT, DOCX, PDF, HTML, CSV et JSON. Choisis les formats d’export une fois par émission, pas une fois par épisode.
Pourquoi une archive consultable compte-t-elle plus qu’une seule transcription ?
Parce que la valeur d’une archive de podcast s’accumule, et qu’une archive impossible à interroger n’accumule rien. Au cinquantième épisode, la question n’est jamais « qu’est-ce qu’on a dit dans l’épisode cinquante » — c’est « dans quel épisode c’était ».
Deux types de recherche répondent à deux questions différentes :
- La recherche par mot-clé retrouve la chaîne exacte : le nom de famille d’un invité, la mention d’un sponsor, une phrase dont tu sais qu’elle a été prononcée.
- La recherche sémantique retrouve un passage quand tu te souviens de l’idée mais pas de la formulation, ce qui correspond à la façon dont on se souvient réellement d’une conversation vieille de huit mois — voir retrouver un passage en le décrivant plutôt qu’en le citant.
Un catalogue d’anciens épisodes, c’est un travail ponctuel plutôt qu’hebdomadaire. Dépose tout le dossier des épisodes passés dans une file d’attente, la même approche que mettre en file tout un dossier d’enregistrements en un seul lot, et chaque future recherche couvrira l’émission entière plutôt que les derniers mois.
À quelle précision t’attendre sur une interview de podcast ?
Plus basse que sur une lecture solo propre, et l’écart est plus large que ce que la plupart des gens imaginent. L’enregistrement détermine la transcription bien plus que l’app.
La fiche modèle NVIDIA de parakeet-tdt-0.6b-v3 rend l’ampleur de l’effet concrète. Sur des jeux d’évaluation uniquement en anglais, le même modèle rapporte :
| Jeu de test (anglais) | Taux d’erreur de mots | Ce qu’il contient |
|---|---|---|
| LibriSpeech test-clean | 1,93 % | Parole lue, audio propre |
| AMI | 11,31 % | Enregistrements de réunion multi-locuteurs |
| Earnings-22 | 11,42 % | Publications de résultats financiers |
Ce sont des chiffres uniquement en anglais, issus d’un seul modèle, mesurés sur des jeux de benchmark standards plutôt que sur ton épisode. Ils décrivent le matériau, pas l’app : un monologue solo sur un bon micro se comporte comme la première ligne, une conversation à distance à deux invités avec des interruptions croisées comme la seconde.
Trois habitudes qui font plus bouger la précision qu’un changement d’outil :
- Enregistre chaque intervenant sur une piste séparée et transcris les pistes séparément quand l’attribution des propos compte. Rien dans une transcription automatique n’identifie de façon fiable qui a parlé.
- Fixe le vocabulaire une fois par émission, pas une fois par épisode. Les mêmes noms récurrents échouent de la même façon chaque semaine.
- Prévois la passe de relecture. La transcription d’une interview est un premier jet ; la traiter comme terminée est ce qui donne aux transcriptions une réputation de manque de fiabilité.
Questions fréquentes
Quelle est la meilleure façon de transcrire un podcast sur Mac ?
Confie le fichier de l’épisode terminé à une app de transcription embarquée et garde la transcription comme fichier de travail. Cela évite un envoi en ligne, renvoie une transcription que tu peux corriger avant que quiconque la lise, et l’exporte dans les formats que ta chaîne de publication consomme. Un moteur local comme Whisper ou whisper.cpp aboutit à la même transcription, mais tu gères toi-même l’étape de conversion, le téléchargement du modèle et la boucle.
Puis-je transcrire un podcast hors ligne, sans envoyer l’audio en ligne ?
Oui, à condition que le moteur s’exécute sur ta machine plutôt que derrière une API. Un modèle local transcrit un épisode sans aucun réseau impliqué, ce qui compte le plus avant la publication : les épisodes non publiés, les invités sous embargo et les lectures de sponsors pas encore validées. Weesper Transcribe s’exécute sur ton Mac et n’envoie rien en ligne.
Ai-je encore besoin de ma propre transcription si Apple Podcasts en génère une ?
En général oui, parce qu’une transcription de plateforme est une fonctionnalité pour l’auditeur, pas un fichier de production. Apple précise que les créateurs « who prefer to provide their own transcripts can do so through RSS tags or in Apple Podcasts Connect for subscriber episodes » (qui préfèrent fournir leurs propres transcriptions peuvent le faire via des balises RSS ou dans Apple Podcasts Connect pour les épisodes réservés aux abonnés), et Spotify affirme carrément que « you can’t edit transcripts directly in Spotify for Creators » (tu ne peux pas modifier les transcriptions directement dans Spotify for Creators).
Dans quel format une transcription de podcast doit-elle être pour des show notes ?
Markdown pour les show notes, et un fichier de sous-titres horodaté pour tout ce qui se lit. Le podcast namespace documente une balise transcript portant des types MIME incluant text/plain, text/html, text/vtt, application/json et application/x-subrip, tandis que Spotify précise qu’une transcription importée « needs to be a VTT or SRT file » (doit être un fichier VTT ou SRT), avec une taille maximale de 5 Mo.
Quelle est la précision de la transcription automatique sur une interview de podcast à plusieurs voix ?
Nettement moins précise que sur une lecture solo propre. La fiche modèle NVIDIA de parakeet-tdt-0.6b-v3 rapporte, sur des jeux d’évaluation en anglais, un taux d’erreur de mots de 1,93 % sur LibriSpeech test-clean — de la parole lue en conditions propres — contre 11,31 % sur AMI, des enregistrements de réunion multi-locuteurs. Cet écart est dû à l’enregistrement, pas au logiciel.
Comment rendre consultable tout un catalogue d’anciens épisodes ?
Transcris le catalogue une seule fois en lot, puis cherche dans les transcriptions plutôt que dans l’audio. Mettre en file un dossier transforme une centaine de travaux séparés en un seul run sans surveillance, et le résultat est une archive texte que tu peux interroger par mot-clé ou par sens.
Conclusion
La transcription de podcast a cessé d’être un problème de transcription il y a un moment déjà. C’est un problème de workflow : où va l’audio, qui possède le fichier corrigé, et quels formats sortent à l’autre bout.
Les plateformes génèrent quelque chose d’utile pour les auditeurs, mais cela ne remplace pas une transcription maîtresse que tu peux corriger, réutiliser et publier sur tes propres pages — ce qu’Apple et Spotify supposent précisément que tu leur apporteras. Garde la transcription en local, corrige-la une fois, exporte-la dans les formats attendus par chaque destination, et laisse l’archive s’accumuler.
Un épisode qui attend d’être transcrit ? Lis la liste complète des fonctionnalités et les limites du palier gratuit, ou récupère l’app sur le Mac App Store — gratuite au téléchargement, avec une mise à niveau Pro en paiement unique et sans abonnement. Les questions d’installation trouvent leur réponse dans la documentation d’assistance.