Direkte Antwort – Wie transkribieren Sie einen Podcast auf einem Mac und verwandeln ihn in Shownotes? Legen Sie die fertige Episodendatei in eine On-Device-Transkriptions-App, lassen Sie Ihren Mac ein zeitcodiertes Transkript erstellen, korrigieren Sie Namen und Fachbegriffe direkt im Text und exportieren Sie dann das Format, das jedes Ziel braucht: Markdown für Shownotes, SRT oder VTT für Untertitel und Plattform-Uploads, reinen Text für die Suche. Alles läuft lokal, sodass eine unveröffentlichte Folge unveröffentlicht bleibt.

Jede fertige Folge enthält bereits ihre eigenen Shownotes, Zitate und ihren Suchindex, eingeschlossen in einer Audiodatei. Podcast-Transkriptionssoftware auf einem Mac schließt sie auf.

Die Frage im Jahr 2026 ist nicht mehr, ob eine Maschine Ihre Folge transkribieren kann – das wurde vor Jahren geklärt –, sondern ob das Transkript als Datei zurückkommt, die Ihnen gehört, in den Formaten, die Ihre Publishing-Kette benötigt, und ob Sie einen Podcast offline transkribieren können, statt eine unveröffentlichte Folge auf den Server eines Dritten zu laden.

Dieser Leitfaden behandelt die Wege, um Podcast-Audio auf einem Mac in Text zu verwandeln, warum ein eigenes Transkript auch dann noch zählt, wenn Apple und Spotify eines erstellen, den Weg von der Episodendatei zu den Shownotes sowie die zu erwartende Genauigkeit bei Interviews mit mehreren Sprechern. Er setzt voraus, dass die Aufnahme fertig ist: Es geht um Postproduktion, nicht um Live-Diktat.

Warum ein eigenes Transkript behalten, wenn Apple und Spotify bereits eines erstellen?

Weil ein Plattform-Transkript eine Funktion für Hörer ist, keine Produktionsdatei. Es wird innerhalb einer App angezeigt, zu den Bedingungen dieser Plattform, und es ist nicht das Dokument, das Sie in Ihr CMS einfügen.

Apples Ankündigung von Transkripten für Apple Podcasts erklärt, dass sie „für neue Folgen kurz nach der Veröffentlichung automatisch verfügbar sein werden“ – und lässt die Tür für Produzenten offen: „Creator, die lieber eigene Transkripte bereitstellen möchten, können dies über RSS-Tags oder in Apple Podcasts Connect für Abonnenten-Folgen tun“.

Spotifys Dokumentation für Creator ist bei den Grenzen deutlicher. Transkripte „sind nicht für alle Creator oder in der mobilen App von Spotify for Creators verfügbar“. Ein hochgeladenes Transkript „muss eine VTT- oder SRT-Datei sein“, mit einer maximalen Größe von 5 MB. Und entscheidend: „Sie können Transkripte nicht direkt in Spotify for Creators bearbeiten“ – der dokumentierte Workflow besteht darin, die VTT-Datei herunterzuladen, „Änderungen an der Datei auf Ihrem Gerät vorzunehmen“ und sie dann erneut hochzuladen.

Zusammen gelesen ergibt sich dieselbe Schlussfolgerung: Die Plattformen erwarten ein korrigiertes Transkript, das anderswo entstanden ist. Lokale Transkription steht vor ihrer Pipeline, statt sie zu duplizieren.

Vier Gründe, die Master-Datei selbst zu behalten:

Welche Wege führen von Podcast-Audio zu Text auf einem Mac?

Vier, und sie unterscheiden sich weniger in der Qualität des Transkripts als darin, wohin Ihr Audio geht und wie viel Tooling Sie selbst pflegen.

WegWohin das Audio gehtWas Sie zurückbekommenAm besten für
Cloud-TranskriptionsdienstHochgeladen zum AnbieterWeb-Editor, Exporte je nach Tarif unterschiedlichTeams, die bereits mit diesem Tool arbeiten
Automatisches Plattform-TranskriptBereits auf der PlattformAnzeige in der App; Spotify erlaubt einen VTT-DownloadHörer, keine Produzenten
Kommandozeilen-Engine (Whisper, whisper.cpp)Bleibt auf Ihrem MacText, den Sie sich selbst per Skript zurechtlegenWer eine eigene Pipeline gern pflegt
On-Device-Mac-AppBleibt auf Ihrem MacBearbeitbares Transkript plus ExporteEin wiederholbarer wöchentlicher Folgen-Workflow

Der skriptbasierte Weg verdient Anerkennung: lokale Engines sind kostenlos, hervorragend und liegen in Ihrer eigenen Kontrolle. Sie machen Sie aber auch zum Verantwortlichen für einen Konvertierungsschritt, einen Modell-Download und eine Schleife – jede Woche, solange die Show läuft.

Der Mac bietet ein dicht besetztes Feld an On-Device-Transkriptions-Apps, darunter MacWhisper, Aiko, Audido und Whisper Notes. Sie unterscheiden sich weniger in der Engine als im Workflow: im Verhalten bei langen Dateien, darin, ob eine Warteschlange existiert, und darin, ob die Transkripte vom letzten Monat noch auffindbar sind.

Wie verwandeln Sie eine Folge Schritt für Schritt in Shownotes?

Sechs Schritte, und nur zwei davon sind die eigentliche Transkription. Der Rest besteht darin, vorab zu entscheiden, was jedes Ziel braucht, bevor Sie irgendetwas exportieren.

Weesper Transcribe ist eine App aus dem Mac App Store genau für diese Phase: vorhandene Audio- und Videodateien rein, bearbeitbarer Text raus, ohne dass etwas hochgeladen wird.

  1. Starten Sie mit dem fertigen Schnitt, nicht mit der Rohaufnahme, damit die Zeitstempel zur veröffentlichten Zeitleiste passen. MP3, WAV, M4A, MP4, MOV und jede andere Datei, die macOS lesen kann, werden akzeptiert.
  2. Ziehen Sie die Datei hinein. Die Transkription läuft auf Ihrem Mac, mit Metal-Beschleunigung auf Apple Silicon. Kein Konto, kein Upload, kein Umweg.
  3. Legen Sie die Ausgangssprache fest. Die Transkription deckt rund 57 Sprachen mit automatischer Erkennung ab; die Sprache explizit festzulegen schlägt es, die automatische Erkennung bei einem zweisprachigen Intro raten zu lassen.
  4. Korrigieren Sie Namen direkt im Text. Gästenamen, Sponsoren, Produktnamen und Insider-Witze sind genau die Wörter, die kein allgemeines Modell je gesehen hat. Klickbare Zeitstempel und ein eingebauter Audio-Player lassen Sie direkt zum Moment springen, statt danach zu suchen.
  5. Exportieren Sie Markdown für die Shownotes. Was Sie erhalten, ist ein sauberes, korrigiertes Transkript – das Rohmaterial für die Zusammenfassung, die Kapitelliste und die Zitate. Es ist keine automatische Zusammenfassung und gibt sich auch nicht als eine aus: Die Einschätzung, was wichtig war, bleibt bei Ihnen.
  6. Exportieren Sie SRT oder VTT für alles, was abgespielt wird. Das akzeptieren die Plattformen, und das erwartet Ihr Videoeditor.

Zwei Grenzen sollten Sie vorab kennen. Die kostenlose Stufe nutzt dieselbe Engine wie Pro, transkribiert aber laut App-Store-Eintrag „Dateien bis zu 15 Minuten, eine nach der anderen, als reinen Text“ – genug, um die Engine an einer echten Datei zu testen, nicht genug für eine vollständige Folge. Ein einmaliger Pro-Kauf „schaltet unbegrenzte Länge, Batch-Verarbeitung, Untertitel- und Dokumentexporte (SRT/VTT/DOCX/PDF), Transkript-Bearbeitung, Volltext- und semantische Suche, klickbare Zeitstempel sowie eine lokale Automatisierungs-API für skriptbasierte Workflows frei“. Die App benötigt macOS 13 oder neuer, auf Apple Silicon oder auf Intel-Macs mit AVX2-Unterstützung.

Wenn das Einmalkauf-Modell selbst der Grund ist, warum Sie suchen: Wir haben warum sich Lifetime-Preise bei Transkriptions-Apps durchsetzen separat behandelt.

Welches Exportformat braucht welches Ziel?

Ein Transkript, mehrere Dateien. Jedes Ziel will ein bestimmtes Format, und das richtige zu exportieren erspart später einen Konvertierungsschritt.

ZielFormatWarum
Shownotes-Seite auf Ihrer WebsiteMarkdownÜberschriften und Links überstehen das Einfügen in jedes CMS
Spotify-Transkript-UploadVTT oder SRTSpotify verlangt eine „VTT- oder SRT-Datei“, max. 5 MB
RSS-Transcript-TagVTT, SRT, TXT, HTML oder JSONDer Namespace dokumentiert text/vtt, application/x-subrip, text/plain, text/html und application/json
Videofassung der FolgeSRT oder VTTZeitcodiert, passt direkt in den Editor
Sponsoren- oder Kunden-DeliverableDOCX oder PDFEin Dokument, keine Datendatei
Eigenes Archiv oder AnalyseTXT, CSV oder JSONMaschinenlesbar, leicht per grep zu durchsuchen oder zu parsen

WebVTT verdient eine Definition, weil der Großteil dieser Kette darauf landet. Die W3C-Spezifikation beschreibt „das Web Video Text Tracks-Format“, dessen „Haupteinsatzzweck die Auszeichnung externer Text-Track-Ressourcen in Verbindung mit dem HTML-Element <track>“ ist – Untertitel, Bildunterschriften, Kapitel und zeitlich ausgerichtete Metadaten. SubRip (SRT) ist das ältere, einfachere zeitcodierte Geschwister-Format, im Podcast-Namespace als application/x-subrip geführt.

Weesper Transcribe exportiert in neun Formate: TXT, Markdown, SRT, VTT, DOCX, PDF, HTML, CSV und JSON. Legen Sie die Exportziele einmal pro Show fest, nicht einmal pro Folge.

Warum zählt ein durchsuchbares Archiv mehr als ein einzelnes Transkript?

Weil der Wert eines Podcast-Archivs sich aufsummiert – und ein unsuchbares Archiv summiert sich zu nichts. Ab Folge fünfzig lautet die Frage nie „was haben wir in Folge fünfzig gesagt“, sondern „in welcher Folge war das noch mal“.

Zwei Arten von Suche beantworten zwei verschiedene Fragen:

Ein Backkatalog ist eine einmalige Aufgabe, keine wöchentliche. Legen Sie den gesamten Ordner mit vergangenen Folgen in eine Warteschlange – derselbe Ansatz wie einen Ordner mit Aufnahmen als einen Batch einreihen –, und jede künftige Suche deckt die gesamte Show ab statt nur die letzten paar Monate.

Welche Genauigkeit sollten Sie bei einem Podcast-Interview erwarten?

Geringer als bei einem sauberen Solo-Vortrag, und die Lücke ist größer, als die meisten erwarten. Die Aufnahme entscheidet weit mehr über das Transkript als die App.

Die Modellkarte von NVIDIA für parakeet-tdt-0.6b-v3 macht die Größenordnung dieses Effekts konkret. Bei rein englischsprachigen Evaluationssets meldet dasselbe Modell:

Testset (Englisch)WortfehlerrateWas es enthält
LibriSpeech test-clean1,93 %Vorgelesene Sprache, saubere Audioqualität
AMI11,31 %Meeting-Aufnahmen mit mehreren Sprechern
Earnings-2211,42 %Telefonkonferenzen zu Geschäftszahlen

Das sind rein englischsprachige Werte, von einem Modell, gemessen an Standard-Benchmark-Sets und nicht an Ihrer Folge. Sie beschreiben das Material, nicht die App: Ein Solo-Monolog an einem guten Mikrofon verhält sich wie die erste Zeile, ein Remote-Gespräch mit zwei Gästen und Überlappungen wie die zweite.

Drei Gewohnheiten, die die Genauigkeit mehr verbessern als ein Tool-Wechsel:

Häufig gestellte Fragen

Was ist der beste Weg, einen Podcast auf einem Mac zu transkribieren?

Übergeben Sie die fertige Episodendatei einer On-Device-Transkriptions-App und behandeln Sie das Transkript als Arbeitsdatei. Das vermeidet einen Upload, liefert ein Transkript, das Sie bearbeiten können, bevor es jemand liest, und exportiert in die Formate, die Ihre Publishing-Kette benötigt. Eine lokale Engine wie Whisper oder whisper.cpp erreicht dasselbe Transkript, aber Sie verantworten den Konvertierungsschritt, den Modell-Download und die Schleife.

Kann ich einen Podcast offline transkribieren, ohne das Audio hochzuladen?

Ja, sofern die Engine auf Ihrem Rechner läuft und nicht hinter einer API. Ein lokales Modell transkribiert eine Folge ganz ohne Netzwerk, was vor der Veröffentlichung am wichtigsten ist: unveröffentlichte Folgen, gesperrte Gäste und nicht freigegebene Sponsoren-Ansagen. Weesper Transcribe läuft auf Ihrem Mac und lädt nichts hoch.

Brauche ich noch ein eigenes Transkript, wenn Apple Podcasts eines erstellt?

In der Regel ja, denn ein Plattform-Transkript ist eine Funktion für Hörer, keine Produktionsdatei. Apple erklärt, dass Creator, „die lieber eigene Transkripte bereitstellen möchten, dies über RSS-Tags oder in Apple Podcasts Connect für Abonnenten-Folgen tun können“, und Spotify sagt unumwunden, dass „Sie Transkripte nicht direkt in Spotify for Creators bearbeiten können“.

In welchem Format sollte ein Podcast-Transkript für Shownotes vorliegen?

Markdown für die Shownotes und eine zeitcodierte Untertiteldatei für alles, was abgespielt wird. Der Podcast-Namespace dokumentiert einen Transcript-Tag mit MIME-Typen, darunter text/plain, text/html, text/vtt, application/json und application/x-subrip, während Spotify festlegt, dass ein hochgeladenes Transkript „eine VTT- oder SRT-Datei sein muss“, mit einer maximalen Größe von 5 MB.

Wie genau ist die automatische Transkription bei einem Podcast-Interview mit mehreren Sprechern?

Spürbar weniger genau als bei einem sauberen Solo-Vortrag. Die Modellkarte von NVIDIA für parakeet-tdt-0.6b-v3 meldet bei englischsprachigen Evaluationssets eine Wortfehlerrate von 1,93 % auf LibriSpeech test-clean – vorgelesene Sprache unter sauberen Bedingungen – gegenüber 11,31 % bei AMI, Meeting-Audio mit mehreren Sprechern. Diese Schwankung wird von der Aufnahme verursacht, nicht von der Software.

Wie mache ich einen Folgen-Backkatalog durchsuchbar?

Transkribieren Sie den Katalog einmal als Batch und durchsuchen Sie dann die Transkripte statt des Audios. Einen Ordner in eine Warteschlange zu geben macht aus hundert einzelnen Aufträgen einen unbeaufsichtigten Lauf, und das Ergebnis ist ein Textarchiv, das Sie nach Stichwort oder nach Bedeutung durchsuchen können.

Fazit

Podcast-Transkription hat vor einiger Zeit aufgehört, ein Transkriptionsproblem zu sein. Es ist ein Workflow-Problem: wohin das Audio geht, wem die korrigierte Datei gehört, und welche Formate am Ende herauskommen.

Die Plattformen erstellen etwas Nützliches für Hörer, aber das ersetzt kein Master-Transkript, das Sie bearbeiten, weiterverwenden und auf Ihren eigenen Seiten veröffentlichen können – genau das setzen Apple und Spotify voraus, dass Sie mitbringen. Behalten Sie die Transkription lokal, korrigieren Sie sie einmal, exportieren Sie in die Formate, die jedes Ziel erwartet, und lassen Sie das Archiv wachsen.

Wartet eine Folge darauf, transkribiert zu werden? Lesen Sie die vollständige Feature-Liste und die Grenzen der kostenlosen Stufe, oder laden Sie die App aus dem Mac App Store – kostenlos herunterladbar, mit einem einmaligen Pro-Upgrade und ohne Abo. Fragen zur Einrichtung beantwortet die Support-Dokumentation.