Audio-Transkription
Macht aus einer Audioaufnahme Text mit Zeitstempeln.
Dieses Tool benötigt JavaScript. Aktiviere JavaScript in deinem Browser und lade die Seite neu.
MACH AUS DER AUFNAHME TEXT.
Die Audio-Transkription wandelt die Sprache einer Ton- oder Videoaufnahme in Text um. Es gibt drei Ausgaben: reiner Text fasst die Sprache an Satzenden zu Absätzen zusammen und eignet sich, um daraus direkt einen Text zu machen; Text mit Zeitstempeln setzt an den Anfang jeder Zeile die Zeit in der Form [00:01:23], praktisch für Besprechungsnotizen und Interview-Abschriften; JSON gibt Anfang und Ende jedes Wortes an, für die Nutzung in einer eigenen Anwendung oder im Schnitt. Für die Spracherkennung läuft OpenAIs offenes Whisper-Modell auf dem Server; 16 Sprachen einschließlich Türkisch sind wählbar, oder sie wird automatisch erkannt.
Die Aufnahme lädst du nur von deinem eigenen Gerät hoch; ein Link-Feld gibt es nicht. Der Ton wird aus der Datei gelöst, auf 16 kHz mono gebracht und an das Whisper-Modell auf dem Server gegeben; er geht an keinen fremden Dienst und wird nach dem Auftrag gelöscht. Abschnitte ohne Sprache (Stille über eine halbe Sekunde, Wartezeiten) werden vor der Erkennung herausgefiltert. Es gibt drei Modelle: „Schnell“ liefert einen groben Entwurf; „Ausgewogen“ reicht für die meisten Aufnahmen; „Beste“ erfasst Namen genauer, ist aber 3–4-mal langsamer und arbeitet mit Aufnahmen bis 10 Minuten. Eine Aufnahme darf höchstens 30 Minuten lang sein; eine längere Vorlesung oder Besprechung teilst du mit „Audio schneiden“ in Teile und lädst sie nacheinander hoch. Wähle die Sprache, wenn du sie kennst; ist die automatische Erkennung unsicher, sagt es der Ergebnisbildschirm.
Von Anfang bis Ende
- Lade deine Audio- oder Videodatei hoch. MP3, WAV, M4A, FLAC, MP4, MOV, MKV… Die Dauer wird gelesen.
- Sprache und Ausgabe wählen. Reiner Text, Text mit Zeitstempeln oder JSON. Modell: Ausgewogen; Beste, wenn Namen wichtig sind.
- Text herunterladen. Der Text erscheint auf dem Bildschirm und lässt sich kopieren; die Datei wird heruntergeladen. Lesen und korrigieren.
Häufige Fragen
Wozu dient Text mit Zeitstempeln?
Die Zeit am Anfang jeder Zeile zeigt, wo in der Aufnahme dieser Satz vorkommt; das dient Besprechungsnotizen, Interviewabschriften und dem Auffinden einer Stelle im Video. Die JSON-Ausgabe liefert dieselbe Information Wort für Wort.
Unterscheidet es die Sprecher?
Nein. Der Text kommt als ein durchgehender Fluss; wer spricht, wird nicht markiert. Bei einem Interview mit zwei Personen geht es am schnellsten, wenn du „Text mit Zeitstempeln“ wählst und beim Anhören der Aufnahme Namen an die Zeilenanfänge setzt.
Wie entstehen die Absätze im reinen Text?
Das Modell erkennt die Sprache abschnittsweise; die Ausgabe als reiner Text fügt die Abschnitte zusammen und beginnt nach etwa 400 Zeichen am nächsten Satzende einen neuen Absatz. Satzzeichen und Großschreibung kommen ebenfalls vom Modell und können bei schnellem oder verrauschtem Sprechen fehlen. Lies den Text vor der Veröffentlichung einmal durch und prüfe vor allem Eigennamen.
Bleibt meine Datei auf dem Server?
Nein. Deine Datei kommt nur zur Verarbeitung auf den Server und wird gelöscht, sobald der Auftrag fertig ist; auch das Ergebnis wird gelöscht, wenn du es heruntergeladen und das Werkzeug verlassen hast. Du brauchst kein Konto, keinen Namen und keine E-Mail-Adresse, und deine Dateien werden an keinen Drittanbieter gesendet. Die Nutzung ist kostenlos: Es gibt kein stündliches oder tägliches Kontingent für die Anzahl der Vorgänge, vor der Verarbeitung musst du keine Werbung ansehen, und wir fügen der Ausgabe kein Wasserzeichen hinzu.
Weitere Audio-Tools
RUPO Studio