Audio zu Text Konverter
Wandle Audiodateien in präzisen Text um. Unterstützt verschiedene Formate wie MP3 und WAV. Schnelle Transkription für Meetings, Notizen und mehr.
Was mit deiner Datei passiert
Deine Datei wird an unseren Server geschickt, dort transkribiert und gelöscht, sobald das Transkript fertig ist. Sie wird nicht archiviert, nicht gesichert und von keinem Menschen angehört. Wir verlangen weder ein Konto noch eine E-Mail-Adresse, also verbindet nichts eine Aufnahme mit dir. Das Transkript erscheint nur auf der Seite, die du zurückbekommst, mit dem Schließen dieser Seite ist es auch bei uns weg.
- Der Upload wird in dem Moment gelöscht, in dem das Transkript entsteht.
- Kein Konto, keine E-Mail-Adresse und keine Aufzeichnung dessen, was du transkribiert hast.
- Die Transkription läuft auf unserer eigenen Maschine, dein Ton geht also nie an einen Drittanbieter.
So wandelst du Audio in Text um
- Wähle deine Audio- oder Videodatei.
- Gib die gesprochene Sprache an, wenn du sie kennst, oder lass es auf automatisch.
- Klicke auf Transkribieren und warte. Kurze Aufnahmen kommen in Sekunden zurück, volle 15 Minuten brauchen etwa eine Minute.
- Kopiere den Text oder lade ihn als TXT, SRT oder VTT-Untertitel herunter.
Unterstützte Formate
Sowohl Audio- als auch Videodateien funktionieren. Das sind die gängigen.
| Art | Formate |
|---|---|
| Audio | MP3, WAV, M4A, AAC, OGG, OPUS, FLAC, WMA, WEBM |
| Video | MP4, MOV, WEBM, MKV, AVI, 3GP (die Tonspur wird genutzt) |
| Export | TXT reiner Text, SRT Untertitel, VTT Web-Untertitel |
Kurze Antwort
Um Audio kostenlos in Text umzuwandeln, wähle oben deine MP3-, WAV-, M4A- oder MP4-Datei, gib die gesprochene Sprache an und klicke auf Transkribieren. Bei kurzen Aufnahmen kommt das Transkript in Sekunden zurück und lässt sich als TXT, SRT oder VTT herunterladen. Ein Konto ist nicht nötig und deine Datei wird gelöscht, sobald das Transkript fertig ist.
Was ist ein Audio-zu-Text-Konverter?
Ein Audio-zu-Text-Konverter hört eine Aufnahme ab und schreibt auf, was gesagt wurde. Es ist dieselbe Arbeit, die ein menschlicher Schreibdienst leistet, nur erledigt sie ein Spracherkennungsmodell in einem Bruchteil der Zeit. Genutzt wird das für Interviews, Vorlesungen, Podcasts, Sprachnotizen, Meeting-Mitschnitte und Videountertitel.
Grenzen und Tempo
Dateien dürfen bis zu 20 MB groß und 15 Minuten lang sein. Eine Aufnahme von 15 Minuten braucht etwa eine Minute, kurze Sprachnotizen kommen in wenigen Sekunden zurück. Bei einem langen Interview funktioniert das Aufteilen an natürlichen Pausen besser, als eine einzige große Datei durchzuschieben.
Wie genau ist das?
Klare Sprache mit wenig Hintergrundgeräusch wird sehr gut erkannt. Die Genauigkeit sinkt bei Durcheinanderreden, starken Akzenten, Musik unter der Stimme und Aufnahmen in Telefonqualität. Zahlen, Eigennamen und Fachbegriffe solltest du von Hand prüfen. Nimm das Ergebnis als guten ersten Entwurf, nicht als fertiges Dokument.
So wird das Transkript besser
- Gib die gesprochene Sprache an, statt sie automatisch erkennen zu lassen.
- Nimm so nah wie möglich an der sprechenden Person auf. Der Mikrofonabstand zählt mehr als das Dateiformat.
- Wenn Musik oder Rauschen unter der Stimme liegt, säubere die Aufnahme vorher.
- Teile lange Aufnahmen an natürlichen Pausen, damit kein Satz mittendrin abbricht.
- Ein ruhiger Raum schlägt ein teures Mikrofon. Kümmere dich zuerst um den Raum.