← Alle WerkzeugeLäuft vollständig im Browser · nichts wird hochgeladen

Transkription Audio → Text

Interviews, Diktate, Podcasts, Sitzungsmitschnitte: Aufnahme hineinziehen, Text mit Zeitmarken herausbekommen — korrigieren, dann als Text, Untertitel oder Word-Datei speichern. Die Aufnahme verlässt dein Gerät nicht.

Hier arbeitet KI — und zwar auf deinem GerätDie Spracherkennung erledigt das neuronale Netz Whisper (OpenAI, MIT-Lizenz). Das Modell wird einmalig von dieser Website geladen und rechnet danach vollständig in deinem Browser: Es wird kein KI-Dienst angefragt, deine Aufnahme wird nicht übertragen und fließt in kein Training ein. Nachlesen im Datenschutz

Aufnahme

Audio- oder Videodatei hierher ziehen MP3, WAV, M4A, OGG, FLAC, MP4, WebM u. a. — oder klicken zum Auswählen
Noch keine Aufnahme geladen.

Gut zu wissen

Ein Interview für den Artikel, das Diktat für die Akte, der Mitschnitt der Vorstandssitzung, der Podcast fürs Archiv: Abtippen dauert ein Vielfaches der Aufnahme. Dafür zahlen viele ein Abo bei einem Transkriptionsdienst — und laden dabei Aufnahmen hoch, die Namen, Diagnosen oder Vereinsinterna enthalten. Hier läuft die Spracherkennung Whisper direkt in deinem Browser: Aufnahme rein, Text mit Zeitmarken raus, im Editor korrigieren, als Text, Untertitel oder Word-Datei speichern. Kein Konto, kein Upload, keine Aufnahmestunden-Abrechnung.

Wird meine Aufnahme hochgeladen?

Nein — und hier ist das kein Detail, sondern der Punkt. Beim ersten Start wird das Erkennungsmodell einmalig von dieser Website geladen (40 bis 250 MB, je nach Wahl) und danach im Browser behalten. Die Aufnahme selbst wird nie übertragen; es gibt keinen Server, der sie annehmen könnte, und sie fließt in kein Training ein. Für Journalisten, Therapeuten, Anwälte oder Vereine, die vertrauliche Gespräche verschriftlichen müssen, ist das der ganze Sinn dieses Werkzeugs.

Wie gut ist die Erkennung?

Bei klarer Aufnahme, wenig Nebengeräuschen und einem Sprecher sehr brauchbar. Das große Modell erkennt Fachwörter, Namen und Satzzeichen deutlich besser als das kleine — es braucht aber mehr Speicher und Zeit. Dialekt, Hall, Durcheinanderreden und leise Sprecher senken die Qualität. Deshalb landet der Text nicht als Block, sondern in Abschnitten mit Zeitmarken: Ein Klick auf die Zeit spielt die Stelle ab, der Text daneben lässt sich direkt korrigieren.

Wie lange dauert es?

Das hängt vom Gerät ab. Mit Grafikbeschleunigung (WebGPU — Chrome und Edge auf aktuellen Rechnern) läuft die Erkennung um ein Vielfaches schneller als die Aufnahme lang ist. Nur mit dem Prozessor dauert es etwa so lange wie die Aufnahme, beim großen Modell länger; auf Handys entsprechend mehr. Die Anzeige nennt den gewählten Rechenweg und schätzt nach dem ersten Abschnitt die Restzeit. Für lange Aufnahmen: Rechner am Strom lassen und den Tab offen halten.

Welche Formate kann ich speichern?

Reinen Text, Text mit Zeitmarken (für Protokolle), Untertitel als SRT oder VTT (für Videos, weiter bearbeitbar im Untertitel-Werkzeug) und ein Word-Dokument mit Titel und Abschnitten. Der Text aus der Zwischenablage passt in jede Textverarbeitung.

Was ist Whisper?

Ein von OpenAI veröffentlichtes, frei nutzbares Spracherkennungsmodell (MIT-Lizenz), das mit hunderttausenden Stunden Sprache trainiert wurde und rund hundert Sprachen versteht. Hier laufen die Größen „tiny“, „base“ und „small“ als ONNX-Modelle über transformers.js und die ONNX-Laufzeitumgebung — beides quelloffen, beides auf deinem Gerät.