Ziehen, ablegen, fertig
Kein Konto, kein Upload-Balken, keine Warteschlange. Die Datei wird dort verarbeitet, wo sie liegt.
Ziehen Sie eine Audio- oder Videodatei in SpeechToWork und erhalten Sie den Text mit Zeitmarken. Die Transkription läuft auf Ihrem PC. Das ist schneller als ein Upload und die einzige Variante, bei der vertrauliche Aufnahmen vertraulich bleiben.

Wer eine Aufnahme schnell als Text braucht, landet bei Online-Diensten. Sie funktionieren, aber Sie laden dafür die komplette Datei auf einen fremden Server. Bei einem Interview, einem Mitarbeitergespräch oder einer Sprachnachricht vom Kunden geben Sie damit Inhalte heraus, über die Sie gar nicht allein verfügen dürfen.
SpeechToWork wandelt Audio in Text um, ohne dass die Datei Ihren Rechner verlässt. Es gibt keine Minutenpakete und keine Obergrenze.
Alle gängigen Formate: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC und WMA. Bei Videodateien wie MP4, MKV, MOV, WEBM oder AVI wird die Tonspur verwendet. Sie ziehen die Datei ins Fenster oder wählen sie aus.
In unserem Test war eine Aufnahme von 32 Sekunden nach 1,4 Sekunden umgewandelt, und das nur auf dem Prozessor. Eine Stunde Audio dauert damit wenige Minuten. Während die Umwandlung läuft, können Sie weiter diktieren.
Kein Konto, kein Upload-Balken, keine Warteschlange. Die Datei wird dort verarbeitet, wo sie liegt.
Transkriptionsdienste rechnen pro Audiominute ab. Hier ist die Umwandlung im festen Preis enthalten.
Text markieren und per Sprache sagen: „Fass das zusammen“ oder „Welche Aufgaben stehen drin?“
Spracherkennung und Sprachmodell sind auf Ihrem PC installiert und rechnen dort. Was Sie diktieren, steht danach in Ihrem Programm und sonst nirgends. So funktioniert der Datenweg.
Audio und Text bleiben auf Ihrem Rechner. Es gibt keinen Server, der mithört, und keinen KI-Anbieter im Hintergrund.
Kein Dritter verarbeitet Ihre Diktate. Dafür brauchen Sie keinen AV-Vertrag und keine Prüfung von Drittlandtransfers.
Nach der Installation arbeitet SpeechToWork offline. Eine Verbindung braucht nur die Lizenzprüfung.
Ja. Speichern Sie die Sprachnachricht aus WhatsApp Web oder der Desktop-App als Datei und ziehen Sie sie in SpeechToWork. Das Format OPUS oder OGG wird direkt verarbeitet. Die Nachricht verlässt dabei Ihren Rechner nicht.
Ja. Sie erhalten den Text mit Zeitmarken je Absatz. Für Gespräche mit mehreren Beteiligten, bei denen Sie die Sprecher getrennt brauchen, eignet sich die Meeting-Funktion besser, weil sie Stimmen unterscheidet.
Bei klarer Aufnahme und Hochdeutsch ist der Text weitgehend fehlerfrei, inklusive Satzzeichen, Großschreibung und Zahlen. Schwierig sind starke Dialekte, schlechte Mikrofone und Eigennamen. Namen und Fachbegriffe können Sie ins Wörterbuch eintragen.
Nein. Lange Aufnahmen werden in Abschnitten verarbeitet, die an Sprechpausen geteilt werden. Begrenzend ist nur der Arbeitsspeicher Ihres Rechners, für mehrere Stunden Audio reichen 16 GB.
Sie bekommen den Download und einen Testzugang per E-Mail. Die Installation dauert wenige Minuten, danach arbeitet alles auf Ihrem Rechner.