Das Modell ist eine Datei
Beim ersten Start lädt SpeechToWork die Sprachmodelle einmalig herunter, je nach Rechner 4 bis 6 GB. Danach liegen sie auf Ihrer Festplatte.
Lokale KI heißt, dass Spracherkennung und Sprachmodell als Dateien auf Ihrem Rechner liegen und dort rechnen. Diese Seite erklärt, was dabei passiert, welche Hardware nötig ist, welche Arbeiten ein lokales Modell im Büro übernimmt und wo es an seine Grenzen kommt.

Lokale KI bedeutet: Das KI-Modell liegt auf Ihrem eigenen Rechner und rechnet dort. Es gibt keinen Dienst im Hintergrund, der Ihre Eingabe entgegennimmt. Sie sprechen oder markieren einen Text, das Modell verarbeitet ihn auf Ihrem Prozessor oder Ihrer Grafikkarte, das Ergebnis erscheint im Programm.
Technisch ist so ein Modell eine große Datei mit Zahlenwerten. Ein Programm lädt sie in den Arbeitsspeicher und rechnet damit. Nichts davon braucht eine Verbindung nach außen: Nach der Installation läuft lokale KI ohne Internet, auch im Zug oder in einem abgeschotteten Netz.
Der Unterschied zur KI aus der Cloud liegt nicht in der Bedienung, sondern im Weg der Daten. Was das rechtlich bedeutet, steht auf unserer Seite zur DSGVO-konformen KI.
Lokal betreiben lässt sich ein Modell nur, wenn seine Gewichte frei verfügbar sind. Solche quelloffenen Modelle werden als Datei veröffentlicht und laufen anschließend auf eigener Hardware. Damit sie in den Arbeitsspeicher eines Büro-PCs passen, werden sie verkleinert: Die Zahlen im Modell werden gröber gespeichert, die Datei schrumpft, für Schreibarbeit bleibt die Qualität brauchbar.
Bei SpeechToWork müssen Sie kein Modell aussuchen und nichts zusammenstecken. Die Software bringt zwei Teile mit: eine Spracherkennung, die 25 europäische Sprachen automatisch erkennt, und ein Sprachmodell, das den erkannten Text in Form bringt. Beim Start prüft sie Ihre Hardware und wählt die passende Größe selbst.
Sie brauchen keinen Server und keine Spezialhardware. SpeechToWork läuft auf einem aktuellen PC oder Notebook mit Windows 10 oder 11, empfohlen sind 16 GB Arbeitsspeicher. Installiert wird mit einem Doppelklick, Administratorrechte sind weder dafür noch für die tägliche Arbeit nötig.
Danach braucht nur noch die Lizenzprüfung eine Verbindung. SpeechToWork gibt es für Windows, eine Version für macOS ist geplant.
Ein lokales Sprachmodell ist dann stark, wenn alle nötigen Informationen schon im Text stehen. Bei Büroarbeit ist das meistens der Fall:
Welche dieser Aufgaben sich in einem Betrieb zuerst lohnen und was ein Arbeitsplatz kostet, steht auf der Seite KI für Unternehmen.
Mit eigenen Daten zu arbeiten heißt bei lokaler KI nicht, dass das Modell trainiert wird. Sie legen ihm die Daten vor, und es arbeitet damit: Sie ziehen ein PDF hinein und stellen Fragen dazu, Sie markieren eine E-Mail und lassen die Aufgaben herausziehen, Sie tragen Kundennamen und Fachbegriffe ins Wörterbuch ein, damit sie richtig geschrieben werden.
Das Modell selbst bleibt unverändert. Es wird beim Installieren als Datei geladen und danach nicht mehr geändert. Ihre Inhalte fließen in keinen Trainingslauf, denn sie verlassen Ihren Rechner nicht.
Ein Modell, das auf einem Büro-PC läuft, ist kleiner als die größten Modelle in Rechenzentren. Es hat weniger Weltwissen und eignet sich nicht für Recherche oder lange kreative Texte. Tagesaktuelles kann es nicht wissen, weil es nichts nachschlägt.
SpeechToWork setzt lokale KI deshalb dort ein, wo sie verlässlich ist: bereinigen, umformulieren, zusammenfassen, herausziehen. Zusätzlich vergleicht eine Prüfung die Ausgabe des Sprachmodells mit dem erkannten Text. Ist das Ergebnis unplausibel, fügt SpeechToWork den erkannten Rohtext ein. Ihr Diktat geht nie verloren.
Beim ersten Start lädt SpeechToWork die Sprachmodelle einmalig herunter, je nach Rechner 4 bis 6 GB. Danach liegen sie auf Ihrer Festplatte.
Mit Grafikkarte ab 6 GB steht der Text rund eine Sekunde nach dem Loslassen der Taste da, ohne Grafikkarte nach einigen Sekunden.
Gerechnet wird auf Ihrer eigenen Hardware. Es gibt keine Gebühren pro Wort, pro Minute oder pro Anfrage.
Spracherkennung und Sprachmodell sind auf Ihrem PC installiert und rechnen dort. Was Sie diktieren, steht danach in Ihrem Programm und sonst nirgends. So funktioniert der Datenweg.
Audio und Text bleiben auf Ihrem Rechner. Es gibt keinen Server, der mithört, und keinen KI-Anbieter im Hintergrund.
Kein Dritter verarbeitet Ihre Diktate. Dafür brauchen Sie keinen AV-Vertrag und keine Prüfung von Drittlandtransfers.
Nach der Installation arbeitet SpeechToWork offline. Eine Verbindung braucht nur die Lizenzprüfung.
Lokale KI ist KI, die auf Ihrem eigenen Rechner läuft. Das Modell liegt als Datei auf der Festplatte und rechnet auf Prozessor oder Grafikkarte. Es gibt keinen Server im Hintergrund, der Ihre Eingaben entgegennimmt, und nach der Installation arbeitet sie ohne Internet.
Modelle mit frei verfügbaren Gewichten, die in verkleinerter Form einige Gigabyte groß sind. Sie sind kleiner als die größten Modelle aus dem Rechenzentrum und für Schreibarbeit gut geeignet. Bei SpeechToWork wählen Sie nichts aus: Die Software prüft beim Start Grafik und Arbeitsspeicher und nimmt das passende Modell.
Bei SpeechToWork mit einem Doppelklick auf die Installationsdatei, ohne Administratorrechte. Beim ersten Start lädt das Programm die Sprachmodelle einmalig herunter, je nach Rechner 4 bis 6 GB. Danach ist die lokale KI einsatzbereit.
Ja. Nach dem einmaligen Download der Modelle funktionieren Diktieren, Formulieren, Zusammenfassen, Meeting-Protokolle und das Auslesen von Belegen ohne Internet. Eine Verbindung braucht nur die Prüfung Ihrer Lizenz.
Nein, sie macht die Sache nur schneller. Empfohlen sind 16 GB Arbeitsspeicher unter Windows 10 oder 11. Mit eigener Grafikkarte ab 6 GB steht der fertige Text rund eine Sekunde nach dem Loslassen der Taste im Programm, auf Rechnern ohne Grafikkarte nach einigen Sekunden.
Ja, indem Sie ihr die Daten vorlegen: ein PDF hineinziehen und Fragen dazu stellen, Text markieren und bearbeiten lassen, Namen und Fachbegriffe ins Wörterbuch eintragen. Trainiert wird das Modell dabei nicht, es bleibt unverändert, und Ihre Inhalte verlassen den Rechner nicht.
Die Modelle, die sich lokal betreiben lassen, stammen aus quelloffenen Veröffentlichungen: Ihre Gewichte sind frei verfügbar und dürfen auf eigener Hardware laufen. Die Anwendung SpeechToWork selbst ist ein kommerzielles Programm mit Lizenz, das Ihnen diese Modelle einsatzfertig auf den Arbeitsplatz bringt.
Text diktieren in Outlook, Word, Teams und jeder anderen Anwendung.
AnsehenMeetings aufnehmen und ein Protokoll mit Entscheidungen und Aufgaben bekommen.
AnsehenSprachnachrichten, Interviews und Videos lokal transkribieren.
AnsehenSpeechToWork steht kurz vor dem Start. Sobald die erste Fassung fertig ist, laden Sie sie hier herunter: ein Klick, eine Datei, kein Formular.
Coming soonFür Windows 10/11 (64-bit). Der Download wird hier freigeschaltet, sobald es so weit ist.
Eine Installationsdatei für Windows, direkt von unserem Server.
Doppelklick genügt. Sie brauchen dafür keine Administratorrechte.
Beim ersten Start: Name und geschäftliche E-Mail eintragen, kein Zahlungsmittel.
Beim ersten Start lädt SpeechToWork einmalig die Sprachmodelle (4 bis 6 GB). Schon einen Lizenzschlüssel? Beim ersten Start eingeben. Was dabei übertragen wird, steht in der Datenschutzerklärung.