Lokales Sprachmodell
Ein lokales Sprachmodell ist ein Sprachmodell, das auf Hardware des Betriebs ausgeführt wird, sodass Eingaben und Ausgaben die eigenen Systeme nicht verlassen und kein Anbieter an der Verarbeitung beteiligt ist.
Das lokale Sprachmodell ist das Gegenstück zum Modellzugang über die Schnittstelle eines Anbieters und die Voraussetzung dafür, dass eine KI-Automation ohne Vertrag zur Auftragsverarbeitung und ohne Drittlandtransfer auskommt.
In einfachen Worten
Ein Sprachmodell erreicht den Betrieb auf zwei Wegen: als Dienst über eine Schnittstelle, bei dem jede Eingabe an die Rechner des Anbieters geht, oder als Modelldatei, die auf einem eigenen Rechner ausgeführt wird. Der zweite Weg ist das lokale Sprachmodell. Möglich wird er durch Modelle, deren Gewichte (die gelernten Zahlenwerte, aus denen das Modell besteht) frei verfügbar sind und die sich auf einer Grafikkarte mit ausreichend Speicher betreiben lassen. Ein Verfahren namens Quantisierung verkleinert die Modelldatei, indem es die Zahlenwerte gröber speichert; das senkt den Speicherbedarf und kostet etwas Genauigkeit. Lokale Modelle sind kleiner als die Modelle der großen Anbieter, weil die Hardware eines Betriebs Grenzen setzt. Für abgegrenzte Aufgaben mit prüfbarem Ergebnis reicht das: Felder aus Belegen lesen (Dokumentenextraktion), Vorgänge einordnen, Schreiben zusammenfassen. Bei Aufgaben, die mehrere lange Unterlagen gegeneinander abwägen, fällt das Ergebnis seltener brauchbar aus. Betrieben wird das Modell innerhalb eines lokalen Harness, der Eingabe, Werkzeuge und Protokoll steuert.
Wozu brauche ich das?
Das lokale Modell ist die Anordnung für Vorgänge, deren Inhalt keinen Außenstehenden erreichen darf: Mandantenakten, Patientenunterlagen, Rezepturen, Einkaufskonditionen. Es erübrigt die Fragen nach Auftragsverarbeitung und Drittlandtransfer, weil kein Anbieter beteiligt ist. Ob es für den eigenen Vorgang reicht, klärt ein Test mit echten Fällen auf der vorgesehenen Hardware, bevor Hardware beschafft wird.
Beispiel aus der Praxis
Eine Steuerkanzlei mit zwölf Beschäftigten will eingehende Belege ihrer Mandanten vorsortieren lassen: Rechnung, Vertrag, Bescheid oder Sonstiges, dazu Mandantennummer und Datum. Weil Mandantenunterlagen die Kanzlei nicht verlassen dürfen, läuft ein lokales Modell auf einem Server im Kanzleinetz mit einer Grafikkarte der oberen Leistungsklasse. Im Test mit mehreren hundert Belegen aus dem Bestand ordnet das Modell die vier Klassen zuverlässig zu und liest Datum und Nummer aus; die Zusammenfassung langer Bescheide bleibt dagegen lückenhaft und wird aus dem Vorhaben gestrichen. Der Harness übergibt dem Modell nur die erste Seite jedes Belegs, schreibt die Zuordnung in ein Prüffeld der Kanzleisoftware und protokolliert jeden Schritt auf dem Server. Kein Zeichen verlässt das Haus, und ein Vertrag mit einem Modellanbieter entfällt.
Wirtschaftlicher Nutzen
Der wirtschaftliche Wert liegt im Wegfall offener Fragen: kein Vertrag mit einem Modellanbieter, keine Prüfung eines Drittlandtransfers, keine Abhängigkeit von Preisänderungen oder Abschaltungen eines Dienstes. Dem stehen die Anschaffung der Hardware, ihr Betrieb und die Grenze der Fähigkeiten gegenüber. Die Rechnung geht auf, wenn der Vorgang täglich anfällt und sein Inhalt so vertraulich ist, dass ein Anbieter ohnehin ausscheidet. Für Vorgänge, bei denen ein Anbieter mit Vertrag zulässig ist, bleibt der lokale Harness mit aufbereitetem Ausschnitt an ein Anbietermodell die naheliegende Alternative.
Typische Fehler
- Hardware beschaffen, bevor ein Test mit echten Vorgängen gezeigt hat, dass ein lokales Modell die Aufgabe löst.
- Ein lokales Modell für Aufgaben einsetzen, die mehrere lange Unterlagen gegeneinander abwägen, und die lückenhaften Ergebnisse als Modellfehler statt als Aufgabenzuschnitt deuten.
- Das Modell ohne Harness betreiben, sodass Eingabe, Werkzeuge und Protokoll ungeregelt bleiben, obwohl die Daten im Haus sind.
- Aktualisierungen des Modells und der Laufzeitumgebung niemandem zuordnen, sodass der Stand nach Monaten unbekannt ist.
- Die Trainingsherkunft und die Lizenz des Modells nicht prüfen, obwohl beides über die zulässige Nutzung entscheidet.
Worauf achten?
- Mit einem abgegrenzten Vorgang beginnen, dessen Ergebnis sich prüfen lässt: Zuordnung, Auslesen von Feldern, Zusammenfassung kurzer Schreiben.
- Den Test auf der Hardware fahren, die später im Betrieb steht, und mit Fällen aus dem eigenen Bestand.
- Den Speicherbedarf des Modells gegen den Grafikspeicher der Karte rechnen, bevor bestellt wird.
- Die Handlungsschleife mit Obergrenzen versehen, weil ein lokales Modell auch bei Endlosläufen Rechenzeit verbraucht.
- Den Harness so anlegen, dass die Adresse des Modells austauschbar bleibt; dann lässt sich ein Anbietermodell später am selben Ablauf vergleichen.
Häufig gestellte Fragen
Was ist ein lokales Sprachmodell?
Ein Sprachmodell, das als Modelldatei auf einem Rechner des Betriebs ausgeführt wird. Eingaben und Ausgaben bleiben auf den eigenen Systemen, ein Anbieter ist an der Verarbeitung nicht beteiligt.
Welche Hardware braucht ein lokales Sprachmodell?
Einen Rechner mit einer Grafikkarte, deren Speicher das Modell aufnimmt. Kleine Modelle für Zuordnung und Feldauslesen laufen auf einer Karte der oberen Leistungsklasse; Modelle für lange Unterlagen verlangen deutlich mehr. Ein Test mit echten Vorgängen auf der vorgesehenen Hardware klärt den Bedarf vor der Beschaffung.
Sind lokale Modelle so gut wie die Modelle der großen Anbieter?
Für abgegrenzte Aufgaben mit prüfbarem Ergebnis ja. Bei Aufgaben, die mehrere lange Unterlagen abwägen, fallen sie seltener brauchbar aus, weil sie auf der Hardware eines Betriebs kleiner sein müssen. Die Antwort für den eigenen Vorgang liefert der Test, nicht die Modellgröße.
Entfällt mit einem lokalen Modell der Vertrag zur Auftragsverarbeitung?
Ja, sofern kein Dienstleister Zugriff auf Modell oder Harness hat. Dann gibt es keinen Auftragsverarbeiter, mit dem ein Vertrag zu schließen wäre. Die Pflichten aus Artikel 32 der DSGVO zur Absicherung der Verarbeitung bleiben bestehen.