KI-Assistent auf eigenen Unternehmensdaten:
was vor dem Start geklärt sein muss
Ein Assistent, der aus den eigenen Unterlagen des Betriebs antwortet, ist schnell eingerichtet und bringt trotzdem nur dann Nutzen, wenn fünf Punkte vorher feststehen: welche Quellen er liest, wem er was zeigt, wie aktuell die Angaben sind, was bei einer falschen Auskunft geschieht und wie jede Anfrage nachvollziehbar bleibt.
Ein KI-Assistent auf eigenen Unternehmensdaten beantwortet Fragen der Belegschaft aus den Unterlagen des Betriebs: aus Handbüchern, Arbeitsanweisungen, Verträgen, Preislisten und abgelegten Vorgängen. Eine Mitarbeiterin fragt in normaler Sprache, und das System sucht die passende Stelle im Bestand und formuliert eine Antwort daraus. Die Bedienung ist einfach, und genau das verstellt den Blick auf die Vorarbeit.
Die Arbeit steckt in den Festlegungen, die vor der ersten Frage getroffen sein müssen. Sie entscheiden, welche Quellen der Assistent überhaupt lesen darf, wem er welche Angaben zeigt, wie aktuell diese Angaben sind, wie er sich bei einer Lücke im Bestand verhält und wie sich im Nachhinein prüfen lässt, was er wem geantwortet hat. Werden diese Punkte übersprungen, entsteht ein System, das flüssig formuliert und im Betrieb dennoch niemand ohne Nachprüfung benutzt.
Dieser Beitrag geht die fünf Klärungen einzeln durch und schließt mit der Reihenfolge, in der sie vor dem ersten Betrieb abzuarbeiten sind. Er behandelt den internen Assistenten für die eigene Belegschaft, nicht den öffentlichen Chatbot auf der Website; wofür ein solcher öffentlicher Chatbot spricht und was gegen ihn spricht, klärt der Beitrag zum Für und Wider eines KI-Chatbots auf der eigenen Website.
Vier Klärungen vor dem ersten Betrieb
Die Schritte, die vor der ersten Frage liegen und in dieser Reihenfolge ablaufen
Jede Klärung setzt die vorige voraus: Ohne festgelegte Quellen lassen sich weder Rechte noch Aktualität regeln
Ein KI-Assistent antwortet aus dem eigenen Bestand
Ein solcher Assistent unterscheidet sich von einem allgemeinen Sprachdienst durch die Quelle seiner Antworten. Ein allgemeines Modell antwortet aus dem, was es beim Training gesehen hat, und weiß über den einzelnen Betrieb nichts. Der interne Assistent bekommt gezielt Zugriff auf einen abgegrenzten Bestand eigener Unterlagen und stellt seine Antwort aus diesen Unterlagen zusammen. Gefragt nach der Garantiefrist eines Bauteils sucht er die Passage im hinterlegten Vertrag und gibt sie wieder, statt eine allgemeine Einschätzung abzugeben.
Technisch geschieht das über ein Verfahren, das die Frage zuerst mit dem Bestand abgleicht und die dazu passenden Textstellen heraussucht. Erst diese Stellen bekommt das Sprachmodell zu sehen, und aus ihnen formuliert es die Antwort. Der Bestand ist damit die Grenze des Wissens: Was dort steht, kann der Assistent beantworten; was dort fehlt, kann er nicht ergänzen, ohne zu raten.
Von dieser Bauweise hängt der Rest des Beitrags ab. Weil der Assistent an einer Stelle zusammenführt, was sonst über viele Ordner, Laufwerke und Programme verteilt liegt, entsteht ein neuer Zugang zu diesem Wissen, und mit ihm die Fragen nach Berechtigung, Aktualität und Nachweis. Ein öffentlicher Chatbot beantwortet Fragen von Besuchern zu allgemein zugänglichen Inhalten. Der interne Assistent arbeitet mit einem geschlossenen Nutzerkreis und mit vertraulichen Unterlagen, und das verschärft jede der folgenden Klärungen.
Die Datenbasis legt fest, worüber er Auskunft gibt
Die Datenbasis ist der festgelegte Bestand an Dokumenten und Datensätzen, aus dem der Assistent seine Antworten zieht. Am Anfang steht die Auswahl der Quellen: Der Betrieb legt fest, welche Dokumente und Datensätze in den Bestand gehören. Ein Assistent, der wahllos jedes Laufwerk durchsucht, vermischt gültige Anweisungen mit veralteten Entwürfen, private Notizen mit verbindlichen Vorgaben und Doppelungen mit dem Original. Die bewusste Auswahl der Quellen ist deshalb der erste Schritt: Welche Handbücher, welche Vertragsvorlagen, welche Preisstände, welche abgelegten Vorgänge sollen für eine Auskunft herangezogen werden, und welche bleiben außen vor.
Nach der Auswahl steht die Qualität dieser Quellen zur Prüfung. Ein Assistent erbt jeden Mangel seiner Grundlage: Steht eine Angabe doppelt und in zwei Fassungen im Bestand, gibt er eine davon zurück, ohne die andere zu erwähnen. Liegt eine Preisliste nur als eingescanntes Bild ohne Textebene vor, findet er sie nicht. Diese Abhängigkeit gilt für jedes KI-Vorhaben, das auf eigene Bestände zugreift; wie ein Betrieb seine Datengrundlage prüft, bevor er ein solches Vorhaben startet, führt der Beitrag zur Datenqualität als Voraussetzung für KI aus.
Zur Auswahl gehört die Entscheidung, welche Form eine Quelle haben muss, damit der Assistent sie verlässlich liest. Ein Datenblatt als durchsuchbarer Text ist nutzbar, dasselbe Datenblatt als Foto einer Papierseite nicht. Eine Tabelle mit sauber getrennten Spalten liefert klare Werte, dieselben Angaben im Fließtext eines Notizfeldes nur unzuverlässig. Ein Teil der Vorarbeit besteht darin, die ausgewählten Quellen in eine lesbare Form zu bringen, und dieser Aufwand gehört in die Planung.
Ein erster Assistent braucht nicht das gesamte Wissen des Betriebs. Er braucht einen klar abgegrenzten Bestand für eine klar umrissene Aufgabe, etwa die Arbeitsanweisungen einer Abteilung. Der enge Ausschnitt zeigt den Nutzen und macht die Pflege überschaubar, bevor weitere Quellen hinzukommen.
Die Rechte des Fragenden begrenzen die Antwort
Ein Assistent führt viele Quellen an einer Stelle zusammen, und darin liegt ein Risiko, das ohne ihn nicht bestünde. Ein Dokument im Personalordner ist heute dadurch geschützt, dass nur die Personalabteilung den Ordner öffnen kann. Speist man dasselbe Dokument in den Bestand eines Assistenten ein, der allen offensteht, kann jede Person seinen Inhalt über eine geschickte Frage abrufen, ohne den Ordner je zu betreten. Der Schutz der einzelnen Ablage greift nicht mehr, sobald ihre Inhalte über den Assistenten erreichbar sind.
Die Regel dagegen ist einfach zu benennen und aufwendig umzusetzen: Der Assistent darf einer Person nur aus Quellen antworten, die diese Person auch direkt einsehen dürfte. Die Rechte des Assistenten folgen damit den Rechten des Fragenden. Fragt jemand aus dem Vertrieb, zieht das System nur Vertriebsquellen heran; fragt jemand aus der Geschäftsführung, steht ein weiterer Bestand offen. Das setzt voraus, dass jede Quelle einer Nutzergruppe zugeordnet ist und dass der Assistent die Gruppe des Fragenden kennt, bevor er antwortet.
Vor dem Start ist deshalb zu klären, welche Nutzergruppen es gibt und welcher Quellbestand jeder Gruppe offensteht. Für die meisten Betriebe genügen zu Beginn wenige Gruppen mit klar getrennten Beständen. Die feinere Abstufung, bei der innerhalb einer Gruppe einzelne Dokumente gesperrt sind, kommt später hinzu und will von Anfang an mitgedacht sein, weil sie über die Zuordnung jeder einzelnen Quelle entscheidet.
Wer zuerst den gesamten Bestand einliest und die Rechte danach nachrüsten will, hat die vertraulichen Inhalte bereits für alle erreichbar gemacht. Die Zuordnung jeder Quelle zu ihrer Nutzergruppe gehört vor das Einlesen, nicht danach.
Veraltete Quellen erzeugen veraltete Antworten
Ein Assistent kennt den Stand des Bestands, der zuletzt eingelesen wurde, und keinen späteren. Ändert sich eine Vorgabe im Betrieb, weiß er davon erst, wenn die geänderte Quelle neu in den Bestand aufgenommen wurde. Bis dahin gibt er die alte Auskunft, und er gibt sie mit demselben ruhigen Ton wie eine aktuelle. Die Aktualität der Quellen ist damit keine Nebensache der Pflege, sie bestimmt unmittelbar die Richtigkeit jeder Antwort.
Daraus folgen drei Regelungen, die vor dem Start festliegen sollten.
- Ein fester Abstand für das Einlesen: Die Quellen werden in einem festgelegten Takt neu eingelesen, damit Änderungen verlässlich ankommen, statt vom Zufall abzuhängen
- Eine Zuständigkeit für das Entfernen: Eine benannte Person nimmt überholte Dokumente aus dem Bestand, damit eine abgelöste Fassung nicht neben der gültigen liegen bleibt
- Ein erkennbarer Stand je Antwort: Der Assistent nennt zur Auskunft das Datum der zugrunde liegenden Quelle, damit der Nutzer das Alter der Angabe einschätzen kann
Der letzte Punkt hängt eng mit der Datenqualität zusammen. Ein Dokument, dem sein Alter nicht anzusehen ist, wird wie eine aktuelle Angabe verarbeitet, auch wenn es längst überholt ist. Ein Datum an der Quelle und ein regelmäßiges Aussortieren halten den Bestand so, dass die jüngste gültige Fassung die einzige ist, die der Assistent findet.
Eine fehlende Antwort ist besser als eine erfundene
Ein Sprachmodell bildet auch dann eine flüssige Antwort, wenn der Bestand die nötige Angabe nicht enthält. Es füllt die Lücke mit einer plausibel klingenden Formulierung, die keine Grundlage hat. Diese Eigenschaft ist der Kern des Problems bei einem Auskunftssystem: Die falsche Antwort sieht genauso überzeugend aus wie die richtige, und der Nutzer hat ohne weiteren Hinweis keine Möglichkeit, sie zu unterscheiden.
Vor dem Start sind deshalb zwei Verhaltensweisen festzulegen. Die erste betrifft die Lücke: Findet der Assistent im Bestand keine tragfähige Grundlage, weist er das aus und rät nicht. Ein „Dazu liegt mir keine Angabe vor" ist die brauchbare Antwort, wo keine Quelle greift. Die zweite betrifft den Beleg: Jede Antwort nennt das Dokument und die Stelle, aus der sie stammt. Damit wird die Auskunft prüfbar, denn der Nutzer öffnet die genannte Quelle und gleicht ab, bevor er auf der Antwort aufbaut.
Ein eigener Fall entsteht, wenn eine eingelesene Quelle selbst eine versteckte Anweisung enthält, die den Assistenten in die Irre führt. Ein präpariertes Dokument im Bestand kann so eine Antwort verfälschen, ohne dass der Nutzer die Ursache sieht. Wie diese Manipulation über eingeschleuste Anweisungen funktioniert und wie ein System sich davor schützt, behandelt der Beitrag zu versteckten Anweisungen und dem Schutz davor.
Ein Auskunftssystem ohne Belegpflicht verschiebt die Prüfung auf den Nutzer, der sie meist unterlässt. Die Fundstelle an jeder Antwort und die ausgewiesene Lücke, wo keine Quelle greift, sind die beiden Festlegungen, die eine geratene Auskunft von einer belegten trennen.
Die Protokollierung macht jede Antwort nachvollziehbar
Die Protokollierung ist die Mitschrift, welche Frage zu welcher Zeit gestellt wurde, welche Quellen der Assistent herangezogen und welche Antwort er gegeben hat. Sie erfüllt drei Zwecke im laufenden Betrieb, die jeder für sich den Aufwand rechtfertigen.
- Fehler finden: Gibt der Assistent eine falsche Auskunft, lässt sich aus dem Protokoll ablesen, aus welcher Quelle sie stammte. So wird der Fehler an der Wurzel behoben, indem die überholte oder falsche Quelle bereinigt wird, statt am Einzelfall zu raten.
- Missbrauch bemerken: Häufen sich Fragen, die auf vertrauliche Inhalte zielen, oder versucht jemand, die Rechtegrenze auszutesten, zeigt sich das im Protokoll. Ohne Mitschrift bliebe ein solches Muster unsichtbar.
- Nutzung verstehen: Das Protokoll zeigt, welche Fragen tatsächlich gestellt werden und wo der Assistent oft keine Antwort findet. Beides steuert die Pflege des Bestands, weil es die Lücken benennt, die zuerst zu schließen sind.
Die Protokollierung berührt personenbezogene Daten, weil sie festhält, wer was gefragt hat. Ihr Umfang, ihre Aufbewahrungsdauer und der Kreis der Zugriffsberechtigten gehören deshalb vor dem Start geregelt, und die Belegschaft ist über die Mitschrift zu informieren. Die Aufzeichnung dient dem sicheren Betrieb, nicht der Leistungskontrolle; diese Zweckbindung ist festzuhalten und einzuhalten.
Wo die Quellen und die Verarbeitung besonders schützenswert sind, stellt sich zusätzlich die Frage, an welchem Ort der Assistent rechnet und wohin die Anfragen fließen. Wie ein Betrieb die Steuerung einer KI-Automation auf den eigenen Systemen hält und den Ort der Verarbeitung selbst bestimmt, führt der Überblick, wie sich KI mit den eigenen Unternehmensdaten verbinden lässt, weiter aus.
Sechs Festlegungen gehören vor den ersten Betrieb
Die einzelnen Klärungen ergeben in einer festen Reihenfolge einen Ablauf. Jeder Schritt baut auf dem vorigen auf, und keiner lässt sich sinnvoll überspringen. Der folgende Durchgang bringt sie in die Ordnung, in der sie vor dem ersten Betrieb abzuarbeiten sind.
Festlegen, welche Frage der Assistent beantworten soll und welcher abgegrenzte Bestand dafür herangezogen wird
Dubletten und überholte Fassungen aussortieren und die Quellen in eine maschinell lesbare Form bringen
Jede Quelle einer Nutzergruppe zuweisen, damit der Assistent nur zeigt, was der Fragende einsehen darf
Den Takt für das Einlesen, die Belegpflicht je Antwort und die ausgewiesene Lücke ohne Quelle festlegen
Umfang und Dauer der Mitschrift regeln und eine Person benennen, die Bestand und Betrieb dauerhaft verantwortet
Den Assistenten zuerst einer einzelnen Nutzergruppe geben und die Antworten an echten Fragen prüfen
Am Ende dieses Durchgangs steht ein Assistent, der einer klar umrissenen Gruppe aus einem geprüften Bestand antwortet, jede Auskunft belegt und jede Anfrage festhält. Aus dem Pilot ergibt sich der Aufwand für die Pflege und die Erfahrung, wie sich der Bestand auf weitere Aufgaben und Gruppen ausdehnen lässt.
Die häufigsten Fehler
Sechs Muster treten wiederholt auf, wenn ein Assistent ohne die vorgelagerten Klärungen in Betrieb geht.
Der Assistent durchsucht jeden Ordner, und veraltete Entwürfe stehen neben gültigen Vorgaben
Vertrauliche Inhalte sind für alle erreichbar, bevor jemand die Zugänge je Gruppe klärt
Der Assistent formuliert Auskünfte, die niemand gegen die Quelle prüfen kann
Der Bestand altert, weil kein fester Takt für das erneute Einlesen festgelegt ist
Statt eine fehlende Angabe auszuweisen, gibt der Assistent eine geratene Antwort
Niemand pflegt den Bestand und wertet die Protokolle aus, deshalb wächst der Wildwuchs zurück
Die Punkte eins bis drei gefährden die Vertraulichkeit und die Verlässlichkeit, die Punkte vier bis sechs den dauerhaften Nutzen
Häufig gestellte Fragen
Ein KI-Assistent auf eigenen Unternehmensdaten ist ein internes System, das Fragen der Belegschaft beantwortet, indem es die Antwort aus den Unterlagen und Datenbeständen des Betriebs zusammenstellt, etwa aus Handbüchern, Verträgen, Preislisten und abgelegten Vorgängen. Er greift dafür auf einen festgelegten Bestand an Quellen zu und gibt die gefundene Auskunft in normaler Sprache zurück. Von einem öffentlichen Website-Chatbot unterscheidet er sich durch seinen geschlossenen Nutzerkreis und die vertraulichen Quellen, aus denen er arbeitet.
Nur, wenn er falsch aufgesetzt ist. Ein KI-Assistent bündelt viele Quellen an einer Stelle und kann jede Angabe daraus zurückgeben, auch an eine Person, die das zugrunde liegende Dokument sonst nicht öffnen dürfte. Die Rechte des Assistenten müssen deshalb denen der fragenden Person folgen: Er darf nur aus Quellen antworten, die diese Person auch direkt einsehen dürfte. Das setzt voraus, dass die Zugänge je Nutzergruppe vor dem Start geklärt und im System hinterlegt sind.
An der Fundstelle. Ein Assistent, der jede Auskunft mit dem Dokument und der Stelle belegt, aus der sie stammt, lässt sich prüfen: Der Nutzer öffnet die Quelle und gleicht ab. Fehlt der Beleg, bleibt die Antwort ungeprüft. Vor dem Start ist deshalb festzulegen, dass jede Antwort ihre Quelle nennt und dass das System eine fehlende Antwort ausweist, statt eine plausibel klingende Auskunft zu erfinden, für die es keine Grundlage im Bestand gibt.
So aktuell wie die Quellen, aus denen er liest. Ein Assistent kennt nur den Stand des Bestands, auf den er zugreift, und den Zeitpunkt, zu dem dieser Bestand zuletzt eingelesen wurde. Liegt eine überholte Preisliste im Quellordner, gibt er den alten Preis zurück. Vor dem Start ist deshalb zu regeln, in welchem Abstand die Quellen neu eingelesen werden, wer veraltete Dokumente entfernt und woran eine Antwort ihren Stand erkennen lässt.
Sechs Festlegungen: welche Quellen der Assistent lesen darf und in welcher Qualität sie vorliegen, welche Nutzergruppe welche Quellen sehen darf, in welchem Abstand die Quellen aktualisiert werden, wie das System mit einer fehlenden oder unsicheren Antwort umgeht, wie jede Anfrage protokolliert wird und wer den Betrieb dauerhaft verantwortet. Erst wenn diese Punkte feststehen, startet ein Pilot mit einer einzelnen Nutzergruppe auf einem abgegrenzten Quellbestand.
Die Vorarbeit entscheidet über den Nutzen
Ein KI-Assistent auf eigenen Unternehmensdaten ist schnell aufgesetzt und trägt doch erst dann, wenn die fünf Klärungen davorliegen: die Auswahl und Qualität der Quellen, die Rechte je Nutzergruppe, die Aktualität des Bestands, der Umgang mit der Lücke und die Protokollierung jeder Anfrage. Jede dieser Festlegungen schützt eine Eigenschaft, die im Betrieb zählt: die Vertraulichkeit, die Richtigkeit und die Nachprüfbarkeit der Auskunft.
Der beschriebene Ablauf lässt sich auf einen engen Bestand und eine einzelne Nutzergruppe anwenden, ohne dass der gesamte Betrieb umgestellt wird. Wer ihn einmal für diesen ersten Fall durchläuft, hat die Grundlage geschaffen, auf der sich weitere Bestände und Gruppen anschließen lassen.
Wir klären mit Ihnen die Quellen, Rechte und Prüfungen Ihres KI-Assistenten in 1 Werktag, bevor die erste Frage beantwortet wird.
Fundiertes KI-Wissen, direkt ins Postfach.
Ein Thema pro Woche, vollständig erklärt – ohne Hype, ohne Werbung, jederzeit abbestellbar.
Zu den KI-News