KI & Automation

Chunking

Chunking bezeichnet das Zerlegen von Dokumenten in kleinere, in sich verständliche Textabschnitte, die ein KI-System einzeln durchsuchen und als Beleg an ein Sprachmodell übergeben kann; Größe und Schnittlinien der Abschnitte bestimmen, ob der Assistent die passende Stelle findet.

Chunking ist der erste Verarbeitungsschritt einer [[rag|RAG-Anwendung]]: Die Abschnitte werden anschließend als [[embedding|Embeddings]] in einer [[vektordatenbank|Vektordatenbank]] abgelegt und bei jeder Frage abgerufen.

In einfachen Worten

Ein Sprachmodell kann nur eine begrenzte Textmenge auf einmal verarbeiten, das Kontextfenster. Ein KI-Assistent auf Unternehmensdaten liest bei einer Frage deshalb nicht alle Handbücher und Verträge. Er sucht die wenigen Abschnitte heraus, die zur Frage passen, und gibt nur diese an das Modell weiter. Damit das gelingt, werden die Dokumente vorab in Abschnitte zerlegt, und die Schnittlinien entscheiden über die Qualität. Wird mitten im Satz oder mitten in einer Tabelle getrennt, fehlt einem Abschnitt der Zusammenhang, und die Antwort stützt sich auf ein Bruchstück. Sind die Abschnitte zu groß, geht der passende Satz zwischen vielen unpassenden unter, und die Suche findet ihn schlechter. Bewährt hat sich das Zerlegen entlang der Struktur des Dokuments: nach Überschriften, Absätzen, Tabellenzeilen oder Vertragsparagrafen. Jeder Abschnitt erhält Angaben zu seiner Herkunft, etwa Dokumenttitel, Kapitel und Ausgabestand, damit die Antwort auf die Fundstelle verweisen kann.

Wozu brauche ich das?

Chunking ist Teil jeder Einrichtung, bei der ein Assistent aus eigenen Unterlagen antwortet: Betriebsanleitungen, Qualitätshandbücher, Produktdatenblätter, interne Richtlinien. Die passende Zerlegung unterscheidet sich je Dokumentart. Ein Datenblatt wird nach Merkmalen getrennt, ein Handbuch nach Kapiteln, ein Vertrag nach Paragrafen. Vor dem Start steht ein Test mit echten Fragen aus dem Arbeitsalltag: Findet der Assistent die richtige Stelle, und enthält der gefundene Abschnitt alles, was zur Antwort gehört?

Beispiel aus der Praxis

Ein Hersteller von Dosierpumpen richtet einen internen Assistenten für den technischen Kundendienst ein. Im ersten Test werden die Betriebsanleitungen in gleich lange Stücke geschnitten. Auf die Frage nach dem Anzugsdrehmoment eines Pumpenkopfs nennt der Assistent einen Wert, der zu einer anderen Baugröße gehört: Die Tabelle war über zwei Abschnitte verteilt, und die Spaltenüberschrift mit der Baugröße lag im falschen Stück. Das Team stellt auf eine Zerlegung nach Kapiteln und Tabellen um, wiederholt die Tabellenüberschrift in jedem Tabellenabschnitt und hängt an jeden Abschnitt Modellreihe und Ausgabestand der Anleitung. Im zweiten Test beantwortet der Assistent dieselben Fragen mit dem richtigen Wert und nennt Kapitel und Ausgabestand als Fundstelle.

Wirtschaftlicher Nutzen

Die Zerlegung ist ein Arbeitsschritt, den Anwender nie sehen und der die Trefferqualität des Assistenten unmittelbar bestimmt. Eine gut zerlegte Wissensbasis liefert belegbare Antworten und senkt die Zahl der Rückfragen an Fachleute. Eine schlecht zerlegte erzeugt plausibel klingende Fehlantworten, die das Vertrauen in den Assistenten nach wenigen Fällen beschädigen. Die Zerlegungsregeln werden einmal je Dokumentart festgelegt und bei jeder Aktualisierung einer Quelle erneut angewendet.

Typische Fehler

  • Dokumente in gleich lange Stücke geschnitten, ohne auf Überschriften, Absätze und Tabellen zu achten.
  • Tabellen zerteilt, sodass Werte und Spaltenüberschriften in verschiedenen Abschnitten liegen.
  • Abschnitte ohne Herkunftsangaben gespeichert – die Antwort kann dann keine Fundstelle nennen.
  • Eingescannte Dokumente ohne Texterkennung (OCR) aufgenommen, sodass Abschnitte leer oder fehlerhaft sind.
  • Die Zerlegung nie mit echten Fragen aus dem Arbeitsalltag getestet.

Worauf achten?

  • Für jede Dokumentart eine eigene Zerlegungsregel festlegen: Kapitel, Paragraf, Merkmal oder Tabellenzeile.
  • An jeden Abschnitt Titel, Kapitel und Ausgabestand des Quelldokuments hängen.
  • Tabellenüberschriften in jedem Tabellenabschnitt wiederholen.
  • Für die KI-Evaluierung eine Liste typischer Fragen mit bekannten richtigen Antworten führen und nach jeder Änderung durchspielen.
  • Bei der Aktualisierung eines Dokuments alle seine alten Abschnitte entfernen, bevor die neuen aufgenommen werden.

Häufig gestellte Fragen

Was ist Chunking?

Das Zerlegen von Dokumenten in kleinere Textabschnitte, die ein KI-System einzeln durchsuchen und als Grundlage einer Antwort an ein Sprachmodell weitergeben kann.

Wie groß sollte ein Chunk sein?

So groß, dass ein Abschnitt für sich verständlich ist, und so klein, dass er ein einzelnes Thema behandelt. Die Größe richtet sich nach der Struktur des Dokuments, also nach Absätzen, Kapiteln oder Tabellenzeilen, und wird mit echten Fragen getestet.

Warum liefert ein KI-Assistent trotz richtiger Dokumente falsche Antworten?

Häufig wegen der Zerlegung: Liegt die entscheidende Angabe über zwei Abschnitte verteilt oder fehlt einem Abschnitt der Zusammenhang, stützt sich die Antwort auf ein Bruchstück. Weitere Ursachen sind veraltete Quellen und fehlende Herkunftsangaben.

Muss Chunking bei jeder Änderung wiederholt werden?

Für das geänderte Dokument ja. Seine alten Abschnitte werden entfernt und die neuen nach derselben Regel erzeugt; der übrige Bestand bleibt unverändert.