Blog

KI-Wissen für den Mittelstand

Praxisnahe Einblicke zu Corporate LLMs, KI-Integration, Automatisierung, Datenschutz und dem EU AI Act.

Aktuelle Fachartikel

Welche Daten braucht RAG im Unternehmen?

Ein RAG-System scheitert selten am Sprachmodell. Es scheitert daran, dass es auf veraltete Arbeitsanweisungen, widersprüchliche Verträge oder unklare Berechtigungen zugreift. Die Frage „Welche Daten braucht RAG“ entscheidet deshalb nicht nur über die Qualität der Antworten, sondern über Akzeptanz, Datenschutz und den wirtschaftlichen Nutzen der gesamten Lösung.

RAG steht für Retrieval-Augmented Generation. Vereinfacht gesagt: Statt ein Sprachmodell mit dem gesamten Unternehmenswissen neu zu trainieren, sucht das System bei jeder Anfrage gezielt relevante Informationen und verwendet sie als belegbaren Kontext für die Antwort. Das eignet sich besonders für mittelständische Unternehmen, deren Wissen in Dokumenten, Fachanwendungen und gewachsenen Ablagestrukturen verteilt ist.

Die entscheidende Voraussetzung lautet jedoch: Nicht möglichst viele Daten machen RAG besser. Entscheidend sind die richtigen Daten, in einer verwertbaren Struktur und mit klar geregeltem Zugriff.

Welche Daten braucht RAG für belastbare Antworten?

Ein produktives RAG-System benötigt Daten, die konkrete Geschäftsfragen beantworten können. Für einen technischen Service-Assistenten sind das andere Inhalte als für einen Vertriebsassistenten oder eine Lösung für die Personalabteilung. Der Ausgangspunkt ist daher nicht der vorhandene Datenbestand, sondern der geplante Anwendungsfall.

Ein Assistent für den Kundenservice benötigt beispielsweise aktuelle Produktinformationen, Bedienungsanleitungen, Freigabeprozesse, bekannte Fehlerbilder und verbindliche Servicevorgaben. Ein RAG-System für den Vertrieb arbeitet eher mit Leistungsbeschreibungen, Referenzen, Angebotsbausteinen, Preislogiken und Vertragsstandards. In beiden Fällen gilt: Die Daten müssen fachlich autorisiert sein und einen erkennbaren Bezug zur täglichen Arbeit haben.

Besonders geeignet sind Dokumente und Wissensquellen, die bereits heute als verbindlich gelten. Dazu zählen Prozesshandbücher, technische Dokumentationen, Qualitätsrichtlinien, Arbeitsanweisungen, Vertragsvorlagen, Produktdatenblätter, Richtlinien, Schulungsunterlagen und gepflegte Wissensdatenbanken. Auch Inhalte aus ERP-, CRM- oder Ticketsystemen können wertvoll sein, wenn sie sauber strukturiert sind und der jeweilige Zugriff technisch kontrolliert wird.

Weniger geeignet sind ungeprüfte persönliche Notizen, historische E-Mail-Archive oder Ablagen, deren Aktualität niemand verantwortet. Solche Quellen können als ergänzender Recherchebestand sinnvoll sein. Sie sollten aber nicht denselben Status wie freigegebene Unternehmensinformationen erhalten. Andernfalls formuliert das System plausible Antworten auf Basis überholter oder nicht belastbarer Inhalte.

Datenqualität ist wichtiger als Datenmenge

Viele Unternehmen starten mit der Annahme, ein RAG-System müsse zunächst alle verfügbaren Dateien erfassen. Das erhöht jedoch vor allem die Wahrscheinlichkeit, dass irrelevante oder widersprüchliche Informationen gefunden werden. Ein guter Startbestand ist überschaubar, klar abgegrenzt und fachlich geprüft.

Bei der Datenqualität kommt es auf vier Ebenen an: Aktualität, Eindeutigkeit, Vollständigkeit und Verantwortlichkeit. Eine Prozessbeschreibung von 2021 kann sprachlich perfekt aufbereitet sein, ist aber wertlos, wenn der Prozess inzwischen geändert wurde. Zwei unterschiedliche Preislisten führen zu Fehlantworten, wenn nicht eindeutig festgelegt ist, welche Version gültig ist. Und eine fachlich korrekte Information hilft wenig, wenn der Nutzer nicht erkennen kann, aus welchem Bereich und welchem Dokument sie stammt.

Jede wichtige Quelle sollte deshalb einen fachlichen Eigentümer haben. Dieser verantwortet nicht jedes Komma, aber die Gültigkeit, Freigabe und Aktualisierung des Inhalts. RAG wird damit zu einem Anwendungsfall für professionelles Wissensmanagement. Die Technik kann Wissen auffindbar machen. Sie kann aber keine fehlende fachliche Verantwortung ersetzen.

Struktur, Metadaten und Dokumentsegmente

Damit RAG relevante Passagen findet, werden Dokumente nicht als komplette Dateien verarbeitet. Sie werden in kleinere, inhaltlich zusammenhängende Abschnitte zerlegt. Diese Abschnitte werden technisch als Vektoren gespeichert, damit das System auch semantisch ähnliche Fragen und Formulierungen erkennt.

Die Aufteilung muss zum Inhalt passen. Bei einer Arbeitsanweisung sollte ein Abschnitt beispielsweise einen vollständigen Arbeitsschritt mit Voraussetzungen und Ausnahmen enthalten. Wird der Text zu grob zerlegt, erhält das Sprachmodell zu viel irrelevanten Kontext. Wird er zu stark zerstückelt, fehlen wichtige Zusammenhänge. Die optimale Segmentgröße hängt daher von Dokumenttyp, Fachsprache und typischen Nutzerfragen ab.

Ebenso relevant sind Metadaten. Sie geben einem Dokument oder Abschnitt Kontext und ermöglichen eine präzise Suche. Nützliche Metadaten sind etwa Dokumenttyp, Fachbereich, Produktlinie, Standort, Version, Gültigkeitsdatum, Sprache, Freigabestatus und Zugriffsgruppe. Für Vertragswissen können zusätzlich Rechtsraum, Vertragsart oder Laufzeitmodell entscheidend sein.

Metadaten verbessern nicht nur die Antwortqualität. Sie erlauben auch, die Suche auf den richtigen Bereich zu begrenzen. Ein Servicetechniker muss nicht in Vertriebsunterlagen suchen, und ein Vertriebsmitarbeiter sollte keine vertraulichen internen Kalkulationsgrundlagen abrufen können.

Berechtigungen müssen mit den Daten mitreisen

Für den Mittelstand ist Datenschutz kein Zusatzmodul nach dem Projektstart. Bei RAG entscheidet das Berechtigungskonzept darüber, ob sich eine Lösung verantwortbar produktiv einsetzen lässt. Ein System darf nur Informationen finden und in Antworten verwenden, die der jeweilige Nutzer ohnehin sehen darf.

Dafür reicht es nicht, die Datenbank allgemein abzusichern. Rechte müssen auf Dokument-, Ordner-, Mandanten- oder im Einzelfall sogar auf Abschnittsebene durchgesetzt werden. Idealerweise übernimmt das RAG-System bestehende Rollen und Gruppen aus der Unternehmensumgebung. So bleibt die Berechtigungslogik dort, wo sie bereits verwaltet und geprüft wird.

Besondere Aufmerksamkeit verdienen personenbezogene Daten, Verträge, Personalunterlagen, Finanzinformationen und Geschäftsgeheimnisse. Nicht jede Quelle mit sensiblem Inhalt muss grundsätzlich ausgeschlossen werden. Häufig ist eine getrennte Datenhaltung mit eng begrenzten Rollen sinnvoller. Ob dies technisch und organisatorisch vertretbar ist, hängt vom Anwendungsfall, den gesetzlichen Anforderungen und der vorhandenen Governance ab.

In DSGVO-relevanten Szenarien sollten Unternehmen außerdem klären, wo Daten verarbeitet werden, welche Auftragsverarbeitungsverträge erforderlich sind, wie Löschfristen umgesetzt werden und ob Protokolle selbst sensible Inhalte enthalten können. Ein geschlossenes Corporate LLM mit kontrollierter Infrastruktur schafft hier die Grundlage, ersetzt aber keine saubere Datenklassifizierung.

Welche Datenquellen zuerst angebunden werden sollten

Der sinnvollste Einstieg ist selten die größte Datenmigration. Besser ist ein Bereich mit klaren Fragen, hoher Informationslast und messbarem Nutzen. Typische Kandidaten sind der technische Support, das Qualitätsmanagement, die interne IT, der Vertrieb oder die Projektabwicklung.

Für die Priorisierung helfen vier Fragen: Welche Fragen werden heute wiederholt gestellt? Wo suchen Mitarbeiter besonders lange nach Informationen? Welche Fehler entstehen durch fehlendes oder verstreutes Wissen? Und welche Datenquellen gelten fachlich bereits als verbindlich?

Ein guter Pilot kann etwa mit einem gepflegten Handbuchbestand, den aktuellen Prozessvorgaben und einer begrenzten Zahl freigegebener Produktdokumente starten. Nach einigen Wochen zeigen echte Nutzeranfragen, welche Inhalte fehlen, welche Quellen zu ungenau sind und wo Metadaten nachgeschärft werden müssen. Dieser kontrollierte Ausbau ist wirtschaftlicher als ein Projekt, das von Beginn an jede Ablage erfassen will.

Datenpflege ist ein Betriebsprozess, kein Einmalprojekt

Ein RAG-System bleibt nur dann verlässlich, wenn Änderungen in den Quellen zeitnah berücksichtigt werden. Werden neue Preislisten freigegeben, Arbeitsanweisungen angepasst oder Produkte abgekündigt, muss der Datenbestand aktualisiert und neu indexiert werden. Dabei sollte das System alte Versionen eindeutig ersetzen oder als historisch kennzeichnen.

Auch die Qualität der Antworten sollte kontinuierlich geprüft werden. Sinnvoll sind Tests mit realen Fragen aus dem Fachbereich, Rückmeldungen der Nutzer und eine Auswertung von Suchtreffern ohne ausreichenden Kontext. Besonders kritische Antworten können Quellenverweise, Versionsstände oder einen Hinweis auf fehlende Informationen enthalten. So wird erkennbar, wann das System gesichert antwortet und wann ein Experte eingebunden werden muss.

Solara AI plant RAG-Lösungen deshalb nicht als isolierten Chatbot, sondern als kontrollierten Zugriff auf Unternehmenswissen. Die Datenarchitektur, Rechteverwaltung und Einbindung in bestehende Prozesse gehören zur Lösung genauso wie das Sprachmodell selbst.

Wer RAG strategisch einführt, beginnt nicht mit der Frage, wie viele Dokumente vorhanden sind. Er beginnt mit den Entscheidungen und Arbeitsabläufen, die schneller, sicherer und nachvollziehbarer werden sollen. Daraus ergibt sich, welche Daten wirklich in das System gehören - und welche besser außerhalb bleiben.