Blog

KI-Wissen für den Mittelstand

Praxisnahe Einblicke zu Corporate LLMs, KI-Integration, Automatisierung, Datenschutz und dem EU AI Act.

Aktuelle Fachartikel

Welche Daten darf KI nutzen? Regeln für Firmen

Ein Vertriebsmitarbeiter kopiert eine Kundenanfrage in ein öffentliches KI-Tool, um eine Antwort vorzubereiten. Ein Einkäufer lädt Vertragsunterlagen hoch, um Klauseln prüfen zu lassen. Beide Vorgänge können effizient sein - oder zu einem Datenschutz-, Geheimnis- und Compliance-Risiko werden. Die Frage „welche Daten darf KI nutzen“ entscheidet deshalb nicht allein über die Tool-Auswahl, sondern über die Architektur und Governance des gesamten KI-Einsatzes.

Für mittelständische Unternehmen gilt: KI darf nicht deshalb Daten verarbeiten, weil sie technisch dazu in der Lage ist. Zulässig ist nur, was einen klaren Geschäftszweck erfüllt, rechtlich abgesichert ist und innerhalb einer kontrollierten Infrastruktur verarbeitet wird. Wer diese drei Ebenen trennt, schafft die Grundlage für produktive KI statt eines schwer steuerbaren Schatten-IT-Risikos.

Welche Daten darf KI nutzen? Die Grundregel

Eine KI darf Daten nutzen, wenn für die konkrete Verarbeitung eine Rechtsgrundlage besteht, der Zweck eindeutig definiert ist und die Verarbeitung auf das erforderliche Maß begrenzt bleibt. Bei personenbezogenen Daten ergibt sich dieser Rahmen vor allem aus der DSGVO. Bei Unternehmensdaten kommen zusätzlich Geschäftsgeheimnisse, vertragliche Vertraulichkeitspflichten, Urheberrechte und branchenspezifische Regeln hinzu.

Entscheidend ist der konkrete Verarbeitungsvorgang. Es macht einen erheblichen Unterschied, ob ein Sprachmodell eine interne Richtlinie einmalig zusammenfasst, ob es dauerhaft über Dokumente recherchiert oder ob diese Dokumente zum Training eines externen Modells verwendet werden. Diese Szenarien verlangen unterschiedliche technische und rechtliche Kontrollen.

Die verbreitete Annahme, Daten seien für KI nutzbar, solange sie im Unternehmen gespeichert sind, greift zu kurz. Das Eigentum oder der Zugriff auf eine Datei ersetzt weder eine datenschutzrechtliche Grundlage noch eine Prüfung von Verträgen und Schutzrechten. Gerade bei Kundenakten, Lieferantenverträgen und Personalunterlagen muss vor dem Einsatz geklärt sein, was verarbeitet werden darf, durch welches System und mit welchem Ergebnis.

Drei Datenkategorien, drei Risikoprofile

Personenbezogene Daten: nur mit klarer Grundlage

Namen, E-Mail-Adressen, Kundennummern, Gesprächsnotizen, Gehaltsdaten oder Leistungsbewertungen sind personenbezogene Daten. Ihre Verarbeitung durch KI braucht einen definierten Zweck und regelmäßig eine Rechtsgrundlage, etwa die Vertragserfüllung, eine rechtliche Verpflichtung oder ein überwiegendes berechtigtes Interesse. Eine Einwilligung ist im Unternehmensalltag nicht automatisch der beste Weg, insbesondere im Arbeitsverhältnis.

Besondere Vorsicht gilt bei sensiblen Daten nach Art. 9 DSGVO. Gesundheitsdaten, biometrische Daten, Angaben zur Gewerkschaftszugehörigkeit oder politische Meinungen dürfen nur unter engen zusätzlichen Voraussetzungen verarbeitet werden. Für viele KI-Anwendungsfälle ist es wirtschaftlich und rechtlich sinnvoller, solche Daten vorab zu entfernen oder den Prozess so zu gestalten, dass sie gar nicht in das System gelangen.

Auch pseudonymisierte Daten bleiben personenbezogen, wenn eine Re-Identifizierung mit vertretbarem Aufwand möglich ist. Anonymisierung senkt Risiken deutlich, muss aber technisch belastbar umgesetzt sein. Das bloße Ersetzen eines Namens durch eine Kundennummer genügt meist nicht.

Vertrauliche Unternehmensdaten: Schutz bleibt Pflicht

Angebote, Preislisten, Kalkulationen, Produktroadmaps, Quellcode, Produktionskennzahlen und interne Strategiepapiere sind häufig keine personenbezogenen Daten. Sie können dennoch hochkritisch sein. Werden sie in einen öffentlichen KI-Dienst eingegeben, kann das Geschäftsgeheimnisse gefährden oder vertragliche Geheimhaltungspflichten verletzen.

Die zentrale Frage lautet hier: Verbleiben Daten in einer vom Unternehmen kontrollierten Umgebung, oder werden sie an einen externen Dienst übertragen und möglicherweise für dessen Modellverbesserung genutzt? Ein geschlossener Corporate-LLM-Betrieb mit klaren Speicherfristen, Mandantentrennung und deaktiviertem Training ist etwas grundlegend anderes als die Nutzung eines frei verfügbaren Consumer-Tools.

Daten Dritter: Verträge und Rechte prüfen

Nicht jede Information, die ein Unternehmen besitzt, darf beliebig weiterverarbeitet werden. Vertragsunterlagen können Geheimhaltungsvereinbarungen unterliegen. Datenbanken können geschützt sein. Fachartikel, Bilder, Softwarecode oder Marktstudien können urheberrechtliche oder lizenzrechtliche Grenzen setzen.

Besondere Aufmerksamkeit verdienen Daten, die Kunden, Lieferanten oder Partner bereitgestellt haben. Vor einer KI-Verarbeitung sollte geprüft werden, ob der ursprüngliche Vertrag diesen Zweck abdeckt. Fehlt die Grundlage, können eine Vereinbarung mit dem Vertragspartner, eine technische Einschränkung oder eine Anonymisierung erforderlich sein.

Der Unterschied zwischen Eingabe, Wissensbasis und Training

Im Management wird oft pauschal von „KI mit Unternehmensdaten“ gesprochen. Für eine belastbare Entscheidung reicht das nicht. Es sind mindestens drei Verarbeitungsarten zu unterscheiden.

Bei einer einmaligen Eingabe verarbeitet das Modell einen Prompt, etwa zur Formulierung einer E-Mail oder zur Zusammenfassung eines Dokuments. Das Risiko hängt vor allem davon ab, ob der Anbieter die Inhalte speichert, wo verarbeitet wird und ob Inhalte für Trainingszwecke verwendet werden.

Eine Wissensbasis stellt autorisierte Dokumente über eine Such- und Retrieval-Schicht bereit. Das Modell erhält nur die für die jeweilige Anfrage relevanten Textauszüge. Dieser Ansatz ist für Unternehmenswissen oft sinnvoller als ein Training, weil Inhalte aktuell bleiben, Berechtigungen durchsetzbar sind und Quellen kontrolliert werden können.

Beim Training oder Fine-Tuning fließen Daten in die Anpassung eines Modells ein. Hier sind Datenqualität, Rechtsgrundlage, Löschkonzepte und die Gefahr einer ungewollten Wiedererkennbarkeit besonders relevant. Für viele mittelständische Anwendungen ist Training nicht notwendig. Eine sauber strukturierte Wissensbasis und klar definierte Workflows liefern häufig schneller messbaren Nutzen bei geringerem Risiko.

Was eine sichere KI-Datenarchitektur ausmacht

Datenschutz entsteht nicht durch eine Richtlinie allein. Er muss in Berechtigungen, Schnittstellen und Betriebsprozessen sichtbar werden. Eine unternehmensfähige Architektur trennt Datenquellen, steuert Zugriffe rollenbasiert und protokolliert, welche Systeme welche Informationen verarbeitet haben.

Dazu gehören eine eindeutige Datenklassifikation, Zugriffskontrollen aus bestehenden Identitäts- und Berechtigungssystemen sowie Verschlüsselung bei Übertragung und Speicherung. Ebenso wichtig sind verbindliche Löschfristen. Daten sollten nicht länger im KI-System verbleiben, als es der konkrete Zweck verlangt.

Wenn ein externer Anbieter personenbezogene Daten im Auftrag verarbeitet, braucht das Unternehmen in der Regel einen Auftragsverarbeitungsvertrag. Auch Unterauftragnehmer, Verarbeitungsorte und mögliche Datenübermittlungen außerhalb des Europäischen Wirtschaftsraums müssen transparent sein. Aussagen wie „DSGVO-konform“ reichen nicht aus, wenn sie sich nicht in Verträgen, technischen Einstellungen und einem nachvollziehbaren Betriebsmodell wiederfinden.

Für sensible Prozesse kann eine Datenschutz-Folgenabschätzung erforderlich sein, etwa wenn KI umfangreich Personen bewertet, Risiken prognostiziert oder Entscheidungen vorbereitet, die erhebliche Auswirkungen haben. Diese Prüfung sollte nicht erst nach dem Pilotprojekt stattfinden. Sie gehört in die Planungsphase.

Ein praxistauglicher Entscheidungsprozess

Bevor ein Fachbereich Daten an eine KI übergibt, sollte er vier Fragen beantworten:

  • Welchen konkreten Geschäftsprozess verbessert die Verarbeitung?
  • Welche Datenarten sind tatsächlich erforderlich?
  • Welche Rechtsgrundlage, Verträge und Schutzpflichten gelten?
  • In welcher technischen Umgebung werden Daten verarbeitet, gespeichert und gelöscht?

Auf dieser Basis lässt sich jeder Anwendungsfall in eine klare Risikoklasse einordnen. Ein KI-Assistent für allgemeine Produktinformationen benötigt andere Kontrollen als ein System, das Kundenkorrespondenz auswertet oder Verträge analysiert. Ein einheitliches Verbot bremst Produktivität. Eine pauschale Freigabe schafft Haftung. Wirksam ist ein abgestuftes Modell mit erlaubten Datenquellen, freigegebenen Tools und klaren Eskalationswegen für Sonderfälle.

Unternehmen sollten außerdem festlegen, wer Inhalte in eine KI-Wissensbasis einstellen darf. Ohne Verantwortlichkeiten entstehen schnell veraltete, doppelte oder unvollständige Bestände. Die Folge sind nicht nur Datenschutzprobleme, sondern fehlerhafte Antworten und sinkendes Vertrauen in das System.

KI-Nutzung braucht auch menschliche Kontrolle

Selbst wenn die Datenverarbeitung zulässig ist, bleibt die fachliche Verantwortung beim Unternehmen. KI-Ausgaben können falsche Schlussfolgerungen enthalten, vertrauliche Details unpassend zusammenführen oder veraltete Informationen verwenden. Besonders bei Angeboten, Vertragsbewertungen, Personalthemen und Entscheidungen mit finanziellen Folgen müssen Mitarbeiter Ergebnisse prüfen, bevor sie übernommen werden.

Die beste KI-Strategie beginnt daher nicht mit dem Modell, sondern mit den Datenflüssen. Wer seine Daten klassifiziert, Zwecke sauber abgrenzt und eine geschlossene, kontrollierbare Infrastruktur schafft, kann internes Wissen produktiv nutzbar machen, ohne Kontrolle und Vertrauen preiszugeben. Genau dort wird aus einem KI-Experiment ein belastbarer Bestandteil der Unternehmensprozesse.