Alle Beiträge
Datenschutz8 Min. Lesezeit

Kein Training auf deinen Daten: was das konkret bedeutet

Kein Training auf Kundendaten: Was die Zusage technisch und vertraglich bedeutet, wo RAG, AVV und Löschpflichten greifen und wo ihre Grenzen liegen.

Martin Semmele

Fotografische Szene aus der Praxis: ein kleines Support-Team an Schreibtischen bei der Bildschirmarbeit, Bildschirme aus der Distanz nur mit abstrakten Formen und Flächen, kein lesbarer Text, keine Logos, keine Überlagerungen
Fotografische Szene aus der Praxis: ein kleines Support-Team an Schreibtischen bei der Bildschirmarbeit, Bildschirme aus der Distanz nur mit abstrakten Formen und Flächen, kein lesbarer Text, keine Logos, keine Überlagerungen · KI-generiert

Wichtige Erkenntnisse

  • Verarbeitung und Training sind verschieden: Nur Training macht deine Daten dauerhaft Teil des Modells, Verarbeitung ist umkehrbar.
  • RAG holt Wissen zur Anfrage aus deiner Wissensbasis in den Kontext. Das Modell lernt dabei nichts aus dem Gespräch.
  • Laut DataGrail 2026 legen möglicherweise 63,6 Prozent der KI-Anbieter — von 2.400 analysierten Software-Systemen — keine externen Unterauftragsverarbeiter in ihren Rechtsdokumenten offen.
  • Auch ohne Training bleiben Daten: Bis zu 90 Tage Logfile-Speicherung für IT-Sicherheit gelten als vertretbar.
  • Anthropic trainiert standardmäßig nicht mit API-Daten, speichert gemeldetes Feedback aber bis zu 5 Jahre.

Verarbeitung ist nicht Training. Der Unterschied zuerst.

Fast jeder KI-Anbieter im Support schreibt den Satz irgendwo hin: kein Training auf deinen Daten. Klingt gut. Hilft dir aber nur, wenn du weißt, was er technisch bedeutet. Denn hinter der Zusage stecken zwei völlig unterschiedliche Vorgänge, die oft in einem Satz vermengt werden.

  • Verarbeitung: Deine Daten werden in Echtzeit benutzt, um eine Aufgabe zu erledigen. Eine Kundenfrage kommt rein, das Modell liefert eine Antwort, fertig. Wenn die Aufgabe abgeschlossen ist, fließen die Daten nicht zurück in ein Lernsystem.
  • Training: Deine Daten werden in ein Modell eingespeist, um es dauerhaft zu verändern. Deine Eingaben werden Teil des Modellwissens. Es gibt kein Zurücksetzen. Die Inhalte wieder herauszulösen hieße, das Modell neu zu trainieren, und dafür hat niemand ein Budget.

Der Unterschied ist also die Umkehrbarkeit. Verarbeitung lässt du vorbeiziehen wie eine Anfrage im Posteingang. Training backt die Daten ein. Genau deshalb ist die Zusage so wichtig, und genau deshalb ist sie als freistehender Satz auf einer Marketingseite nichts wert. Der Satz hat keinen Geltungsbereich, nennt keine Unterauftragsverarbeiter, keine Aufbewahrungsfristen und trägt niemandes Unterschrift1.

Woran du die Zusage also festmachst: an den überprüfbaren Teilen. Welche Anbieter bekommen die Daten, wie lange bleibt jede Datenart gespeichert, gilt der Ausschluss auch für anonymisierte und aggregierte Versionen, und steht das alles im unterschriebenen Vertrag1. Die nächsten Abschnitte gehen diese Punkte der Reihe nach durch.

RAG: Das Modell lernt nicht aus deinen Gesprächen.

Im Kundensupport beruht die Zusage meist auf einer Architektur namens Retrieval-Augmented Generation, kurz RAG. Das Prinzip: Das Sprachmodell wird nicht mit deinen Daten trainiert. Stattdessen durchsucht das System bei jeder Frage eine externe Wissensquelle und baut die gefundenen Informationen in die Antwort ein2.

Fotografische Szene aus der Praxis: ein Support-Team arbeitet gemeinsam an Bildschirmen im Büro, im Vordergrund zwei Personen im Gespräch, die Bildschirme zeigen nur abstrakte Flächen und Symbole, keine Schrift, keine Logos, keine Beschriftungen
Support-Teams prüfen KI-Antworten heute am Bildschirm. Die Architektur dahinter entscheidet, was mit den Gesprächsdaten passiert. · KI-generiert
  1. 01Retrieve: Die Kundenanfrage wird in eine Vektorrepräsentation umgewandelt und gegen die Vektordatenbank deiner Wissensbasis abgeglichen. Die Suche findet die Abschnitte, die der Frage am ähnlichsten sind2.
  2. 02Augment: Die gefundenen Abschnitte werden in den Kontext der Anfrage eingefügt. Der Prompt enthält jetzt die ursprüngliche Frage plus die relevanten Textstellen2.
  3. 03Generate: Das Modell formuliert aus diesem Kontext eine Antwort in natürlicher Sprache. Danach ist der Vorgang abgeschlossen, nichts fließt in ein Training zurück2.

Der Nebeneffekt ist für dich mindestens so wichtig wie der Datenschutz: Weil das Modell nur aus den gefundenen Abschnitten antwortet, kann jede Antwort ihre Quelle nennen. Das begrenzt auch Halluzinationen, weil das System nicht aus dem Gedächtnis dichtet, sondern aus deinem gepflegten Wissen2. Wie so eine RAG-Pipeline im Detail gegen Halluzinationen abgesichert wird, haben wir separat beschrieben: Halluzinationen verhindern.

Datenisolation: Mandantentrennung und ihre Grenzen.

Die zweite technische Säule ist Isolation. Anbieter trennen die Daten verschiedener Kunden, damit dein Wissensstand und deine Gespräche nicht mit denen anderer Mandanten vermischt werden. Üblich sind zwei Ebenen3:

  • Mandantentrennung: Die Daten verschiedener Kunden werden logisch voneinander getrennt verarbeitet. Jeder Mandant sieht nur seine eigenen Inhalte.
  • Tenant-Trennung: Die Isolation greift zusätzlich auf Infrastrukturebene, also systemseitig oder physisch, damit eine Vermischung technisch ausgeschlossen ist.

Beides ist sinnvoll und erhöht das Schutzniveau deutlich. Aber halte dir zwei Grenzen vor Augen. Erstens: Pseudonymisierung ist keine Anonymisierung. Wer identifizierende Merkmale durch Kennziffern ersetzt, macht Daten nicht anonym. Solange eine Re-Identifikation zumindest theoretisch möglich bleibt, gelten die Daten weiter als personenbezogen und unterliegen vollständig der DSGVO3.

Zweitens: Technische Schutzmaßnahmen ersetzen keine Rechtsgrundlage. Die DSGVO verlangt, dass jede Verarbeitung personenbezogener Daten auf einer Rechtsgrundlage nach Art. 6 beruht, egal wie gut die Daten technisch geschützt sind. Isolation kann eine Verarbeitung sicherer machen, aber nicht rechtmäßiger3. Für den Einsatz im Kundenservice heißt das: Auch neben der Technik brauchst du eine tragfähige Rechtsgrundlage und einen sauberen Vertrag4.

Der AVV: Wo die Zusage verbindlich wird.

Sobald ein KI-Anbieter personenbezogene Daten weisungsgebunden für dein Unternehmen verarbeitet, brauchst du einen Auftragsverarbeitungsvertrag nach Art. 28 DSGVO, kurz AVV. Der AVV ist der Ort, an dem die Zusage vom Marketingtext zur Vertragspflicht wird. Diese Pflichtinhalte solltest du prüfen:

  • Weisungsbindung: Der Anbieter verarbeitet die Daten nur auf deine dokumentierte Weisung.
  • Vertraulichkeit: Die betroffenen Personen sind zur Vertraulichkeit verpflichtet.
  • Löschregelung: Was passiert nach Vertragsende, in welchem Zeitraum werden Daten gelöscht oder zurückgegeben.
  • Subprozessoren: Welche Unterauftragsverarbeiter es gibt, unter welchen Bedingungen sie eingesetzt werden und welche Pflichten auf sie übertragen werden.

Der kritische Punkt bei KI-Anbietern ist der letzte. Der Trainingsausschluss muss für jeden Unterauftragsverarbeiter festgehalten werden, nicht nur für den Hauptanbieter. Denn meist läuft die eigentliche Modellverarbeitung über einen Modell- oder Einbettungsdienst weiter hinten in der Kette. Wie weit die Lücke in der Praxis ist, zeigt eine Auswertung von DataGrail aus dem Jahr 2026: Von 2.400 analysierten Software-Systemen legen laut DataGrail möglicherweise 63,6 Prozent der Anbieter mit KI-Funktionen keine externen Unterauftragsverarbeiter in ihren Rechtsdokumenten offen5.

Das heißt nicht, dass alle diese Anbieter heimlich trainieren. Manche haben schlicht keinen. Aber von außen kannst du die beiden Gruppen nicht unterscheiden, solange die Lieferkette ungenannt bleibt1. Eine Checkliste für die Anbieterauswahl nach DSGVO-Kriterien haben wir in einem eigenen Beitrag zusammengestellt: DSGVO-konforme KI im Kundenservice.

Was OpenAI und Anthropic tatsächlich zusichern.

Wenn dein Support-Anbieter ein großes Modell vorschaltet, hängt deine Position auch von dessen Zusagen ab. Die lassen sich am Wortlaut prüfen.

OpenAI schreibt: Standardmäßig werden keine Daten aus ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu und der API-Plattform, weder Eingaben noch Ausgaben, zum Training oder zur Verbesserung der Modelle verwendet. Für qualifizierende Organisationen gibt es zusätzlich Aufbewahrungskontrollen bis hin zur Zero-Data-Retention-Politik in der API-Plattform6.

Anthropic sichert für kommerzielle Produkte wie Claude for Work und die Anthropic API dasselbe zu: Eingaben und Ausgaben werden standardmäßig nicht zum Training verwendet. Es gibt aber eine Ausnahme, die du kennen solltest. Wenn Nutzer über den Daumen-hoch- oder Daumen-runter-Button Feedback melden, speichert Anthropic die gesamte zugehörige Konversation bis zu 5 Jahre im gesicherten Backend und kann das Feedback zum Training nutzen7.

Für deine Evaluation heißt das: Frage nicht nur, welches Modell der Anbieter einsetzt, sondern über welche Endpunkte, mit welchen Aufbewahrungseinstellungen und ob Feedback-Funktionen für Kunden deaktiviert sind oder in die Trainingskette führen können.

Grenzen: Logs, Metadaten, aggregierte Auswertungen.

Jetzt der Teil, den die meisten Anbieterseiten weglassen. Auch bei ernst gemeinter Zusage bleibt eine Menge bestehen. Das ist kein Skandal, sondern der normale Betrieb eines Onlinedienstes. Du solltest es nur wissen, bevor du totale Datenlosigkeit versprichst oder erwartest.

  • Betriebs- und Sicherheitsprotokolle: Logfiles zeichnen auf, wer wann auf welches System zugegriffen hat. Eine Speicherdauer von bis zu 90 Tagen gilt zum Zweck der IT-Sicherheit als datenschutzrechtlich vertretbar, längere Speicherung nur mit einem deutlich überwiegenden Interesse. Der Bundesbeauftragte für den Datenschutz und die Informationsfreiheit hat mit Verweis auf das Grundsatzurteil des Bundesverfassungsgerichts zur Vorratsdatenspeicherung sechs Monate als Obergrenze des Verhältnismäßigen bezeichnet8.
  • Abrechnungs-Metadaten: Zeitstempel, Token-Anzahlen und Latenz müssen gespeichert werden, sonst kann dir niemand eine Rechnung stellen. Das überlebt auch eine Zero-Data-Retention-Zusage, die sich nur auf Inhalte bezieht1.
  • Backups und Auswertungen: Backups überleben die Löschung einzelner Konversationen, bis sie überschrieben sind. Und aggregierte Auswertungen, etwa Lösungsraten oder häufige Fragen, entstehen fast immer über den Inhalt einzelner Gespräche hinaus1.

Genau deshalb ist die nützliche Frage an einen Anbieter nicht, ob er Logs hat. Jeder hat Logs. Die Frage ist, welche Datenarten er speichert, wie lange jeweils, und ob der Trainingsausschluss auch für abgeleitete Versionen deiner Daten gilt, also die oben genannten Kriterien aus dem ersten Abschnitt1. Was nutzungsbasierte Abrechnung mit solchen Metadaten macht, haben wir separat aufgeschlüsselt: Nutzungsbasierte Kosten.

Comlayer als Beispiel. Und deine Checkliste.

Zum Schluss ein konkretes Beispiel, nämlich unser eigenes. Comlayer verarbeitet Konversationen, Wissensbasis, Dateianhänge und die KI-Verarbeitung in europäischen Regionen. Anmeldung, Zahlung, Mailversand und semantische Suche laufen über Dienste in den USA, und wir nennen diese Anbieter beim Namen, statt es zu verschweigen. Wir werten deine Inhalte nicht aus, um eigene Modelle zu trainieren, und die eingesetzten Modell- und Einbettungsanbieter haben sich vertraglich zum selben Ausschluss verpflichtet. Der AVV hält das je Anbieter fest.

Das ist kein Sonderfall, sondern das, was du von jedem Anbieter verlangen kannst. Diese Fragen helfen bei der Evaluation:

  • Wer sind die Unterauftragsverarbeiter, namentlich, inklusive der Modell- und Einbettungsdienste?
  • Wie lange wird jede Datenart aufbewahrt, in Tagen, nicht in Paragrafen?
  • Wie lautet die Lösch-SLA auf Anfrage, und erfasst sie Backups?
  • Gilt der Trainingsausschluss auch für anonymisierte, de-identifizierte und aggregierte Daten?
  • Steht alles im unterschriebenen AVV, mit Vorrang vor den Online-Bedingungen?

Ein Anbieter, der alle Fragen in einem flüssigen Absatz beantwortet, rät. Ein Anbieter, der mit Namen, Zahlen und Klauselverweis antwortet, wurde schon öfter geprüft1. Unsere Pläne und Preise findest du transparent auf der Preisseite.

Ein Hinweis zum Schluss: Dieser Artikel ist keine Rechtsberatung. Er ordnet Technik und Vertragspraxis ein, ersetzt aber keine individuelle Prüfung durch eine Fachperson, zumal die Haftung für falsche KI-Antworten beim Betreiber bleibt: Haftung bei KI-Fehlern.

Häufig gestellte Fragen

Was bedeutet "kein Training auf Kundendaten" technisch genau?

Der Anbieter verarbeitet deine Inhalte nur, um das angeforderte Ergebnis zu liefern: eine Antwort, eine Zusammenfassung, eine Extraktion. Die Daten fließen nicht in das Training, Fine-Tuning, die Evaluation oder das Benchmarking eines Modells. Der Unterschied zur Verarbeitung ist die Umkehrbarkeit: Verarbeitete Daten lassen sich löschen, in ein Modell eingespeiste Daten praktisch nicht mehr entfernen.

Lernt das KI-Modell aus den Gesprächen mit meinen Kunden?

Bei einer RAG-Architektur nicht. Die Kundenfrage wird in eine Vektordarstellung umgewandelt und mit deiner Wissensbasis abgeglichen. Die gefundenen Abschnitte werden in den Kontext des Prompts eingefügt, das Modell formuliert daraus die Antwort. Nach der Antwort ist nichts gelernt: Das Modell behält die Konversation nicht als Wissen.

Reicht die Zusage "kein Training" für die DSGVO?

Nein. Technische Schutzmaßnahmen wie Mandanten- und Tenant-Trennung erhöhen die Sicherheit, ersetzen aber keine Rechtsgrundlage nach Art. 6 DSGVO. Und Pseudonymisierung ist keine Anonymisierung: Solange Re-Identifikation theoretisch möglich bleibt, gelten die Daten als personenbezogen. Die Zusage muss zusätzlich vertraglich im AVV festgehalten werden.

Was muss in einem AVV mit einem KI-Anbieter stehen?

Nach Art. 28 Abs. 3 DSGVO mindestens: Weisungsbindung, Vertraulichkeitsverpflichtungen, technische und organisatorische Maßnahmen, Löschpflichten und die Benennung der Subprozessoren. Beim Thema Training wichtig: Der Ausschluss muss je Unterauftragsverarbeiter festgehalten werden, nicht nur für den Hauptanbieter. Laut DataGrail-Auswertung von 2.400 analysierten Software-Systemen legen möglicherweise 63,6 Prozent der Anbieter mit KI-Funktionen keine externen Unterauftragsverarbeiter in ihren Rechtsdokumenten offen.

Nutzen OpenAI oder Anthropic meine Support-Daten zum Training?

Standardmäßig nein. OpenAI nutzt Daten von API- und Business-Produkten nicht zum Training oder Verbessern der Modelle. Anthropic verspricht dasselbe für kommerzielle Produkte wie die API. Aber: Bei Anthropic kann gemeldetes Feedback (Daumen hoch oder runter) inklusive der Konversation bis zu 5 Jahre gespeichert werden. Prüfe also auch die Feedback-Wege, nicht nur die Trainingsklausel.

Welche Daten bleiben trotz der Zusage gespeichert?

Betriebs- und Sicherheitsprotokolle, Abrechnungs-Metadaten wie Zeitstempel und Token-Anzahlen, Backups und aggregierte Auswertungen. Logfiles sind für IT-Sicherheit und Angriffserkennung nötig: Bis zu 90 Tage Speicherung gelten als datenschutzrechtlich vertretbar, längere Speicherung braucht ein begründetes Interesse. Zero Data Retention ändert daran wenig, weil Abrechnungsdaten und Missbrauchsüberwachung überleben.

Wie prüfe ich einen KI-Anbieter vor der Vertragsunterzeichnung?

Mit den fünf Fragen aus der Checkliste oben: Subprozessoren mit Namen und Standort, Aufbewahrungsfristen je Datenart in Tagen, Lösch-SLA inklusive Backups, Trainingsausschluss auch für anonymisierte und aggregierte Daten, und alles festgehalten im unterschriebenen AVV.

Quellen

  1. 01parseur.com
  2. 02ibm.com
  3. 03dr-datenschutz.de
  4. 04dr-datenschutz.de
  5. 05datagrail.io
  6. 06openai.com
  7. 07privacy.claude.com
  8. 08dsn-group.de

Kostenlos starten · Keine Kreditkarte

Heute Abend eingerichtet. Morgen früh schon geantwortet.

Widget einbinden, Wissen hinterlegen, fertig — ComLayer übernimmt, auch wenn niemand am Rechner sitzt.