Wszystkie artykuły
Ochrona danych8 min czytania

Brak trenowania na twoich danych: co to naprawdę oznacza

Brak trenowania na danych klientów: co obietnica oznacza technicznie i umownie, gdzie stosują się RAG, DPA i obowiązki usunięcia danych, i gdzie leżą ich granice.

Martin Semmele

Scena z miejsca pracy: mały zespół wsparcia przy biurkach pracujący przy ekranach, ekrany widziane z daleka pokazują tylko abstrakcyjne kształty i powierzchnie, brak czytelnego tekstu, brak logo, brak nakładek
Scena z miejsca pracy: mały zespół wsparcia przy biurkach pracujący przy ekranach, ekrany widziane z daleka pokazują tylko abstrakcyjne kształty i powierzchnie, brak czytelnego tekstu, brak logo, brak nakładek · Wygenerowane przez AI

Kluczowe wnioski

  • Przetwarzanie i trenowanie są różne: tylko trenowanie sprawia, że twoje dane stają się trwałą częścią modelu; przetwarzanie jest odwracalne.
  • RAG pobiera wiedzę z twojej bazy wiedzy do kontekstu przy każdym zapytaniu. Model nie uczy się niczego z rozmowy.
  • Według DataGrail 2026, być może 63,6% dostawców AI — spośród 2 400 analizowanych systemów oprogramowania — może nie ujawniać zewnętrznych podprzetwarzających w swoich dokumentach prawnych.
  • Nawet bez trenowania dane pozostają: do 90 dni przechowywania logów dla bezpieczeństwa IT jest uważane za dopuszczalne.
  • Anthropic domyślnie nie trenuje na danych API, ale przechowuje zgłoszone opinie do 5 lat.

Przetwarzanie to nie trenowanie. Najpierw różnica.

Prawie każdy dostawca AI w obszarze wsparcia pisze gdzieś to zdanie: brak trenowania na twoich danych. Brzmi dobrze. Pomaga ci jednak tylko wtedy, gdy wiesz, co to oznacza technicznie. Za obietnicą kryją się bowiem dwa zupełnie różne procesy, które często są mylone w jednym zdaniu.

  • Przetwarzanie: twoje dane są używane w czasie rzeczywistym do wykonania zadania. Przychodzi zapytanie klienta, model dostarcza odpowiedź, gotowe. Po zakończeniu zadania dane nie wracają do systemu uczenia się.
  • Trenowanie: twoje dane są wprowadzane do modelu, by trwale go zmienić. Twoje dane wejściowe stają się częścią wiedzy modelu. Nie ma odwrotu. Wyodrębnienie treści z powrotem oznaczałoby ponowne trenowanie modelu, a na to nikt nie ma budżetu.

Różnica to zatem odwracalność. Przetwarzanie mijasz jak zapytanie w skrzynce odbiorczej. Trenowanie wbudowuje dane na stałe. Właśnie dlatego obietnica ma znaczenie, i właśnie dlatego nie jest warta nic jako samodzielne zdanie na stronie marketingowej. Zdanie nie ma zakresu, nie wymienia podprzetwarzających, terminów przechowywania i nie nosi niczyjego podpisu1.

Dlatego obietnicę zakotwiczasz w sprawdzalnych elementach. Którzy dostawcy otrzymują dane, jak długo przechowywany jest każdy typ, czy wyłączenie obejmuje także wersje zanonimizowane i zagregowane, i czy wszystko to jest zawarte w podpisanej umowie1. Kolejne sekcje omawiają te punkty po kolei.

RAG: model nie uczy się z twoich rozmów.

W obsłudze klienta obietnica opiera się zwykle na architekturze zwanej Retrieval-Augmented Generation, w skrócie RAG. Zasada: model językowy nie jest trenowany na twoich danych. Zamiast tego przy każdym pytaniu system przeszukuje zewnętrzne źródło wiedzy i włącza znalezione informacje do odpowiedzi2.

Scena z miejsca pracy: zespół wsparcia pracujący razem przy ekranach w biurze, dwie osoby rozmawiające na pierwszym planie, ekrany pokazują tylko abstrakcyjne powierzchnie i symbole, brak tekstu, brak logo, brak etykiet
Zespoły wsparcia dziś weryfikują odpowiedzi AI na ekranie. Architektura w tle decyduje o tym, co dzieje się z danymi z rozmów. · Wygenerowane przez AI
  1. 01Retrieve (pobierz): zapytanie klienta jest konwertowane na reprezentację wektorową i porównywane z wektorową bazą danych twojej bazy wiedzy. Wyszukiwanie znajduje sekcje najbardziej podobne do pytania2.
  2. 02Augment (wzbogać): znalezione sekcje są wstawiane do kontekstu zapytania. Prompt zawiera teraz oryginalne pytanie plus odpowiednie fragmenty2.
  3. 03Generate (wygeneruj): model formułuje odpowiedź w języku naturalnym z tego kontekstu. Potem proces jest zakończony; nic nie wraca do żadnego trenowania2.

Efekt uboczny jest dla ciebie co najmniej równie ważny jak prywatność: ponieważ model odpowiada tylko z pobranych sekcji, każda odpowiedź może podać swoje źródło. Ogranicza to również halucynacje, bo system nie improwizuje z pamięci, lecz czerpie z twojej utrzymywanej bazy wiedzy2. Jak pipeline RAG jest szczegółowo zabezpieczony przed halucynacjami, opisaliśmy osobno: Zapobieganie halucynacjom.

Izolacja danych: separacja najemców i jej granice.

Drugi filar techniczny to izolacja. Dostawcy oddzielają dane różnych klientów, aby twoja baza wiedzy i rozmowy nie mieszały się z danymi innych najemców. Powszechne są dwa poziomy3:

  • Separacja najemców: dane różnych klientów są przetwarzane w logicznie oddzielonych środowiskach. Każdy najemca widzi tylko własne treści.
  • Izolacja najemców: izolacja działa dodatkowo na poziomie infrastruktury — systemowo lub fizycznie — tak że mieszanie jest technicznie wykluczone.

Oba mają sens i znacznie podwyższają poziom ochrony. Pamiętaj jednak o dwóch ograniczeniach. Po pierwsze: pseudonimizacja to nie anonimizacja. Zastąpienie atrybutów identyfikujących identyfikatorami nie sprawia, że dane stają się anonimowe. Dopóki re-identyfikacja pozostaje przynajmniej teoretycznie możliwa, dane nadal są uważane za osobowe i w pełni podlegają RODO3.

Po drugie: środki techniczne nie zastępują podstawy prawnej. RODO wymaga, aby każde przetwarzanie danych osobowych opierało się na podstawie prawnej zgodnie z art. 6, niezależnie od tego, jak dobrze dane są technicznie chronione. Izolacja może uczynić operację przetwarzania bezpieczniejszą, ale nie bardziej zgodną z prawem3. W przypadku zastosowania w obsłudze klienta oznacza to: oprócz technologii potrzebujesz solidnej podstawy prawnej i przejrzystej umowy4.

DPA: gdzie obietnica staje się wiążąca.

Gdy tylko dostawca AI przetwarza dane osobowe na polecenie w imieniu twojej firmy, potrzebujesz umowy powierzenia przetwarzania danych zgodnie z art. 28 RODO, czyli DPA. DPA to miejsce, w którym obietnica przechodzi z tekstu marketingowego do zobowiązania umownego. Powinieneś sprawdzić te obowiązkowe elementy:

  • Wiązanie poleceniami: dostawca przetwarza dane wyłącznie zgodnie z twoimi udokumentowanymi poleceniami.
  • Poufność: zaangażowane osoby są zobowiązane do zachowania poufności.
  • Zasada usuwania: co dzieje się po zakończeniu umowy, w jakim terminie dane są usuwane lub zwracane.
  • Podprzetwarzający: którzy podprzetwarzający istnieją, na jakich warunkach są angażowani i jakie obowiązki są na nich przenoszone.

Krytycznym punktem w przypadku dostawców AI jest ostatni. Wyłączenie trenowania musi być odnotowane dla każdego podprzetwarzającego, nie tylko dla głównego dostawcy. Rzeczywiste przetwarzanie modelu zazwyczaj odbywa się bowiem przez usługę modelu lub embeddingu dalej w łańcuchu. Jak duża jest ta luka w praktyce, pokazuje analiza DataGrail z 2026 roku: spośród 2 400 analizowanych systemów oprogramowania, być może 63,6% dostawców z funkcjami AI może nie ujawniać zewnętrznych podprzetwarzających w swoich dokumentach prawnych5.

Nie oznacza to, że wszyscy ci dostawcy potajemnie trenują. Niektórzy po prostu nie mają żadnych. Ale z zewnątrz nie możesz odróżnić tych dwóch grup, dopóki łańcuch dostaw pozostaje bez nazwy1. Listę kontrolną wyboru dostawcy według kryteriów RODO zebraliśmy w osobnym artykule: AI zgodna z RODO w obsłudze klienta.

Do czego naprawdę zobowiązują się OpenAI i Anthropic.

Jeśli twój dostawca wsparcia używa dużego modelu jako front endu, twoja pozycja zależy też od zobowiązań tego modelu. Można je sprawdzić na podstawie dokładnego brzmienia.

OpenAI stwierdza: domyślnie żadne dane z ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu i platformy API — ani dane wejściowe, ani wyjściowe — nie są używane do trenowania ani ulepszania modeli. Dla kwalifikujących się organizacji dostępne są dodatkowo kontrole retencji aż do polityki zerowej retencji danych na platformie API6.

Anthropic składa to samo zobowiązanie dla produktów komercyjnych, takich jak Claude for Work i API Anthropic: dane wejściowe i wyjściowe domyślnie nie są używane do trenowania. Jest jednak jeden wyjątek, o którym powinieneś wiedzieć. Jeśli użytkownicy zgłaszają opinię przez przycisk kciuk w górę lub w dół, Anthropic przechowuje całą powiązaną rozmowę przez okres do 5 lat w bezpiecznym zapleczu i może wykorzystywać tę opinię do trenowania7.

W kontekście twojej oceny oznacza to: pytaj nie tylko o to, z jakiego modelu korzysta dostawca, ale przez jakie endpointy, z jakimi ustawieniami retencji i czy funkcje opinii dla klientów są wyłączone lub mogą zasilać łańcuch trenowania.

Granice: logi, metadane, zagregowane analizy.

Teraz część, którą większość stron dostawców pomija. Nawet przy szczerze złożonej obietnicy dużo pozostaje. To nie jest skandal, lecz normalne działanie usługi online. Po prostu powinieneś o tym wiedzieć, zanim obiecasz lub spoczniesz całkowity brak danych.

  • Logi operacyjne i bezpieczeństwa: pliki logów rejestrują, kto kiedy miał dostęp do jakiego systemu. Okres przechowywania do 90 dni w celach bezpieczeństwa IT jest uważany za dopuszczalny na gruncie prawa ochrony danych; dłuższe przechowywanie tylko przy wyraźnie przeważającym interesie. Federalny Komisarz Niemiec ds. Ochrony Danych wskazał sześć miesięcy jako górną granicę proporcjonalności8.
  • Metadane rozliczeniowe: znaczniki czasu, liczby tokenów i opóźnienia muszą być przechowywane, inaczej nikt nie może wystawić ci faktury. Przeżywa to nawet zobowiązanie do zerowej retencji danych, które dotyczy tylko treści1.
  • Kopie zapasowe i raporty: kopie zapasowe przeżywają usunięcie poszczególnych rozmów do czasu ich nadpisania. A zagregowane analizy — takie jak wskaźniki rozwiązania lub często zadawane pytania — prawie zawsze powstają ponad treścią poszczególnych rozmów1.

Właśnie dlatego użyteczne pytanie do dostawcy nie brzmi: czy ma logi. Wszyscy mają logi. Pytanie brzmi: jakie typy danych przechowuje, jak długo każdy z nich, i czy wyłączenie trenowania obejmuje też pochodne wersje twoich danych — czyli kryteria z pierwszej sekcji1. Co rozliczanie oparte na użyciu robi z tymi metadanymi, wyjaśniliśmy osobno: Koszty oparte na użyciu.

ComLayer jako przykład. I twoja lista kontrolna.

Na zakończenie konkretny przykład — nasz własny. ComLayer przetwarza rozmowy, bazę wiedzy, załączniki i przetwarzanie AI w europejskich regionach. Rejestracja, płatność, wysyłka e-maili i wyszukiwanie semantyczne działają przez usługi w USA, i nazywamy tych dostawców po imieniu, zamiast to ukrywać. Nie analizujemy twoich treści, by trenować własne modele, a dostawcy modeli i embeddingów, z których korzystamy, zobowiązali się umownie do tego samego wyłączenia. DPA odnotowuje to dla każdego dostawcy.

To nie jest wyjątkowy przypadek, lecz to, czego możesz wymagać od każdego dostawcy. Te pytania pomagają w ocenie:

  • Kim są podprzetwarzający, z imienia i nazwiska, w tym usługi modelu i embeddingu?
  • Jak długo przechowywany jest każdy typ danych, w dniach, nie w klauzulach?
  • Jaki jest SLA usunięcia na żądanie, czy obejmuje kopie zapasowe?
  • Czy wyłączenie trenowania obejmuje też dane zanonimizowane, zdeanonimizowane i zagregowane?
  • Czy wszystko jest zawarte w podpisanym DPA, z pierwszeństwem przed warunkami online?

Dostawca, który odpowiada na wszystkie pytania płynnym akapitem, zgaduje. Dostawca, który odpowiada nazwami, liczbami i odniesieniami do klauzul, był już wcześniej audytowany1. Nasze plany i ceny znajdziesz w sposób przejrzysty na stronie cenowej.

Uwaga na koniec: ten artykuł nie stanowi porady prawnej. Kontekstualizuje technologię i praktykę umowną, ale nie zastępuje indywidualnego przeglądu przez specjalistę, tym bardziej że odpowiedzialność za błędne odpowiedzi AI spoczywa na operatorze: Odpowiedzialność za błędy AI.

Często zadawane pytania

Co dokładnie oznacza "brak trenowania na danych klientów" pod względem technicznym?

Dostawca przetwarza twoje treści wyłącznie w celu dostarczenia żądanego wyniku: odpowiedzi, podsumowania, ekstrakcji. Dane nie trafiają do trenowania, dostrajania, ewaluacji ani benchmarkingu modelu. Różnica w stosunku do przetwarzania polega na odwracalności: przetworzone dane można usunąć; danych wprowadzonych do modelu w praktyce nie da się już wyodrębnić.

Czy model AI uczy się z rozmów z moimi klientami?

Przy architekturze RAG — nie. Zapytanie klienta jest konwertowane na reprezentację wektorową i porównywane z twoją bazą wiedzy. Znalezione sekcje są wstawiane do kontekstu promptu; model formułuje z tego odpowiedź. Po odpowiedzi nic się nie nauczyło: model nie zachowuje rozmowy jako wiedzy.

Czy obietnica "braku trenowania" wystarczy dla RODO?

Nie. Środki techniczne, jak separacja najemców, zwiększają bezpieczeństwo, ale nie zastępują podstawy prawnej z art. 6 RODO. A pseudonimizacja to nie anonimizacja: dopóki re-identyfikacja pozostaje teoretycznie możliwa, dane są nadal uważane za osobowe. Obietnica musi być dodatkowo odnotowana umownie w DPA.

Co musi zawierać DPA z dostawcą AI?

Zgodnie z art. 28(3) RODO co najmniej: wiązanie poleceniami, zobowiązania do poufności, środki techniczne i organizacyjne, obowiązki usunięcia oraz wskazanie podprzetwarzających. W kwestii trenowania: wyłączenie musi być odnotowane dla każdego podprzetwarzającego, nie tylko dla głównego dostawcy. Według analizy DataGrail obejmującej 2 400 analizowanych systemów oprogramowania, być może 63,6% dostawców z funkcjami AI może nie ujawniać zewnętrznych podprzetwarzających w swoich dokumentach prawnych.

Czy OpenAI lub Anthropic używają moich danych wsparcia do trenowania?

Domyślnie nie. OpenAI nie używa danych z produktów API i Business do trenowania ani ulepszania modeli. Anthropic składa to samo zobowiązanie dla produktów komercyjnych jak API. Ale: w przypadku Anthropic zgłoszona opinia (kciuk w górę lub w dół) wraz z rozmową może być przechowywana do 5 lat. Sprawdź też kanały opinii, nie tylko klauzulę trenowania.

Jakie dane pozostają przechowywane mimo obietnicy?

Logi operacyjne i bezpieczeństwa, metadane rozliczeniowe jak znaczniki czasu i liczby tokenów, kopie zapasowe i zagregowane analizy. Pliki logów są niezbędne dla bezpieczeństwa IT i wykrywania włamań: do 90 dni przechowywania jest uważane za dopuszczalne na gruncie prawa ochrony danych; dłuższe przechowywanie wymaga uzasadnionego interesu. Zerowa retencja danych niewiele tu zmienia, bo dane rozliczeniowe i monitoring nadużyć przeżywają.

Jak ocenić dostawcę AI przed podpisaniem umowy?

Za pomocą pięciu pytań z listy kontrolnej: podprzetwarzający z nazwami i lokalizacjami, okresy retencji dla każdego typu danych w dniach, SLA usunięcia obejmujący kopie zapasowe, wyłączenie trenowania także dla danych zanonimizowanych i zagregowanych, i wszystko zawarte w podpisanym DPA.

Źródła

  1. 01parseur.com
  2. 02ibm.com
  3. 03dr-datenschutz.de
  4. 04dr-datenschutz.de
  5. 05datagrail.io
  6. 06openai.com
  7. 07privacy.claude.com
  8. 08dsn-group.de

Zacznij za darmo · Bez karty kredytowej

Skonfigurowane dziś wieczorem. Odpowiada już jutro rano.

Osadź widget, dodaj swoją wiedzę, gotowe — ComLayer przejmuje obsługę, także wtedy, gdy nikogo nie ma przy komputerze.