Nessun addestramento sui tuoi dati: cosa significa nella pratica
Nessun addestramento sui dati dei clienti: cosa significa la promessa tecnicamente e contrattualmente, dove si applicano RAG, DPA e obblighi di cancellazione, e dove si trovano i loro limiti.
Martin Semmele

Contenuti
- 01L'elaborazione non è addestramento. Prima la differenza.
- 02RAG: il modello non impara dalle tue conversazioni.
- 03Isolamento dei dati: separazione dei tenant e i suoi limiti.
- 04Il DPA: dove la promessa diventa vincolante.
- 05A cosa si impegnano davvero OpenAI e Anthropic.
- 06Limiti: log, metadati, analisi aggregate.
- 07ComLayer come esempio. E la tua checklist.
- 08Domande frequenti
Punti chiave
- Elaborazione e addestramento sono cose diverse: solo l'addestramento rende i tuoi dati una parte permanente del modello; l'elaborazione è reversibile.
- Il RAG recupera conoscenze dalla tua knowledge base nel contesto per ogni richiesta. Il modello non impara nulla dalla conversazione.
- Secondo DataGrail 2026, forse il 63,6% dei fornitori di IA — su 2.400 sistemi software analizzati — potrebbe non divulgare i subprocessori esterni nei propri documenti legali.
- Anche senza addestramento rimangono dei dati: fino a 90 giorni di conservazione dei log per la sicurezza informatica è considerato accettabile.
- Anthropic non addestra con i dati API per impostazione predefinita, ma conserva il feedback segnalato fino a 5 anni.
L'elaborazione non è addestramento. Prima la differenza.
Quasi ogni fornitore di IA nel supporto scrive la frase da qualche parte: nessun addestramento sui tuoi dati. Suona bene. Ma ti aiuta solo se sai cosa significa tecnicamente. Perché dietro questa promessa si nascondono due processi completamente diversi che spesso vengono confusi in una sola frase.
- Elaborazione: i tuoi dati vengono usati in tempo reale per completare un'attività. Arriva una domanda di un cliente, il modello fornisce una risposta, fatto. Una volta completata l'attività, i dati non ritornano in un sistema di apprendimento.
- Addestramento: i tuoi dati vengono inseriti in un modello per modificarlo in modo permanente. I tuoi input diventano parte della conoscenza del modello. Non c'è modo di tornare indietro. Estrarre nuovamente il contenuto significherebbe riaddestrare il modello, e nessuno ha il budget per farlo.
La differenza è quindi la reversibilità. L'elaborazione la lasci passare come una richiesta nella posta in arrivo. L'addestramento incorpora i dati in modo definitivo. È esattamente per questo che la promessa conta, ed è esattamente per questo che non vale nulla come frase isolata su una pagina di marketing. La frase non ha un perimetro, non nomina subprocessori, né periodi di conservazione, e non porta la firma di nessuno1.
È quindi agli elementi verificabili che ancori la promessa. Quali fornitori ricevono i dati, per quanto tempo viene conservato ogni tipo, se l'esclusione copre anche le versioni anonimizzate e aggregate, e se tutto questo è riportato nel contratto firmato1. Le sezioni successive passano in rassegna questi punti nell'ordine.
RAG: il modello non impara dalle tue conversazioni.
Nel supporto clienti, la promessa si basa di solito su un'architettura chiamata Retrieval-Augmented Generation, o RAG. Il principio: il modello linguistico non viene addestrato sui tuoi dati. Al contrario, per ogni domanda il sistema cerca in una fonte di conoscenza esterna e incorpora le informazioni trovate nella risposta2.

- 01Retrieve (recuperare): la richiesta del cliente viene convertita in una rappresentazione vettoriale e confrontata con il database vettoriale della tua knowledge base. La ricerca trova le sezioni più simili alla domanda2.
- 02Augment (arricchire): le sezioni trovate vengono inserite nel contesto della richiesta. Il prompt contiene ora la domanda originale più i passaggi pertinenti2.
- 03Generate (generare): il modello formula una risposta in linguaggio naturale da questo contesto. Dopodiché il processo è completo; nulla ritorna verso alcun addestramento2.
L'effetto collaterale è almeno altrettanto importante per te quanto la privacy: poiché il modello risponde solo dalle sezioni recuperate, ogni risposta può citare la sua fonte. Questo limita anche le allucinazioni, perché il sistema non improvvisa a memoria ma attinge dalla tua knowledge base curata2. Come una pipeline RAG viene protetta in dettaglio contro le allucinazioni lo abbiamo descritto separatamente: Prevenire le allucinazioni.
Isolamento dei dati: separazione dei tenant e i suoi limiti.
Il secondo pilastro tecnico è l'isolamento. I fornitori separano i dati di diversi clienti in modo che la tua knowledge base e le tue conversazioni non vengano mescolate con quelle di altri tenant. Due livelli sono comuni3:
- Separazione dei tenant: i dati di diversi clienti vengono elaborati in ambienti logicamente separati. Ogni tenant vede solo il proprio contenuto.
- Isolamento dei tenant: l'isolamento opera anche a livello di infrastruttura — sistemicamente o fisicamente — così che la commistione è tecnicamente esclusa.
Entrambi hanno senso e innalzano considerevolmente il livello di protezione. Ma tieni a mente due limiti. Primo: la pseudonimizzazione non è l'anonimizzazione. Sostituire attributi identificativi con identificatori non rende i dati anonimi. Finché la re-identificazione rimane almeno teoricamente possibile, i dati continuano a essere considerati personali e rientrano interamente nel GDPR3.
Secondo: le misure tecniche non sostituiscono una base giuridica. Il GDPR richiede che ogni trattamento di dati personali si fondi su una base giuridica ai sensi dell'art. 6, indipendentemente da quanto bene i dati siano tecnicamente protetti. L'isolamento può rendere un'operazione di trattamento più sicura, ma non più lecita3. Per l'uso nel servizio clienti questo significa: oltre alla tecnologia hai bisogno anche di una solida base giuridica e di un contratto pulito4.
Il DPA: dove la promessa diventa vincolante.
Non appena un fornitore di IA elabora dati personali su istruzione per conto della tua azienda, hai bisogno di un accordo sul trattamento dei dati ai sensi dell'art. 28 del GDPR, o DPA. Il DPA è il luogo in cui la promessa passa dal testo di marketing all'obbligo contrattuale. Questi contenuti obbligatori dovresti verificare:
- Vincolo di istruzione: il fornitore tratta i dati solo secondo le tue istruzioni documentate.
- Riservatezza: le persone coinvolte sono vincolate da obblighi di riservatezza.
- Regola di cancellazione: cosa succede alla fine del contratto, entro quale termine i dati vengono cancellati o restituiti.
- Subprocessori: quali subprocessori esistono, in quali condizioni vengono ingaggiati e quali obblighi vengono loro trasferiti.
Il punto critico con i fornitori di IA è l'ultimo. L'esclusione dell'addestramento deve essere registrata per ogni subprocessore, non solo per il fornitore principale. Perché il trattamento effettivo del modello di solito avviene tramite un servizio di modello o di embedding più avanti nella catena. Quanto sia ampia la lacuna in pratica lo mostra un'analisi di DataGrail del 2026: su 2.400 sistemi software analizzati, forse il 63,6% dei fornitori con funzionalità IA potrebbe non divulgare i subprocessori esterni nei propri documenti legali5.
Ciò non significa che tutti questi fornitori si stiano addestrando in segreto. Alcuni semplicemente non ne hanno nessuno. Ma dall'esterno non puoi distinguere i due gruppi finché la catena di fornitura rimane senza nome1. Una checklist per la selezione dei fornitori secondo i criteri del GDPR l'abbiamo compilata in un articolo separato: IA conforme al GDPR nel servizio clienti.
A cosa si impegnano davvero OpenAI e Anthropic.
Se il tuo fornitore di supporto usa un modello di grandi dimensioni come front end, la tua posizione dipende anche dagli impegni di quel modello. Possono essere verificati sul testo esatto.
OpenAI dichiara: per impostazione predefinita, nessun dato di ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu e della piattaforma API — né input né output — viene utilizzato per addestrare o migliorare i modelli. Per le organizzazioni qualificate esistono inoltre controlli sulla conservazione fino a una politica di zero data retention sulla piattaforma API6.
Anthropic si impegna allo stesso modo per i prodotti commerciali come Claude for Work e l'API Anthropic: input e output non vengono utilizzati per l'addestramento per impostazione predefinita. C'è però un'eccezione che dovresti conoscere. Se gli utenti segnalano feedback tramite il pulsante pollice su o pollice giù, Anthropic conserva l'intera conversazione associata fino a 5 anni nel backend sicuro e può utilizzare quel feedback per l'addestramento7.
Per la tua valutazione questo significa: chiedi non solo quale modello usa il fornitore, ma tramite quali endpoint, con quali impostazioni di conservazione, e se le funzioni di feedback per i clienti sono disabilitate o possono alimentare la catena di addestramento.
Limiti: log, metadati, analisi aggregate.
Ora la parte che la maggior parte delle pagine dei fornitori omette. Anche con una promessa sincera, rimane molto. Non è uno scandalo ma il normale funzionamento di un servizio online. Dovresti semplicemente saperlo prima di promettere o aspettarti una totale assenza di dati.
- Log operativi e di sicurezza: i file di log registrano chi ha avuto accesso a quale sistema e quando. Un periodo di conservazione fino a 90 giorni per fini di sicurezza informatica è considerato accettabile in materia di protezione dei dati; una conservazione più lunga solo con un interesse chiaramente prevalente. Il Commissario federale tedesco per la protezione dei dati ha indicato sei mesi come limite massimo di proporzionalità8.
- Metadati di fatturazione: timestamp, conteggi di token e latenza devono essere conservati, altrimenti nessuno può emettere una fattura. Questo sopravvive anche a un impegno di zero data retention che riguarda solo i contenuti1.
- Backup e report: i backup sopravvivono alla cancellazione delle singole conversazioni finché non vengono sovrascritti. E le analisi aggregate — come i tassi di risoluzione o le domande frequenti — nascono quasi sempre al di là del contenuto delle singole conversazioni1.
È esattamente per questo che la domanda utile da porre a un fornitore non è se ha dei log. Tutti li hanno. La domanda è quali tipi di dati conserva, per quanto tempo ciascuno, e se l'esclusione dell'addestramento copre anche le versioni derivate dei tuoi dati — ovvero i criteri della prima sezione1. Cosa fa la fatturazione basata sull'utilizzo con questi metadati lo abbiamo analizzato separatamente: Costi basati sull'utilizzo.
ComLayer come esempio. E la tua checklist.
Per concludere, un esempio concreto — il nostro. ComLayer elabora conversazioni, knowledge base, allegati e il trattamento IA in regioni europee. La registrazione, il pagamento, l'invio di email e la ricerca semantica passano attraverso servizi negli USA, e nominiamo questi fornitori invece di nasconderli. Non analizziamo i tuoi contenuti per addestrare modelli proprietari, e i fornitori di modelli e di embedding utilizzati si sono impegnati contrattualmente alla stessa esclusione. Il DPA lo registra per ogni fornitore.
Non è un caso speciale ma ciò che puoi richiedere a qualsiasi fornitore. Queste domande aiutano nella valutazione:
- Chi sono i subprocessori, per nome, inclusi i servizi di modello e di embedding?
- Per quanto tempo viene conservato ogni tipo di dato, in giorni, non in clausole?
- Qual è il SLA di cancellazione su richiesta, e copre i backup?
- L'esclusione dell'addestramento si applica anche ai dati anonimizzati, de-identificati e aggregati?
- È tutto riportato nel DPA firmato, con prevalenza sulle condizioni online?
Un fornitore che risponde a tutte le domande in un paragrafo fluido sta improvvisando. Un fornitore che risponde con nomi, cifre e riferimenti a clausole è già stato verificato prima1. I nostri piani e prezzi li trovi in modo trasparente sulla pagina dei prezzi.
Una nota finale: questo articolo non costituisce una consulenza legale. Contestualizza la tecnologia e la pratica contrattuale, ma non sostituisce una verifica individuale da parte di un esperto, tanto più che la responsabilità per le risposte errate dell'IA rimane all'operatore: Responsabilità per gli errori dell'IA.
Domande frequenti
Cosa significa esattamente "nessun addestramento sui dati dei clienti" tecnicamente?
Il fornitore elabora il tuo contenuto solo per fornire il risultato richiesto: una risposta, un riassunto, un'estrazione. I dati non confluiscono nell'addestramento, nel fine-tuning, nella valutazione o nel benchmarking di un modello. La differenza rispetto all'elaborazione è la reversibilità: i dati elaborati possono essere cancellati; i dati inseriti in un modello non possono praticamente più essere rimossi.
Il modello di IA impara dalle conversazioni con i miei clienti?
Con un'architettura RAG, no. La richiesta del cliente viene convertita in una rappresentazione vettoriale e confrontata con la tua knowledge base. Le sezioni trovate vengono inserite nel contesto del prompt; il modello formula la risposta da questo. Dopo la risposta non è stato appreso nulla: il modello non conserva la conversazione come conoscenza.
La promessa "nessun addestramento" è sufficiente per il GDPR?
No. Le misure tecniche come la separazione dei tenant aumentano la sicurezza ma non sostituiscono una base giuridica ai sensi dell'art. 6 del GDPR. E la pseudonimizzazione non è l'anonimizzazione: finché la re-identificazione rimane teoricamente possibile, i dati continuano a essere considerati personali. La promessa deve essere registrata in aggiunta contrattualmente nel DPA.
Cosa deve contenere un DPA con un fornitore di IA?
Ai sensi dell'art. 28(3) del GDPR come minimo: vincolo di istruzione, obblighi di riservatezza, misure tecniche e organizzative, obblighi di cancellazione e la designazione dei subprocessori. Sul tema dell'addestramento: l'esclusione deve essere registrata per ogni subprocessore, non solo per il fornitore principale. Secondo l'analisi di DataGrail su 2.400 sistemi software analizzati, forse il 63,6% dei fornitori con funzionalità IA potrebbe non divulgare i subprocessori esterni nei propri documenti legali.
OpenAI o Anthropic usano i miei dati di supporto per l'addestramento?
Per impostazione predefinita, no. OpenAI non usa i dati dei prodotti API e Business per addestrare o migliorare i modelli. Anthropic prende lo stesso impegno per i prodotti commerciali come l'API. Ma: con Anthropic, il feedback segnalato (pollice su o giù) inclusa la conversazione può essere conservato fino a 5 anni. Verifica anche i canali di feedback, non solo la clausola di addestramento.
Quali dati rimangono conservati nonostante la promessa?
Log operativi e di sicurezza, metadati di fatturazione come timestamp e conteggi di token, backup e analisi aggregate. I file di log sono necessari per la sicurezza informatica e il rilevamento delle intrusioni: fino a 90 giorni di conservazione è considerato accettabile in materia di protezione dei dati; una conservazione più lunga richiede un interesse giustificato. Lo zero data retention cambia poco qui perché i dati di fatturazione e il monitoraggio degli abusi sopravvivono.
Come valuto un fornitore di IA prima di firmare un contratto?
Con le cinque domande della checklist: subprocessori con nomi e sedi, periodi di conservazione per tipo di dato in giorni, SLA di cancellazione inclusi i backup, esclusione dell'addestramento anche per i dati anonimizzati e aggregati, e tutto riportato nel DPA firmato.