Pas d'entraînement sur tes données : ce que cela signifie concrètement
Pas d'entraînement sur les données clients : ce que la promesse signifie sur le plan technique et contractuel, où le RAG, le DPA et les obligations de suppression s'appliquent, et où se situent leurs limites.
Martin Semmele

Sommaire
- 01Le traitement n'est pas l'entraînement. La différence d'abord.
- 02RAG : le modèle n'apprend pas de tes conversations.
- 03Isolation des données : séparation des locataires et ses limites.
- 04Le DPA : là où la promesse devient contraignante.
- 05Ce qu'OpenAI et Anthropic s'engagent réellement à respecter.
- 06Limites : journaux, métadonnées, analyses agrégées.
- 07ComLayer comme exemple. Et ta liste de vérification.
- 08Questions fréquentes
Points clés
- Le traitement et l'entraînement sont distincts : seul l'entraînement fait de tes données une partie permanente du modèle ; le traitement est réversible.
- Le RAG récupère des connaissances de ta base de connaissances dans le contexte pour chaque requête. Le modèle n'apprend rien de la conversation.
- Selon DataGrail 2026, peut-être 63,6 % des fournisseurs d'IA — parmi 2 400 systèmes logiciels analysés — ne divulguent pas leurs sous-traitants externes dans leurs documents juridiques.
- Même sans entraînement, des données subsistent : un stockage des journaux allant jusqu'à 90 jours à des fins de sécurité informatique est considéré comme acceptable.
- Anthropic n'entraîne pas avec les données API par défaut, mais stocke les retours signalés jusqu'à 5 ans.
Le traitement n'est pas l'entraînement. La différence d'abord.
Presque chaque fournisseur d'IA dans le support écrit cette phrase quelque part : pas d'entraînement sur tes données. Ça sonne bien. Mais ça ne t'aide que si tu sais ce que ça signifie techniquement. Car derrière cette promesse se cachent deux processus complètement différents qui sont souvent confondus dans une seule phrase.
- Traitement : tes données sont utilisées en temps réel pour accomplir une tâche. Une question client arrive, le modèle fournit une réponse, c'est tout. Une fois la tâche terminée, les données ne retournent pas dans un système d'apprentissage.
- Entraînement : tes données sont injectées dans un modèle pour le modifier de façon permanente. Tes entrées deviennent une partie du savoir du modèle. Il n'y a pas de retour en arrière. Extraire à nouveau le contenu signifierait réentraîner le modèle, et personne n'a le budget pour ça.
La différence est donc la réversibilité. Le traitement, tu le laisses passer comme une requête dans la boîte de réception. L'entraînement intègre les données de façon définitive. C'est précisément pourquoi la promesse importe, et pourquoi elle ne vaut rien comme phrase isolée sur une page marketing. La phrase n'a pas de périmètre, ne nomme aucun sous-traitant, aucun délai de conservation, et ne porte la signature de personne1.
C'est donc aux éléments vérifiables que tu ancres la promesse. Quels fournisseurs reçoivent les données, combien de temps chaque type est conservé, si l'exclusion couvre aussi les versions anonymisées et agrégées, et si tout cela figure dans le contrat signé1. Les sections suivantes passent en revue ces points dans l'ordre.
RAG : le modèle n'apprend pas de tes conversations.
Dans le support client, la promesse repose généralement sur une architecture appelée Retrieval-Augmented Generation, ou RAG. Le principe : le modèle de langage n'est pas entraîné sur tes données. À la place, pour chaque question, le système recherche dans une source de connaissances externe et intègre les informations trouvées dans la réponse2.

- 01Retrieve (récupérer) : la requête du client est convertie en représentation vectorielle et confrontée à la base de données vectorielle de ta base de connaissances. La recherche trouve les sections les plus similaires à la question2.
- 02Augment (enrichir) : les sections trouvées sont insérées dans le contexte de la requête. Le prompt contient désormais la question initiale et les passages pertinents2.
- 03Generate (générer) : le modèle formule une réponse en langage naturel à partir de ce contexte. Ensuite le processus est terminé ; rien ne retourne vers un quelconque entraînement2.
L'effet secondaire est au moins aussi important pour toi que la confidentialité : comme le modèle ne répond qu'à partir des sections récupérées, chaque réponse peut citer sa source. Cela limite aussi les hallucinations, car le système n'improvise pas de mémoire mais s'appuie sur tes connaissances maintenues2. Comment un pipeline RAG est protégé en détail contre les hallucinations, nous l'avons décrit séparément : Prévenir les hallucinations.
Isolation des données : séparation des locataires et ses limites.
Le second pilier technique est l'isolation. Les fournisseurs séparent les données de différents clients afin que ta base de connaissances et tes conversations ne soient pas mélangées avec celles d'autres locataires. Deux niveaux sont courants3 :
- Séparation des locataires : les données de différents clients sont traitées dans des environnements logiquement séparés. Chaque locataire ne voit que son propre contenu.
- Isolation des locataires : l'isolation opère en plus au niveau de l'infrastructure — systémiquement ou physiquement — de sorte que le mélange est techniquement exclu.
Les deux font sens et élèvent considérablement le niveau de protection. Mais garde deux limites à l'esprit. Premièrement : la pseudonymisation n'est pas l'anonymisation. Remplacer des attributs identifiants par des identifiants ne rend pas les données anonymes. Tant que la réidentification reste au moins théoriquement possible, les données continuent d'être considérées comme personnelles et relèvent entièrement du RGPD3.
Deuxièmement : les mesures techniques ne remplacent pas une base juridique. Le RGPD exige que tout traitement de données personnelles repose sur une base juridique au titre de l'art. 6, peu importe la qualité de la protection technique des données. L'isolation peut rendre un traitement plus sûr, mais pas plus licite3. Pour l'usage dans le service client, cela signifie : en plus de la technologie, tu as besoin d'une base juridique solide et d'un contrat propre4.
Le DPA : là où la promesse devient contraignante.
Dès qu'un fournisseur d'IA traite des données personnelles sous instruction au nom de ton entreprise, tu as besoin d'un accord de traitement des données au titre de l'art. 28 du RGPD, ou DPA. Le DPA est l'endroit où la promesse passe du texte marketing à l'obligation contractuelle. Ces éléments obligatoires devraient être vérifiés :
- Contrainte d'instruction : le fournisseur traite les données uniquement selon tes instructions documentées.
- Confidentialité : les personnes concernées sont soumises à des obligations de confidentialité.
- Règle de suppression : que se passe-t-il à la fin du contrat, dans quel délai les données sont supprimées ou restituées.
- Sous-traitants : quels sous-traitants existent, dans quelles conditions ils interviennent et quelles obligations leur sont transférées.
Le point critique avec les fournisseurs d'IA est le dernier. L'exclusion de l'entraînement doit être enregistrée pour chaque sous-traitant, pas seulement pour le fournisseur principal. Car le traitement effectif du modèle passe généralement par un service de modèle ou d'embedding plus loin dans la chaîne. L'ampleur de la lacune en pratique est illustrée par une analyse de DataGrail de 2026 : parmi 2 400 systèmes logiciels analysés, peut-être 63,6 % des fournisseurs disposant de fonctionnalités IA ne divulguent pas leurs sous-traitants externes dans leurs documents juridiques5.
Cela ne signifie pas que tous ces fournisseurs s'entraînent en secret. Certains n'en ont tout simplement aucun. Mais de l'extérieur, tu ne peux pas distinguer les deux groupes tant que la chaîne d'approvisionnement reste sans nom1. Une liste de vérification pour la sélection des fournisseurs selon les critères du RGPD, nous l'avons compilée dans un article séparé : IA conforme au RGPD dans le service client.
Ce qu'OpenAI et Anthropic s'engagent réellement à respecter.
Si ton fournisseur de support utilise un grand modèle en frontal, ta position dépend aussi des engagements de ce modèle. Ils peuvent être vérifiés sur le texte exact.
OpenAI indique : par défaut, aucune donnée de ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu et de la plateforme API — ni les entrées ni les sorties — n'est utilisée pour entraîner ou améliorer les modèles. Pour les organisations éligibles, il existe en outre des contrôles de rétention allant jusqu'à une politique de zéro rétention des données sur la plateforme API6.
Anthropic prend le même engagement pour les produits commerciaux comme Claude for Work et l'API Anthropic : les entrées et sorties ne sont par défaut pas utilisées pour l'entraînement. Il y a cependant une exception que tu dois connaître. Si les utilisateurs signalent un retour via le bouton pouce vers le haut ou vers le bas, Anthropic stocke toute la conversation associée jusqu'à 5 ans dans le back-end sécurisé et peut utiliser ce retour pour l'entraînement7.
Pour ton évaluation, cela signifie : demande non seulement quel modèle utilise le fournisseur, mais via quels endpoints, avec quels paramètres de rétention, et si les fonctions de retour pour les clients sont désactivées ou peuvent alimenter la chaîne d'entraînement.
Limites : journaux, métadonnées, analyses agrégées.
Maintenant la partie que la plupart des pages des fournisseurs omettent. Même avec une promesse sincère, beaucoup subsiste. Ce n'est pas un scandale mais le fonctionnement normal d'un service en ligne. Tu devrais simplement le savoir avant de promettre ou d'attendre une absence totale de données.
- Journaux opérationnels et de sécurité : les fichiers journaux enregistrent qui a accédé à quel système et quand. Une durée de stockage allant jusqu'à 90 jours à des fins de sécurité informatique est considérée comme acceptable en matière de protection des données ; un stockage plus long seulement avec un intérêt clairement prépondérant. Le Commissaire fédéral allemand à la protection des données et à la liberté de l'information a désigné six mois comme limite supérieure de la proportionnalité8.
- Métadonnées de facturation : les horodatages, les comptages de tokens et la latence doivent être stockés, sinon personne ne peut t'émettre de facture. Cela survit même à un engagement de zéro rétention qui ne porte que sur le contenu1.
- Sauvegardes et rapports : les sauvegardes survivent à la suppression des conversations individuelles jusqu'à ce qu'elles soient écrasées. Et les analyses agrégées — comme les taux de résolution ou les questions fréquentes — naissent presque toujours au-delà du contenu des conversations individuelles1.
C'est exactement pourquoi la question utile à poser à un fournisseur n'est pas de savoir s'il a des journaux. Tout le monde a des journaux. La question est de savoir quels types de données il stocke, pour combien de temps chacun, et si l'exclusion de l'entraînement couvre aussi les versions dérivées de tes données — c'est-à-dire les critères de la première section1. Ce que la facturation à l'usage fait avec ces métadonnées, nous l'avons détaillé séparément : Coûts basés sur l'usage.
ComLayer comme exemple. Et ta liste de vérification.
Pour finir, un exemple concret — le nôtre. ComLayer traite les conversations, la base de connaissances, les pièces jointes et le traitement IA dans des régions européennes. L'inscription, le paiement, l'envoi d'e-mails et la recherche sémantique passent par des services aux États-Unis, et nous nommons ces fournisseurs plutôt que de les dissimuler. Nous n'analysons pas tes contenus pour entraîner des modèles propriétaires, et les fournisseurs de modèles et d'embeddings utilisés se sont contractuellement engagés à la même exclusion. Le DPA l'enregistre pour chaque fournisseur.
Ce n'est pas un cas particulier mais ce que tu peux exiger de tout fournisseur. Ces questions aident lors de l'évaluation :
- Qui sont les sous-traitants, par nom, y compris les services de modèle et d'embedding ?
- Combien de temps chaque type de donnée est-il conservé, en jours, pas en clauses ?
- Quel est le SLA de suppression sur demande, et couvre-t-il les sauvegardes ?
- L'exclusion de l'entraînement s'applique-t-elle aussi aux données anonymisées, désidentifiées et agrégées ?
- Tout est-il mentionné dans le DPA signé, avec primauté sur les conditions en ligne ?
Un fournisseur qui répond à toutes les questions dans un paragraphe fluide improvise. Un fournisseur qui répond avec des noms, des chiffres et des références de clauses a déjà été audité1. Nos offres et tarifs sont disponibles en toute transparence sur la page des tarifs.
Une note finale : cet article ne constitue pas un conseil juridique. Il contextualise la technologie et les pratiques contractuelles, mais ne remplace pas un examen individuel par un spécialiste, d'autant plus que la responsabilité des réponses incorrectes de l'IA incombe à l'opérateur : Responsabilité pour les erreurs d'IA.
Questions fréquentes
Que signifie exactement "pas d'entraînement sur les données clients" sur le plan technique ?
Le fournisseur traite ton contenu uniquement pour fournir le résultat demandé : une réponse, un résumé, une extraction. Les données ne transitent pas vers l'entraînement, le fine-tuning, l'évaluation ou le benchmarking d'un modèle. La différence avec le traitement est la réversibilité : les données traitées peuvent être supprimées ; les données injectées dans un modèle ne peuvent pratiquement plus être retirées.
Le modèle d'IA apprend-il des conversations avec mes clients ?
Avec une architecture RAG, non. La requête du client est convertie en représentation vectorielle et confrontée à ta base de connaissances. Les sections trouvées sont insérées dans le contexte du prompt ; le modèle formule la réponse à partir de là. Après la réponse, rien n'a été appris : le modèle ne retient pas la conversation comme connaissance.
La promesse "pas d'entraînement" suffit-elle pour le RGPD ?
Non. Les mesures techniques comme la séparation des locataires renforcent la sécurité mais ne remplacent pas une base juridique au titre de l'art. 6 du RGPD. Et la pseudonymisation n'est pas l'anonymisation : tant que la réidentification reste théoriquement possible, les données continuent d'être considérées comme personnelles. La promesse doit en outre être enregistrée contractuellement dans le DPA.
Que doit contenir un DPA avec un fournisseur d'IA ?
Conformément à l'art. 28(3) du RGPD au minimum : contrainte d'instruction, obligations de confidentialité, mesures techniques et organisationnelles, obligations de suppression et désignation des sous-traitants. Sur le sujet de l'entraînement : l'exclusion doit être enregistrée pour chaque sous-traitant, pas seulement pour le fournisseur principal. Selon l'analyse DataGrail portant sur 2 400 systèmes logiciels analysés, peut-être 63,6 % des fournisseurs disposant de fonctionnalités IA ne divulguent pas leurs sous-traitants externes dans leurs documents juridiques.
OpenAI ou Anthropic utilisent-ils mes données de support pour l'entraînement ?
Par défaut, non. OpenAI n'utilise pas les données des produits API et Business pour entraîner ou améliorer les modèles. Anthropic prend le même engagement pour les produits commerciaux comme l'API. Mais : chez Anthropic, les retours signalés (pouce vers le haut ou vers le bas) incluant la conversation peuvent être stockés jusqu'à 5 ans. Vérifie aussi les canaux de retour, pas seulement la clause d'entraînement.
Quelles données restent stockées malgré la promesse ?
Les journaux opérationnels et de sécurité, les métadonnées de facturation comme les horodatages et les comptages de tokens, les sauvegardes et les analyses agrégées. Les fichiers journaux sont nécessaires pour la sécurité informatique et la détection des intrusions : jusqu'à 90 jours de stockage est considéré comme acceptable en matière de protection des données ; un stockage plus long nécessite un intérêt justifié. La zéro rétention des données change peu ici car les données de facturation et la surveillance des abus survivent.
Comment évaluer un fournisseur d'IA avant de signer un contrat ?
Avec les cinq questions de la liste de vérification : sous-traitants avec noms et lieux, délais de conservation par type de donnée en jours, SLA de suppression incluant les sauvegardes, exclusion de l'entraînement aussi pour les données anonymisées et agrégées, et tout mentionné dans le DPA signé.