Sem treino nos teus dados: o que isso significa na prática
Sem treino nos dados dos clientes: o que a promessa significa técnica e contratualmente, onde se aplicam RAG, DPA e obrigações de eliminação, e onde se encontram os seus limites.
Martin Semmele

Conteúdo
- 01Processamento não é treino. A diferença primeiro.
- 02RAG: o modelo não aprende das tuas conversas.
- 03Isolamento de dados: separação de inquilinos e os seus limites.
- 04O DPA: onde a promessa se torna vinculativa.
- 05A que se comprometem realmente a OpenAI e a Anthropic.
- 06Limites: registos, metadados, análises agregadas.
- 07ComLayer como exemplo. E a tua lista de verificação.
- 08Perguntas frequentes
Conclusões principais
- Processamento e treino são coisas diferentes: só o treino torna os teus dados uma parte permanente do modelo; o processamento é reversível.
- O RAG recupera conhecimento da tua base de conhecimento para o contexto em cada consulta. O modelo não aprende nada da conversa.
- Segundo a DataGrail 2026, possivelmente 63,6% dos fornecedores de IA — de entre 2 400 sistemas de software analisados — pode não estar a divulgar subprocessadores externos nos seus documentos legais.
- Mesmo sem treino, os dados ficam: até 90 dias de armazenamento de registos para segurança informática é considerado aceitável.
- A Anthropic não treina com dados da API por defeito, mas armazena o feedback reportado até 5 anos.
Processamento não é treino. A diferença primeiro.
Quase todos os fornecedores de IA no suporte escrevem a frase em algum lado: sem treino nos teus dados. Soa bem. Mas só te ajuda se souberes o que significa tecnicamente. Porque por trás da promessa escondem-se dois processos completamente diferentes que muitas vezes são misturados numa só frase.
- Processamento: os teus dados são usados em tempo real para completar uma tarefa. Chega uma consulta de um cliente, o modelo fornece uma resposta, fim. Quando a tarefa está concluída, os dados não voltam para um sistema de aprendizagem.
- Treino: os teus dados são introduzidos num modelo para o modificar de forma permanente. As tuas entradas passam a fazer parte do conhecimento do modelo. Não há volta atrás. Extrair o conteúdo de novo significaria voltar a treinar o modelo, e ninguém tem orçamento para isso.
A diferença é, portanto, a reversibilidade. O processamento deixas passar como uma consulta na caixa de entrada. O treino incorpora os dados de forma definitiva. É exactamente por isso que a promessa importa, e é exactamente por isso que não vale nada como frase isolada numa página de marketing. A frase não tem âmbito, não nomeia subprocessadores, nem prazos de retenção, e não tem a assinatura de ninguém1.
É por isso que ancoras a promessa às partes verificáveis. Quais fornecedores recebem os dados, durante quanto tempo é conservado cada tipo, se a exclusão abrange também as versões anonimizadas e agregadas, e se tudo isto consta no contrato assinado1. As secções seguintes percorrem estes pontos por ordem.
RAG: o modelo não aprende das tuas conversas.
No suporte ao cliente, a promessa baseia-se normalmente numa arquitectura chamada Retrieval-Augmented Generation, ou RAG. O princípio: o modelo de linguagem não é treinado com os teus dados. Em vez disso, a cada pergunta o sistema procura numa fonte de conhecimento externa e incorpora as informações encontradas na resposta2.

- 01Retrieve (recuperar): a consulta do cliente é convertida numa representação vectorial e comparada com a base de dados vectorial da tua base de conhecimento. A pesquisa encontra as secções mais semelhantes à pergunta2.
- 02Augment (enriquecer): as secções encontradas são inseridas no contexto da consulta. O prompt contém agora a pergunta original mais as passagens relevantes2.
- 03Generate (gerar): o modelo formula uma resposta em linguagem natural a partir deste contexto. Depois o processo está concluído; nada volta para nenhum treino2.
O efeito secundário é pelo menos tão importante para ti como a privacidade: como o modelo só responde a partir das secções recuperadas, cada resposta pode citar a sua fonte. Isto também limita as alucinações, porque o sistema não improvisa de memória mas extrai do teu conhecimento mantido2. Como um pipeline RAG é protegido em detalhe contra alucinações descrevemo-lo separadamente: Prevenir alucinações.
Isolamento de dados: separação de inquilinos e os seus limites.
O segundo pilar técnico é o isolamento. Os fornecedores separam os dados de diferentes clientes para que a tua base de conhecimento e as tuas conversas não sejam misturadas com as de outros inquilinos. São comuns dois níveis3:
- Separação de inquilinos: os dados de diferentes clientes são processados em ambientes logicamente separados. Cada inquilino vê apenas o seu próprio conteúdo.
- Isolamento de inquilinos: o isolamento opera adicionalmente ao nível da infraestrutura — sistémica ou fisicamente — de modo que a mistura é tecnicamente excluída.
Ambos fazem sentido e elevam consideravelmente o nível de protecção. Mas tem em mente dois limites. Primeiro: a pseudonimização não é anonimização. Substituir atributos identificativos por identificadores não torna os dados anónimos. Enquanto a reidentificação permanecer pelo menos teoricamente possível, os dados continuam a ser considerados pessoais e ficam inteiramente abrangidos pelo RGPD3.
Segundo: as salvaguardas técnicas não substituem uma base jurídica. O RGPD exige que todo o tratamento de dados pessoais assente numa base jurídica ao abrigo do art. 6, independentemente de quão bem os dados estejam tecnicamente protegidos. O isolamento pode tornar uma operação de tratamento mais segura, mas não mais lícita3. Para utilização no serviço ao cliente isto significa: além da tecnologia precisas também de uma base jurídica sólida e de um contrato limpo4.
O DPA: onde a promessa se torna vinculativa.
Assim que um fornecedor de IA processa dados pessoais sob instrução em nome da tua empresa, precisas de um acordo de tratamento de dados ao abrigo do art. 28 do RGPD, ou DPA. O DPA é o sítio onde a promessa passa do texto de marketing para a obrigação contratual. Deves verificar estes conteúdos obrigatórios:
- Vinculação a instruções: o fornecedor trata os dados apenas de acordo com as tuas instruções documentadas.
- Confidencialidade: as pessoas envolvidas estão vinculadas por obrigações de confidencialidade.
- Regra de eliminação: o que acontece no fim do contrato, em que prazo os dados são eliminados ou devolvidos.
- Subprocessadores: quais subprocessadores existem, em que condições são contratados e que obrigações lhes são transferidas.
O ponto crítico com os fornecedores de IA é o último. A exclusão do treino deve ser registada para cada subprocessador, não apenas para o fornecedor principal. Porque o processamento efectivo do modelo normalmente decorre através de um serviço de modelo ou de embedding mais atrás na cadeia. A dimensão da lacuna na prática é demonstrada por uma análise da DataGrail de 2026: de 2 400 sistemas de software analisados, possivelmente 63,6% dos fornecedores com funcionalidades de IA pode não estar a divulgar subprocessadores externos nos seus documentos legais5.
Isso não significa que todos estes fornecedores estejam a treinar em segredo. Alguns simplesmente não têm nenhum. Mas do exterior não consegues distinguir os dois grupos enquanto a cadeia de fornecimento permanecer sem nome1. Uma lista de verificação para a selecção de fornecedores segundo critérios do RGPD compilámo-la num artigo separado: IA conforme com o RGPD no serviço ao cliente.
A que se comprometem realmente a OpenAI e a Anthropic.
Se o teu fornecedor de suporte usa um modelo grande como front end, a tua posição depende também dos compromissos desse modelo. Podem ser verificados no texto exacto.
A OpenAI afirma: por defeito, nenhum dado do ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu e da plataforma API — nem entradas nem saídas — é usado para treinar ou melhorar os modelos. Para organizações qualificadas existem adicionalmente controlos de retenção até uma política de zero retenção de dados na plataforma API6.
A Anthropic compromete-se ao mesmo para produtos comerciais como o Claude for Work e a API Anthropic: entradas e saídas não são usadas para treino por defeito. Há, no entanto, uma excepção que deves conhecer. Se os utilizadores reportarem feedback através do botão polegar para cima ou para baixo, a Anthropic armazena toda a conversa associada até 5 anos no back-end seguro e pode usar esse feedback para treino7.
Para a tua avaliação isto significa: pergunta não apenas que modelo usa o fornecedor, mas através de que endpoints, com que configurações de retenção, e se as funções de feedback para clientes estão desactivadas ou podem alimentar a cadeia de treino.
Limites: registos, metadados, análises agregadas.
Agora a parte que a maioria das páginas dos fornecedores omite. Mesmo com uma promessa sincera, muito fica. Não é um escândalo mas o funcionamento normal de um serviço online. Simplesmente deves saber isto antes de prometer ou esperar uma ausência total de dados.
- Registos operacionais e de segurança: os ficheiros de registo anotam quem acedeu a que sistema quando. Um período de armazenamento até 90 dias para fins de segurança informática é considerado aceitável em matéria de protecção de dados; armazenamento mais longo apenas com um interesse claramente prevalecente. O Comissário Federal Alemão para a Protecção de Dados designou seis meses como limite máximo de proporcionalidade8.
- Metadados de facturação: carimbos de data/hora, contagens de tokens e latência têm de ser armazenados, caso contrário ninguém te pode emitir uma factura. Isto sobrevive mesmo a um compromisso de zero retenção de dados que apenas cobre conteúdo1.
- Cópias de segurança e relatórios: as cópias de segurança sobrevivem à eliminação de conversas individuais até serem sobrescritas. E as análises agregadas — como taxas de resolução ou perguntas frequentes — surgem quase sempre para além do conteúdo de conversas individuais1.
É exactamente por isso que a pergunta útil a um fornecedor não é se tem registos. Todos têm registos. A pergunta é que tipos de dados armazena, durante quanto tempo cada um, e se a exclusão do treino abrange também versões derivadas dos teus dados — ou seja, os critérios da primeira secção1. O que a facturação baseada em utilização faz com esses metadados analisámos separadamente: Custos baseados em utilização.
ComLayer como exemplo. E a tua lista de verificação.
Para terminar, um exemplo concreto — o nosso. A ComLayer processa conversas, base de conhecimento, anexos e o processamento de IA em regiões europeias. O registo, o pagamento, o envio de e-mails e a pesquisa semântica funcionam através de serviços nos EUA, e nomeamos estes fornecedores em vez de os esconder. Não analisamos os teus conteúdos para treinar modelos proprietários, e os fornecedores de modelos e embeddings utilizados comprometeram-se contratualmente à mesma exclusão. O DPA regista isso por fornecedor.
Não é um caso especial, mas sim o que podes exigir de qualquer fornecedor. Estas perguntas ajudam na avaliação:
- Quem são os subprocessadores, por nome, incluindo os serviços de modelo e embedding?
- Durante quanto tempo é retido cada tipo de dados, em dias, não em cláusulas?
- Qual é o SLA de eliminação a pedido, e abrange as cópias de segurança?
- A exclusão do treino aplica-se também a dados anonimizados, desidentificados e agregados?
- Está tudo no DPA assinado, com prevalência sobre as condições online?
Um fornecedor que responde a todas as perguntas num parágrafo fluido está a adivinhar. Um fornecedor que responde com nomes, números e referências de cláusulas já foi auditado antes1. Os nossos planos e preços encontras de forma transparente na página de preços.
Uma nota final: este artigo não constitui aconselhamento jurídico. Contextualiza a tecnologia e a prática contratual, mas não substitui uma revisão individual por um especialista, tanto mais que a responsabilidade por respostas incorrectas da IA fica com o operador: Responsabilidade por erros de IA.
Perguntas frequentes
O que significa exactamente "sem treino nos dados dos clientes" do ponto de vista técnico?
O fornecedor processa o teu conteúdo apenas para entregar o resultado solicitado: uma resposta, um resumo, uma extracção. Os dados não fluem para o treino, o ajuste fino, a avaliação ou o benchmarking de um modelo. A diferença em relação ao processamento é a reversibilidade: os dados processados podem ser eliminados; os dados introduzidos num modelo já não podem ser praticamente removidos.
O modelo de IA aprende com as conversas com os meus clientes?
Com uma arquitectura RAG, não. A consulta do cliente é convertida numa representação vectorial e comparada com a tua base de conhecimento. As secções encontradas são inseridas no contexto do prompt; o modelo formula a resposta a partir daí. Após a resposta, nada foi aprendido: o modelo não retém a conversa como conhecimento.
A promessa de "sem treino" é suficiente para o RGPD?
Não. As salvaguardas técnicas como a separação de inquilinos aumentam a segurança mas não substituem uma base jurídica ao abrigo do art. 6 do RGPD. E a pseudonimização não é anonimização: enquanto a reidentificação permanecer teoricamente possível, os dados continuam a ser considerados pessoais. A promessa deve ser adicionalmente registada contratualmente no DPA.
O que deve conter um DPA com um fornecedor de IA?
Ao abrigo do art. 28(3) do RGPD pelo menos: vinculação a instruções, obrigações de confidencialidade, medidas técnicas e organizativas, obrigações de eliminação e a designação dos subprocessadores. Em matéria de treino: a exclusão deve ser registada para cada subprocessador, não apenas para o fornecedor principal. Segundo a análise da DataGrail sobre 2 400 sistemas de software analisados, possivelmente 63,6% dos fornecedores com funcionalidades de IA pode não estar a divulgar subprocessadores externos nos seus documentos legais.
A OpenAI ou a Anthropic usam os meus dados de suporte para treino?
Por defeito, não. A OpenAI não usa dados dos produtos API e Business para treinar ou melhorar os modelos. A Anthropic assume o mesmo compromisso para produtos comerciais como a API. Mas: com a Anthropic, o feedback reportado (polegar para cima ou para baixo) incluindo a conversa pode ser armazenado até 5 anos. Verifica também os canais de feedback, não apenas a cláusula de treino.
Que dados ficam armazenados apesar da promessa?
Registos operacionais e de segurança, metadados de facturação como carimbos de data/hora e contagens de tokens, cópias de segurança e análises agregadas. Os ficheiros de registo são necessários para segurança informática e detecção de intrusões: até 90 dias de armazenamento é considerado aceitável em matéria de protecção de dados; armazenamento mais longo requer um interesse justificado. A zero retenção de dados pouco muda aqui porque os dados de facturação e o monitoramento de abusos sobrevivem.
Como avalio um fornecedor de IA antes de assinar um contrato?
Com as cinco perguntas da lista de verificação: subprocessadores com nomes e localizações, períodos de retenção por tipo de dados em dias, SLA de eliminação incluindo cópias de segurança, exclusão do treino também para dados anonimizados e agregados, e tudo no DPA assinado.