Sin entrenamiento con tus datos: qué significa eso en la práctica
Sin entrenamiento con datos de clientes: qué significa la promesa técnica y contractualmente, dónde aplican RAG, DPA y las obligaciones de eliminación, y dónde están sus límites.
Martin Semmele

Contenido
- 01El procesamiento no es entrenamiento. La diferencia primero.
- 02RAG: el modelo no aprende de tus conversaciones.
- 03Aislamiento de datos: separación de inquilinos y sus límites.
- 04El DPA: donde la promesa se vuelve vinculante.
- 05Qué se comprometen realmente a hacer OpenAI y Anthropic.
- 06Límites: registros, metadatos, análisis agregados.
- 07ComLayer como ejemplo. Y tu lista de comprobación.
- 08Preguntas frecuentes
Conclusiones clave
- El procesamiento y el entrenamiento son distintos: solo el entrenamiento convierte tus datos en parte permanente del modelo; el procesamiento es reversible.
- El RAG recupera conocimiento de tu base de conocimiento al contexto en cada consulta. El modelo no aprende nada de la conversación.
- Según DataGrail 2026, posiblemente el 63,6 % de los proveedores de IA — de 2.400 sistemas de software analizados — puede que no divulguen subprocesadores externos en sus documentos legales.
- Incluso sin entrenamiento, permanecen datos: hasta 90 días de almacenamiento de registros para seguridad informática se considera aceptable.
- Anthropic no entrena con datos de la API por defecto, pero almacena el feedback reportado hasta 5 años.
El procesamiento no es entrenamiento. La diferencia primero.
Casi todos los proveedores de IA en soporte escriben la frase en algún lugar: sin entrenamiento con tus datos. Suena bien. Pero solo te ayuda si sabes qué significa técnicamente. Porque detrás de la promesa se esconden dos procesos completamente diferentes que a menudo se mezclan en una sola frase.
- Procesamiento: tus datos se usan en tiempo real para completar una tarea. Llega una consulta de un cliente, el modelo ofrece una respuesta, fin. Cuando la tarea está completada, los datos no vuelven a un sistema de aprendizaje.
- Entrenamiento: tus datos se introducen en un modelo para modificarlo de forma permanente. Tus entradas pasan a formar parte del conocimiento del modelo. No hay vuelta atrás. Extraer el contenido de nuevo significaría volver a entrenar el modelo, y nadie tiene presupuesto para eso.
La diferencia es, por tanto, la reversibilidad. El procesamiento lo dejas pasar como una consulta en la bandeja de entrada. El entrenamiento incorpora los datos de forma permanente. Por eso la promesa importa, y por eso no vale nada como frase suelta en una página de marketing. La frase no tiene ámbito, no nombra subprocesadores ni plazos de retención, y nadie la firma1.
Por eso anclas la promesa a las partes verificables. Qué proveedores reciben los datos, cuánto tiempo se conserva cada tipo, si la exclusión también aplica a versiones anonimizadas y agregadas, y si todo esto consta en el contrato firmado1. Las siguientes secciones recorren estos puntos uno a uno.
RAG: el modelo no aprende de tus conversaciones.
En soporte al cliente, la promesa suele apoyarse en una arquitectura llamada Retrieval-Augmented Generation, o RAG. El principio: el modelo de lenguaje no se entrena con tus datos. En cambio, con cada pregunta el sistema busca en una fuente de conocimiento externa e incorpora la información encontrada en la respuesta2.

- 01Retrieve (recuperar): la consulta del cliente se convierte en una representación vectorial y se coteja con la base de datos vectorial de tu base de conocimiento. La búsqueda encuentra las secciones más similares a la pregunta2.
- 02Augment (enriquecer): las secciones encontradas se insertan en el contexto de la consulta. El prompt contiene ahora la pregunta original más los fragmentos relevantes2.
- 03Generate (generar): el modelo formula una respuesta en lenguaje natural a partir de este contexto. Después el proceso está completo; nada vuelve a ningún entrenamiento2.
El efecto secundario es al menos tan importante para ti como la privacidad: como el modelo solo responde a partir de las secciones recuperadas, cada respuesta puede citar su fuente. Esto también limita las alucinaciones, porque el sistema no improvisa de memoria sino que extrae de tu conocimiento mantenido2. Cómo se protege en detalle un pipeline RAG contra las alucinaciones lo hemos descrito por separado: Prevenir alucinaciones.
Aislamiento de datos: separación de inquilinos y sus límites.
El segundo pilar técnico es el aislamiento. Los proveedores separan los datos de distintos clientes para que tu base de conocimiento y tus conversaciones no se mezclen con las de otros inquilinos. Son habituales dos niveles3:
- Separación de inquilinos: los datos de distintos clientes se procesan en entornos lógicamente separados. Cada inquilino ve solo su propio contenido.
- Aislamiento de inquilinos: el aislamiento también opera a nivel de infraestructura — sistémica o físicamente — de modo que la mezcla queda técnicamente descartada.
Ambos tienen sentido y elevan considerablemente el nivel de protección. Pero ten en cuenta dos límites. Primero: la seudonimización no es anonimización. Sustituir atributos identificadores por identificadores no convierte los datos en anónimos. Mientras la reidentificación siga siendo al menos teóricamente posible, los datos siguen considerándose personales y están plenamente sujetos al RGPD3.
Segundo: las salvaguardas técnicas no sustituyen una base jurídica. El RGPD exige que todo tratamiento de datos personales se apoye en una base jurídica conforme al art. 6, independientemente de lo bien que estén técnicamente protegidos los datos. El aislamiento puede hacer una operación de tratamiento más segura, pero no más legítima3. Para el uso en atención al cliente esto significa: además de la tecnología necesitas una base jurídica sólida y un contrato limpio4.
El DPA: donde la promesa se vuelve vinculante.
En cuanto un proveedor de IA procesa datos personales bajo instrucción en nombre de tu empresa, necesitas un acuerdo de tratamiento de datos conforme al art. 28 del RGPD, o DPA. El DPA es donde la promesa pasa del texto de marketing a la obligación contractual. Estos contenidos obligatorios deberías revisar:
- Vinculación a instrucciones: el proveedor trata los datos solo según tus instrucciones documentadas.
- Confidencialidad: las personas implicadas están obligadas a guardar confidencialidad.
- Regla de eliminación: qué ocurre al final del contrato, en qué plazo se eliminan o devuelven los datos.
- Subprocesadores: qué subprocesadores existen, bajo qué condiciones se contratan y qué obligaciones se les transfieren.
El punto crítico con los proveedores de IA es el último. La exclusión del entrenamiento debe quedar registrada para cada subprocesador, no solo para el proveedor principal. Porque el procesamiento real del modelo suele discurrir a través de un servicio de modelo o de embedding más atrás en la cadena. La dimensión de la brecha en la práctica la muestra un análisis de DataGrail de 2026: de 2.400 sistemas de software analizados, posiblemente el 63,6 % de los proveedores con funciones de IA puede que no divulguen subprocesadores externos en sus documentos legales5.
Eso no significa que todos estos proveedores estén entrenando en secreto. Algunos simplemente no tienen ninguno. Pero desde fuera no puedes distinguir los dos grupos mientras la cadena de suministro permanezca sin nombrar1. Una lista de comprobación para la selección de proveedores según criterios del RGPD la hemos compilado en un artículo aparte: IA conforme al RGPD en atención al cliente.
Qué se comprometen realmente a hacer OpenAI y Anthropic.
Si tu proveedor de soporte usa un modelo grande como interfaz, tu posición también depende de los compromisos de ese modelo. Pueden verificarse en el texto exacto.
OpenAI establece: por defecto, ningún dato de ChatGPT Enterprise, ChatGPT Business, ChatGPT Edu y la plataforma API — ni entradas ni salidas — se usa para entrenar o mejorar los modelos. Para organizaciones que cumplan los requisitos existen además controles de retención hasta una política de cero retención de datos en la plataforma API6.
Anthropic se compromete a lo mismo para productos comerciales como Claude for Work y la API de Anthropic: las entradas y salidas no se usan por defecto para el entrenamiento. Sin embargo, hay una excepción que debes conocer. Si los usuarios reportan feedback mediante el botón de pulgar arriba o abajo, Anthropic almacena toda la conversación asociada hasta 5 años en el backend seguro y puede usar ese feedback para entrenamiento7.
Para tu evaluación esto significa: pregunta no solo qué modelo usa el proveedor, sino a través de qué endpoints, con qué configuraciones de retención, y si las funciones de feedback para clientes están desactivadas o pueden alimentar la cadena de entrenamiento.
Límites: registros, metadatos, análisis agregados.
Ahora la parte que la mayoría de páginas de proveedores omite. Incluso con una promesa sincera, queda mucho. Esto no es un escándalo sino el funcionamiento normal de un servicio online. Solo deberías saberlo antes de prometer o esperar una ausencia total de datos.
- Registros operativos y de seguridad: los archivos de registro anotan quién accedió a qué sistema cuándo. Un período de almacenamiento de hasta 90 días con fines de seguridad informática se considera aceptable en protección de datos; almacenamiento más largo solo con un interés claramente prevaleciente. El Comisionado Federal Alemán para la Protección de Datos ha señalado seis meses como límite máximo de proporcionalidad8.
- Metadatos de facturación: marcas de tiempo, recuentos de tokens y latencia deben almacenarse, de lo contrario nadie puede emitirte una factura. Esto sobrevive incluso a un compromiso de cero retención de datos que solo cubre el contenido1.
- Copias de seguridad e informes: las copias de seguridad sobreviven a la eliminación de conversaciones individuales hasta que se sobrescriben. Y los análisis agregados — como tasas de resolución o preguntas frecuentes — surgen casi siempre más allá del contenido de conversaciones individuales1.
Por eso la pregunta útil a un proveedor no es si tiene registros. Todos los tienen. La pregunta es qué tipos de datos almacena, durante cuánto tiempo cada uno, y si la exclusión de entrenamiento también cubre versiones derivadas de tus datos — es decir, los criterios de la primera sección1. Lo que hace la facturación basada en uso con esos metadatos lo hemos desglosado por separado: Costes basados en uso.
ComLayer como ejemplo. Y tu lista de comprobación.
Para terminar, un ejemplo concreto: el nuestro. ComLayer procesa conversaciones, base de conocimiento, archivos adjuntos y el procesamiento de IA en regiones europeas. El registro, el pago, el envío de correos y la búsqueda semántica funcionan a través de servicios en EE. UU., y nombramos a estos proveedores en lugar de ocultarlos. No analizamos tus contenidos para entrenar modelos propios, y los proveedores de modelos y embeddings utilizados se han comprometido contractualmente a la misma exclusión. El DPA lo registra por proveedor.
Esto no es un caso especial, sino lo que puedes exigir a cualquier proveedor. Estas preguntas ayudan en la evaluación:
- ¿Quiénes son los subprocesadores, por nombre, incluidos los servicios de modelo y embedding?
- ¿Cuánto tiempo se retiene cada tipo de dato, en días, no en cláusulas?
- ¿Cuál es el SLA de eliminación a petición, y cubre las copias de seguridad?
- ¿La exclusión del entrenamiento también aplica a datos anonimizados, desidentificados y agregados?
- ¿Todo consta en el DPA firmado, con prevalencia sobre las condiciones en línea?
Un proveedor que responde todas las preguntas en un párrafo fluido está improvisando. Un proveedor que responde con nombres, cifras y referencias de cláusulas ha sido auditado antes1. Nuestros planes y precios los encuentras de forma transparente en la página de precios.
Una nota final: este artículo no es asesoramiento jurídico. Contextualiza la tecnología y la práctica contractual, pero no sustituye una revisión individual por un especialista, especialmente porque la responsabilidad por respuestas incorrectas de la IA recae en el operador: Responsabilidad por errores de IA.
Preguntas frecuentes
¿Qué significa exactamente "sin entrenamiento con datos de clientes" desde el punto de vista técnico?
El proveedor procesa tu contenido solo para entregar el resultado solicitado: una respuesta, un resumen, una extracción. Los datos no fluyen hacia el entrenamiento, el ajuste fino, la evaluación ni el benchmarking de un modelo. La diferencia con el procesamiento es la reversibilidad: los datos procesados pueden eliminarse; los datos introducidos en un modelo ya no pueden extraerse en la práctica.
¿Aprende el modelo de IA de las conversaciones con mis clientes?
Con una arquitectura RAG, no. La consulta del cliente se convierte en una representación vectorial y se coteja con tu base de conocimiento. Las secciones encontradas se insertan en el contexto del prompt; el modelo formula la respuesta a partir de ahí. Tras la respuesta, nada se ha aprendido: el modelo no retiene la conversación como conocimiento.
¿Es suficiente la promesa de "sin entrenamiento" para el RGPD?
No. Las salvaguardas técnicas como la separación de inquilinos elevan la seguridad pero no sustituyen una base jurídica conforme al art. 6 del RGPD. Y la seudonimización no es anonimización: mientras la reidentificación siga siendo teóricamente posible, los datos se siguen considerando personales. La promesa debe quedar registrada además contractualmente en el DPA.
¿Qué debe contener un DPA con un proveedor de IA?
Conforme al art. 28(3) del RGPD como mínimo: vinculación a instrucciones, obligaciones de confidencialidad, medidas técnicas y organizativas, obligaciones de eliminación y la designación de los subprocesadores. En materia de entrenamiento: la exclusión debe quedar registrada por cada subprocesador, no solo para el proveedor principal. Según el análisis de DataGrail de 2.400 sistemas de software analizados, posiblemente el 63,6 % de los proveedores con funciones de IA puede que no divulguen subprocesadores externos en sus documentos legales.
¿Usan OpenAI o Anthropic mis datos de soporte para entrenamiento?
Por defecto, no. OpenAI no usa datos de los productos API y Business para entrenar o mejorar los modelos. Anthropic hace el mismo compromiso para productos comerciales como la API. Pero: con Anthropic, el feedback reportado (pulgar arriba o abajo) incluida la conversación puede almacenarse hasta 5 años. Revisa también los canales de feedback, no solo la cláusula de entrenamiento.
¿Qué datos permanecen almacenados a pesar de la promesa?
Registros operativos y de seguridad, metadatos de facturación como marcas de tiempo y recuentos de tokens, copias de seguridad e informes agregados. Los archivos de registro son necesarios para la seguridad informática y la detección de intrusiones: hasta 90 días de almacenamiento se considera aceptable en protección de datos; el almacenamiento más largo requiere un interés justificado. La cero retención de datos cambia poco esto porque los datos de facturación y la supervisión de abusos sobreviven.
¿Cómo evalúo a un proveedor de IA antes de firmar el contrato?
Con las cinco preguntas de la lista de comprobación: subprocesadores con nombre y ubicación, períodos de retención por tipo de dato en días, SLA de eliminación incluidas las copias de seguridad, exclusión del entrenamiento también para datos anonimizados y agregados, y todo registrado en el DPA firmado.