Evitar alucinaciones en el soporte: qué ayuda técnicamente
Descubre cómo evitar técnicamente las alucinaciones de la IA en la atención al cliente: desde las arquitecturas RAG hasta los umbrales de confianza y la vinculación a las fuentes.
Martin Semmele

Contenido
- 01Las alucinaciones como problema estructural
- 02Arquitectura RAG para la vinculación local del conocimiento
- 03Grounding y citas obligatorias
- 04Umbrales de confianza y modo sombra
- 05El fallback limpio: rechazar en lugar de adivinar
- 06Evaluación continua en producción
- 07Ejemplo práctico: una capa de IA con vinculación estricta al conocimiento
- 08Preguntas frecuentes
Conclusiones clave
- Los modelos de lenguaje sin regular alucinan hasta en el 27 por ciento de los casos.
- Una capa de grounding reduce la tasa de error en el soporte por debajo del 5 por ciento.
- La IA solo puede responder a partir de fuentes internas verificadas (RAG).
- Cuando falta conocimiento, el sistema debe traspasar el caso a una persona de inmediato.
Las alucinaciones como problema estructural
Los grandes modelos de lenguaje calculan probabilidades de secuencias de palabras. No acceden a una base de datos interna de hechos verificados, sino que eligen, a partir de los datos de entrenamiento, el siguiente token estadísticamente más probable. Para la atención al cliente, este principio matemático es un problema. Los modelos de lenguaje están optimizados para formular respuestas retóricamente convincentes, con independencia de que el contenido sea objetivamente correcto.
En la investigación se distinguen dos formas principales de error: las alucinaciones intrínsecas y las extrínsecas1. Las alucinaciones intrínsecas contradicen directamente la información facilitada en el contexto. Las alucinaciones extrínsecas inventan detalles nuevos que no aparecen en absoluto en el texto de partida, como plazos de devolución inventados o funciones de producto inexistentes. Sin medidas técnicas de protección, los modelos de lenguaje sin regular alucinan entre el 15 % y el 30 % de los casos2. Los prompts de sistema por sí solos no resuelven este problema, porque no dejan sin efecto el principio estocástico básico del modelo.
| Tipo de alucinación | Mecanismo en el modelo | Efecto en el soporte |
|---|---|---|
| Alucinación intrínseca | El modelo tergiversa cifras o condiciones del contexto facilitado. | Datos de precio o de fecha erróneos pese a existir documentación. |
| Alucinación extrínseca | El modelo completa el conocimiento que le falta con hechos inventados. | Promesas de funciones o reembolsos que la empresa no ofrece. |
Arquitectura RAG para la vinculación local del conocimiento
Para reducir drásticamente la tasa de error en el soporte, el modelo de lenguaje debe desacoplarse de sus datos públicos de entrenamiento. La solución técnica para ello es la generación aumentada por recuperación (RAG). En este procedimiento, el modelo de lenguaje general se amplía con un almacén de conocimiento externo y controlado. En lugar de generar libremente, el modelo recibe en cada solicitud exactamente los fragmentos de documento que son relevantes para responderla.
La precisión de una arquitectura RAG depende por completo de la calidad de la preparación de los datos y del mecanismo de búsqueda. En el proceso de ingesta, los documentos se dividen en fragmentos (chunks) y se almacenan como vectores en una base de datos diseñada para la búsqueda por similitud. IBM señala el chunking subóptimo como una de las debilidades centrales de las pipelines RAG clásicas: si el corte se hace en puntos fijos, en medio de una tabla, la recuperación solo devuelve media tabla y la exactitud de la respuesta se pierde3. Una base de conocimiento bien mantenida, con fragmentos cortados con limpieza y cerrados semánticamente, es por tanto el requisito para que una pipeline RAG pueda siquiera reducir la tasa de alucinación frente a los modelos sin regular.
- 01Ingesta de documentos: limpieza y estructuración automáticas de los artículos de ayuda y las políticas internas.
- 02Smart chunking: división de los textos en unidades de información cerradas semánticamente a lo largo de los títulos.
- 03Vectorización y recuperación: cotejo matemático de la solicitud del cliente con los fragmentos almacenados mediante similitud del coseno.
- 04Ampliación del contexto: entrega de los fragmentos relevantes al prompter como única base de hechos.
Grounding y citas obligatorias
Una arquitectura RAG por sí sola no basta en ámbitos críticos para la seguridad. Aunque se recuperen de la base de datos los documentos correctos, el modelo de lenguaje puede cometer errores al resumir. Por eso hace falta una capa de comprobación posterior: la capa de grounding. Los estudios comparativos sobre la clasificación de groundedness muestran que las respuestas generadas se pueden clasificar de forma automatizada según estén o no cubiertas por el material de origen, y que este paso puede ejecutarse tras la generación con una latencia asumible.
En la capa de grounding, el borrador de respuesta se descompone en afirmaciones concretas. Cada afirmación se analiza mediante inferencia de lenguaje natural (NLI) para determinar si se puede deducir directamente del documento de origen: el documento de origen sirve de premisa, la afirmación parcial generada de hipótesis, y la comprobación decide si la afirmación está cubierta por la fuente4. Además, el modelo queda obligado a aportar una cita de la fuente concreta en el Centro de ayuda para cada afirmación principal. Esta combinación de comprobación automática y obligación de citar reduce la tasa de error real en funcionamiento por debajo del 5 %2.
- Análisis por separación de frases: descomposición de la respuesta de IA en hechos atómicos.
- Cotejo NLI: comprobación lógica de cada afirmación parcial frente al fragmento de contexto recuperado.
- Bloqueo automático: descarte del borrador de respuesta ante contradicciones lógicas o afirmaciones sin respaldo.
- Inyección de citas: enlace a la fuente de conocimiento exacta directamente al final de la respuesta.
Umbrales de confianza y modo sombra
No todas las solicitudes de la clientela se pueden responder de forma inequívoca a partir de los documentos existentes. Para evitar informaciones falsas hay que definir umbrales técnicos (confidence thresholds). El sistema calcula un valor de confianza para cada paso de recuperación y de respuesta. Si ese valor queda por debajo del límite fijado, la respuesta automática se detiene y el caso se traspasa a una persona. En los sistemas en producción, los umbrales habituales se sitúan entre el 80 y el 95 por ciento, según el riesgo del caso de uso5.
Antes de la puesta en marcha conviene establecer un modo sombra (shadow mode). El agente de IA acompaña en silencio los flujos humanos con casos reales entrantes: reconoce la intención, recupera conocimiento, recomienda una solución y redacta la respuesta al cliente con su justificación, pero no actualiza ningún registro de caso, no envía ninguna comunicación al cliente y no cambia ningún estado6. Así, quienes deciden en el plano técnico pueden medir durante varias semanas cómo se comporta la tasa de acierto en condiciones reales y calibrar los umbrales sin riesgo para la satisfacción de la clientela.
| Rango de confianza | Comportamiento del sistema | Escenario de uso |
|---|---|---|
| Confianza alta | Entrega directa de la respuesta al cliente con indicación de la fuente. | Preguntas estándar sobre envíos, devoluciones o funciones conocidas. |
| Confianza media | El borrador se presenta en la bandeja de entrada para su revisión humana. | Casos de uso más complejos con pequeñas lagunas de información. |
| Confianza baja | Rechazo automático de la respuesta y traspaso directo al equipo. | Edge cases desconocidos o fuentes de conocimiento ausentes. |
El fallback limpio: rechazar en lugar de adivinar
La regla de seguridad más importante para la IA en el soporte dice así: rechazar siempre sale más barato que adivinar. Una respuesta inventada lleva a expectativas equivocadas de la clientela, a devoluciones innecesarias o, en el peor de los casos, a riesgos jurídicos de responsabilidad. Cuando el índice de contexto no aporta datos suficientemente relevantes, el sistema debe negar la respuesta y dar una indicación clara.
Aquí entra en juego el mecanismo de fallback. El agente de IA cede la conversación al soporte humano sin fricciones y le traspasa al menos un paquete estructurado con el historial completo de la conversación con marcas de tiempo, los datos del cliente registrados, el perfil de CRM con contactos anteriores, el motivo concreto de la escalada y los pasos ya intentados5. De este modo, la clientela no tiene que explicar su asunto otra vez. Quien planifica de forma estratégica qué flujos se pueden automatizar en la atención al cliente y dónde sigue siendo necesaria la experiencia humana crea procesos fiables.
- Negativa transparente: mensaje claro al usuario de que la información no está disponible por ahora.
- Traspaso fiel al contexto: reenvío del chat completo, incluido su historial, a la bandeja de entrada.
- Sin bucles infinitos: escalada inmediata a personas de contacto reales, sin repetir preguntas estándar.
- Panel del agente: puesta en evidencia de la laguna de conocimiento para el equipo de soporte.
Evaluación continua en producción
La protección frente a las alucinaciones no termina con el arranque del sistema. Durante el funcionamiento hay que vigilar de forma continua la exactitud de la IA. Para ello se prestan métricas cuantitativas: la tasa de negativas (refusal rate), la tasa de escalada al soporte humano y la tasa de error de afirmaciones sin respaldo (unsupported claim rate). Como orientación para el traspaso a personas, en la práctica rigen tasas de handoff del 10 al 20 por ciento con una deflection rate del 40 al 70 por ciento, teniendo en cuenta que una tasa de automatización alta solo vale algo si la satisfacción de la clientela se mantiene estable5.
Igual de importante es un sistema de feedback sistemático. Cada respuesta denegada y cada valoración negativa de la clientela sirve de señal de que falta información en el almacén de conocimiento o de que está obsoleta. Si los equipos de soporte evalúan de forma dirigida las preguntas de clientes sin responder y amplían la base de conocimiento cada semana, pueden reducir el volumen de tickets y aumentar de forma continua la tasa de automatización.
- 01Control de calidad por muestreo: revisión manual del 5 % de las respuestas automatizadas por parte de los responsables de soporte.
- 02Evaluación de señales de fallback: registro de todas las solicitudes en las que la IA se detuvo por falta de confianza.
- 03Identificación de lagunas: categorización de las preguntas sin responder para ampliar la documentación de forma dirigida.
- 04Optimización iterativa del modelo: mantenimiento posterior de los fragmentos y eliminación de artículos de ayuda obsoletos.
Ejemplo práctico: una capa de IA con vinculación estricta al conocimiento
Quien busca una automatización fiable sin el esfuerzo de un departamento de desarrollo propio también puede comprar los mecanismos de protección descritos como plataforma terminada. Aquí son decisivas tres propiedades comprobables: el agente de IA responde exclusivamente a partir de los datos de empresa depositados, aporta la fuente exacta en cada respuesta y se niega a responder cuando no hay información suficiente. En ese caso, la conversación pasa directamente a la bandeja de entrada compartida.
La infraestructura y el almacenamiento de datos están concebidos según los estándares de seguridad europeos. Todos los contenidos permanecen en la UE, el tratamiento se realiza estrictamente conforme al RGPD y sin entrenar modelos públicos de IA con tus datos de clientes IA conforme al RGPD. El modelo de precios está construido con transparencia: además de un plan Free gratuito para probar, ComLayer Pro ofrece desde 49 € al mes, con 500 respuestas de IA incluidas, todas las funciones para equipos de soporte profesionales.
- Aislamiento estricto del conocimiento: las respuestas salen exclusivamente de tu base de conocimiento verificada.
- Indicación automática de la fuente: enlace directo a la página de ayuda correspondiente bajo cada respuesta.
- Fallback seguro: traspaso sin fricciones al equipo humano en caso de duda.
- Alojamiento en la UE y RGPD: almacenamiento y tratamiento con IA en centros de datos europeos, sin cesión de datos.
Preguntas frecuentes
¿Por qué alucinan los modelos de lenguaje?
Los grandes modelos de lenguaje solo calculan probabilidades para la palabra siguiente. No poseen una comprensión real de los hechos. Sin una limitación técnica, rellenan las lagunas de conocimiento con invenciones que suenan plausibles pero son falsas. Esto afecta hasta al 27 por ciento de las salidas sin regular.
¿Qué es RAG en la atención al cliente?
La generación aumentada por recuperación (RAG) une un modelo de lenguaje con una base de datos verificada. La IA genera sus respuestas exclusivamente a partir de los documentos internos de la empresa recuperados previamente e ignora su conocimiento general de entrenamiento.
¿Cómo reduce el grounding la tasa de error?
El grounding obliga al modelo a respaldar cada afirmación con una fuente específica. Una capa de validación adicional coteja la respuesta con el documento. Así, la tasa de alucinación se puede reducir por debajo del 5 por ciento.
¿Qué pasa si la IA no puede responder una pregunta?
Un sistema seguro detecta cuándo no se alcanzan los umbrales de confianza. En lugar de adivinar, la IA se niega a responder y traslada la solicitud sin fricciones al equipo de soporte humano.
¿Cómo pruebo un sistema de IA sin riesgo para la clientela?
Las soluciones de IA nuevas deberían funcionar primero en modo sombra. Las respuestas generadas se evalúan internamente, pero no se envían a la clientela. Así determinas la exactitud antes de poner el sistema en producción.
¿Qué importancia tiene el mantenimiento de la base de conocimiento?
La calidad de las respuestas de IA depende directamente de los datos depositados. Los documentos obsoletos o sin estructurar llevan a recuperaciones erróneas. Un mantenimiento continuo y la evaluación de los tickets sin resolver cierran las lagunas de conocimiento de forma sistemática.