Preguntas de prueba para el agente de IA antes de publicar el conocimiento
Un conjunto fijo de preguntas de prueba que se ejecuta de nuevo antes de cada publicación de la base de conocimiento: qué tipos de pregunta debe incluir, qué cuenta como superado y cómo se mantiene el conjunto.
Martin Semmele

Contenido
Conclusiones principales
- Una muestra de respuestas ya publicadas encuentra los errores después de que los clientes los hayan visto; un conjunto de prueba los encuentra antes.
- Cinco tipos de pregunta pertenecen a cada conjunto: caso estándar, caso límite, pregunta sin respuesta en la base de conocimiento, información desactualizada y pregunta con premisa falsa.
- Superado significa: correcto Y con la fuente esperada como respaldo, o un traspaso honesto a una persona. Una respuesta correcta con una fuente incorrecta no está superada.
- El conjunto crece a partir de solicitudes reales y de cada error que ha llegado hasta la clienta o el cliente; nunca se reduce.
- El modo sombra, en el que el agente solo deposita borradores, es la medición en operación, no el sustituto del conjunto.
Por qué una muestra no basta
Quien opera un agente de IA en soporte acaba comprobando sus respuestas en algún momento. El camino habitual es la muestra: cada semana alguien lee una parte de las conversaciones y valora si la respuesta es correcta. Hemos descrito este método en una publicación propia sobre el muestreo, y sigue siendo correcto. Solo tiene una característica que hay que conocer: encuentra los errores después de que los clientes los hayan visto.
Un conjunto de prueba invierte el orden. Consta de preguntas cuya respuesta correcta se conoce y se plantea antes de publicar un cambio en la base de conocimiento. El principio procede del desarrollo de software, donde las pruebas se ejecutan con cada cambio, y vale igualmente para los modelos de lenguaje: Hamel Husain, que describe métodos de evaluación para productos de IA, exige que estas comprobaciones sean rápidas y baratas, para poder ejecutarlas con cada cambio1. El motivo es el mismo que en el software: un cambio en un punto tiene efectos secundarios en otros.
En una base de conocimiento estos efectos secundarios son especialmente discretos. Un nuevo artículo de ayuda sobre la cancelación puede provocar que el agente, ante una pregunta sobre la factura, cite de repente el artículo de cancelación, porque su redacción está más cerca de la pregunta. Nadie ha tocado el artículo de la factura y, aun así, la respuesta a la pregunta sobre la factura se ha vuelto otra. Una muestra lo descubre en la semana siguiente. Un conjunto de prueba lo descubre antes de la publicación.
De dónde vienen las preguntas
El conjunto no se inventa, sino que se recopila. La mejor fuente son las solicitudes reales de la bandeja de entrada, y no las típicas, sino aquellas en las que el soporte ya ha fallado una vez: preguntas que hubo que hacer dos veces, preguntas con una respuesta que luego se corrigió, preguntas que fueron a parar a una persona aunque la respuesta estaba en la base de conocimiento. Cada una de ellas es un candidato.
La segunda fuente son los traspasos del propio agente. Cuando el agente traspasa una pregunta al equipo porque la base de conocimiento no da para más, ese traspaso o es correcto, porque realmente no hay respuesta, o es incorrecto, porque la respuesta está ahí y simplemente no se encontró. Ambos casos pertenecen al conjunto, con expectativas distintas. La guía de Anthropic para construir casos de prueba recomienda expresamente no olvidar los casos límite: entradas irrelevantes o inexistentes, entradas demasiado largas y, en el chat, también entradas de usuario malas o inadecuadas2. En preguntas de soporte esto afecta precisamente a los casos que rara vez aparecen en una muestra y que por eso deberían estar representados de forma desproporcionada en el conjunto.
Los cinco tipos de pregunta.
Un conjunto formado solo por preguntas estándar comprueba únicamente si el agente funciona en un buen día. Cinco tipos cubren lo que ocurre realmente en operación:
- Caso estándar: una pregunta frecuente cuya respuesta está claramente en un artículo. Expectativa: la respuesta de ese artículo, con ese artículo como fuente.
- Caso límite: una pregunta cuya respuesta debe componerse a partir de dos artículos o está en una frase secundaria. Expectativa: la respuesta compuesta, con ambas fuentes.
- Pregunta sin respuesta en la base de conocimiento: una pregunta sobre la que deliberadamente no hay ningún artículo. Expectativa: traspaso a una persona, ninguna respuesta inventada.
- Información desactualizada: una pregunta sobre algo que ha cambiado, por ejemplo un precio o un plazo. Expectativa: el estado actual, no el antiguo, aunque siga existiendo un artículo antiguo.
- Pregunta con premisa falsa: una pregunta que presupone algo falso, por ejemplo sobre una función que no existe. Expectativa: el agente contradice la premisa en lugar de confirmarla.
Qué cuenta como superado
La valoración debe quedar fijada antes de la primera ejecución; de lo contrario, se ajusta a posteriori a las respuestas. Tres reglas bastan, y están pensadas en sentido estricto.
Primera: una respuesta solo está superada si es correcta en su contenido Y menciona la fuente esperada. Una respuesta correcta con una fuente incorrecta o ausente no está superada. El motivo es práctico: una respuesta sin una fuente sólida no la puede revisar nadie del equipo, y el agente la ha compuesto, en caso de duda, a partir de la redacción de otro punto. En la siguiente ejecución, la misma pregunta puede salir de otra manera.
Segunda: un traspaso honesto a una persona es, en los tipos «sin respuesta» y «premisa falsa», el resultado esperado y por tanto superado. En los otros tres tipos no está superado, porque allí la respuesta estaba en la base de conocimiento. Un traspaso no es un salvoconducto; solo es correcto donde falta el conocimiento.
Tercera: una respuesta que es correcta, pero afirma más de lo que la fuente respalda, no está superada. Es el caso que más a menudo se escapa, porque la respuesta suena bien. Un agente que menciona correctamente el plazo de cancelación y además inventa una regla de cortesía no ha superado la pregunta.
| Tipo de pregunta | Resultado esperado | Superado si | No superado si |
|---|---|---|---|
| Caso estándar | Respuesta del artículo A | Contenido correcto, fuente A mencionada | Falta la fuente o es otro artículo |
| Caso límite | Respuesta de A y B | Ambas partes correctas, ambas fuentes mencionadas | Solo una parte, o una parte inventada |
| Sin respuesta | Traspaso a una persona | Traspaso sin contenido inventado | Cualquier respuesta con contenido |
| Información desactualizada | Estado actual | Valor nuevo, fuente nueva | Valor antiguo, o ambos valores a la vez |
| Premisa falsa | Contradicción de la premisa | Premisa señalada y corregida | Premisa asumida |
Qué tamaño debe tener el conjunto
No hay una cifra que valga para todos los equipos, pero sí una regla orientativa que se deduce de la estructura de la base de conocimiento: al menos una pregunta por cada artículo que el agente cita con frecuencia, más una pregunta de los tipos tres a cinco por cada área temática. En un Centro de ayuda con cuarenta artículos en cinco áreas son unas 55 preguntas. Suena a mucho, pero se recopila en una tarde y se repasa en media hora.
Anthropic recomienda para las evaluaciones dar prioridad a la cantidad sobre la calidad individual: más preguntas con una valoración automática algo más gruesa son mejores que pocas valoradas a mano con esfuerzo2. Para un equipo de soporte sin automatización de pruebas propia, traducido significa: mejor 55 preguntas con una valoración de sí o no según las tres reglas de arriba que 15 preguntas con una escala del uno al diez. La escala genera discusiones; el sí o no genera una lista de tareas.
Cuándo se ejecuta el conjunto.
Antes de cada publicación de un cambio en la base de conocimiento que vaya más allá de una errata. Artículo nuevo, artículo eliminado, cifra modificada, estructura modificada, nueva fuente en el rastreo: cada vez. Esto solo se sostiene si la ejecución es corta, y es corta cuando las preguntas están ya preparadas en una tabla y solo hay que plantearlas. Un conjunto que solo se ejecuta mensualmente no es una prueba de regresión, sino un inventario.
Mantener el conjunto
Un conjunto de prueba queda anticuado en el momento en que cambia la base de conocimiento, y eso es intencionado: cada cambio arrastra un cambio en el conjunto. Tres reglas lo mantienen utilizable.
- Cada error que ha llegado hasta la clienta se convierte en una pregunta. Cuando la muestra o una reclamación encuentra una respuesta incorrecta, la pregunta entra en el conjunto con la expectativa correcta. Se queda ahí de forma permanente, porque los errores que han ocurrido una vez vuelven a ocurrir.
- Una información que cambia modifica la expectativa, no la pregunta. Si sube un precio, la pregunta sobre el precio sigue en el conjunto y recibe una nueva respuesta esperada. La respuesta antigua pasa a ser la expectativa de «no superado», justo el caso que comprueba el tipo «información desactualizada».
- El conjunto nunca se reduce. Una pregunta solo se elimina cuando el área temática a la que pertenece desaparece del producto. Una pregunta superada diez veces seguidas no es lastre, sino la prueba de que un punto es estable.
Quien lleva el conjunto en una tabla necesita seis columnas: la pregunta, el tipo, la respuesta esperada en una frase, la fuente esperada, el resultado de la última ejecución y la fecha. No hace falta más herramienta, y buscar una herramienta propia para ello es el motivo más frecuente por el que el conjunto nunca llega a existir.
Qué aporta el modo sombra
El conjunto de prueba comprueba la base de conocimiento antes de la publicación. Lo que no comprueba es la variedad de las formulaciones reales: las clientas y los clientes hacen la misma pregunta de cien maneras, con erratas, medias frases y contexto de un pedido anterior. Para eso existe la segunda medición, y esa tiene lugar en operación.
En Comlayer se llama modo sombra. En este ajuste, el agente no responde por sí mismo, sino que deposita en la bandeja de entrada, para cada pregunta que entra, un borrador con fuentes. El equipo envía el borrador sin cambios, lo edita o lo descarta, y la proporción de borradores enviados sin cambios muestra lo bien que el agente se desenvuelve con formulaciones reales. Un borrador en el que el agente habría traspasado está marcado como tal. El agente responde exclusivamente a partir del conocimiento del espacio de trabajo, es decir, de los artículos del Centro de ayuda, los documentos subidos y las páginas rastreadas de tu propio sitio web, menciona la fuente en cada respuesta y traspasa al equipo cuando el conocimiento no da para la respuesta.
Ambas mediciones se complementan, pero no se sustituyen. El modo sombra muestra si el agente está listo para hablar con personas reales. El conjunto de prueba muestra si la base de conocimiento, tras el último cambio, sigue diciendo lo que debe decir. Quien solo tiene lo uno nota las regresiones solo en la pila de borradores, y quien solo tiene lo otro nunca se entera de cómo preguntan realmente las clientas.
Preguntas frecuentes
¿En qué se diferencia un conjunto de prueba de una muestra?
Una muestra valora respuestas que ya se han publicado y encuentra los errores después de que los clientes los hayan visto. Un conjunto de prueba se plantea antes de publicar un cambio en la base de conocimiento y encuentra los errores antes de que alguien los vea.
¿Cuántas preguntas de prueba necesita un equipo pequeño?
No hay una cifra que valga para todos los equipos. Como regla orientativa: al menos una pregunta por cada artículo que el agente cita con frecuencia, más una pregunta de los tipos tres a cinco por área temática. En un Centro de ayuda con cuarenta artículos en cinco áreas son unas 55 preguntas.
¿Una respuesta correcta sin fuente cuenta como superada?
No. Superada significa que la respuesta es correcta en su contenido Y menciona la fuente esperada. Una respuesta sin una fuente sólida no la puede revisar nadie del equipo y, en caso de duda, el agente la ha compuesto a partir de la redacción de otro punto.
¿Cuándo es un traspaso a una persona el resultado correcto?
En los tipos «sin respuesta en la base de conocimiento» y «premisa falsa», un traspaso honesto es el resultado esperado y por tanto superado. En los otros tres tipos no está superado, porque allí la respuesta estaba en la base de conocimiento.
¿Con qué frecuencia debe ejecutarse el conjunto?
Antes de cada publicación de un cambio que vaya más allá de una errata: artículo nuevo, artículo eliminado, cifra modificada, estructura modificada, nueva fuente en el rastreo. Un conjunto que solo se ejecuta mensualmente no es una prueba de regresión, sino un inventario.
¿Sustituye el modo sombra al conjunto de prueba?
No. El modo sombra mide en operación, a través de la proporción de borradores enviados sin cambios, lo bien que el agente se desenvuelve con formulaciones reales. El conjunto de prueba comprueba antes de la publicación si la base de conocimiento, tras un cambio, sigue diciendo lo que debe decir. Ambas mediciones se complementan.