Entrenar al Agente de IA con los chats reales: cómo funciona el feedback

9 · Entrenar al agente con los chats reales

Un agente no mejora escribiendo reglas cada vez más largas: mejora con lo que hace tu equipo en cada conversación. Esa es la parte del trabajo que no se hace en el editor, y es la que más rinde con el tiempo.

El feedback depende del modo

Lo primero es saber en qué momento puede intervenir tu equipo, porque cambia según el modo de operación que le hayas puesto:

Modo Cuándo interviene Cómo le llega el feedback

Sugerencias y Copiloto por debajo del umbral

Antes de que salga el mensaje

El agente edita la respuesta propuesta y envía su versión, o pide otra con Solicitar cambios.

Autónomo

Después: el mensaje ya se envió

👍 / 👎 sobre el mensaje. El 👎 abre la corrección: el razonamiento y, sobre todo, la respuesta como debería haber sido.

Si lo ponés en autónomo, alguien tiene que calificar. En autónomo nadie revisa antes de que el mensaje salga: si además nadie marca 👍/👎, el agente repite el mismo error todos los días y se congela en la calidad del día que lo configuraste. Es el error más caro de esta sección.

Por eso conviene arrancar un agente nuevo en sugerencias: cada chat atendido lo corrige, y recién cuando las sugerencias salen bien sin tocarlas lo pasás a autónomo.

Qué se corrige con un 👎

La calificación negativa no es solo un voto: abre la corrección, con dos campos que el agente guarda juntos.

Campo Para qué sirve

El razonamiento

Cómo pensó antes de responder. Corregirlo endereza la lógica: qué tenía que haber tenido en cuenta, qué dio por sentado de más.

La respuesta como debería haber sido

Lo más importante. El mensaje exacto que tenía que salir. Es lo que el agente reutiliza cuando vuelve a aparecer un caso parecido.

Ese par —razonamiento + respuesta— es la misma estructura de un ejemplo de entrenamiento (ver 8 · Ejemplos de entrenamiento). Por eso calificar desde el chat rinde tanto: es armar un ejemplo sin salir de la conversación.

Cómo escribir la respuesta corregida

Da lo mismo si la corrección llega editando una sugerencia o con un 👎: lo que se guarda es el mensaje que tenía que haber salido, listo para enviar. Un comentario sobre la respuesta no se puede reutilizar.

En vez de Escribí

“Está mal” “El envío a Córdoba es 3 a 5 días hábiles, no 24 hs.”

“Muy largo” “Contestá el precio en una línea y recién si preguntan, explicá qué incluye.”

“No entendió” “Cuando piden ‘el más barato’ están pidiendo el plan Starter, no un descuento.”

Vale la pena bajarle esta regla al equipo: escribí la respuesta que hubieras mandado vos, tal cual, lista para copiar y pegar. Es la diferencia entre un feedback que se convierte en ejemplo y uno que se pierde.