COLVO aplica la misma idea en dos momentos (verificar el resultado real, nunca fiarse de la palabra del agente): antes del lanzamiento y en cada acción en directo. Lo que dice el agente es una afirmación. Lo que muestra el estado del proveedor es la verdad.
| Comprobación | Esperado | Observado | |
|---|---|---|---|
| Suscripción | activa · cancelación al final | cancelado | ✕ |
| Acceso | hasta el 31 oct | retirado hoy | ✕ |
| Reembolso | ninguno | ninguno | ✓ |
| Otras cuentas | intactas | intactas | ✓ |
Las herramientas de evaluación de agentes califican la conversación. COLVO califica el efecto real. Un agente que responde de maravilla pero reembolsa al cliente equivocado, cancela demasiado pronto o cobra dos veces no pasa, porque lo dice el estado.
Reproduce incidentes y casos límite sobre cuentas ficticias aisladas que se comportan como Stripe. Cada intento parte de una fixture nueva, así que una ejecución superada significa que el agente hizo lo correcto tres veces seguidas, no una por suerte.
Se sitúa delante de las acciones reales. El agente nunca tiene credenciales de escritura: propone. Guard aplica tu mandato, retiene las llamadas arriesgadas para aprobación humana, ejecuta exactamente una vez y verifica el resultado contra el proveedor.
Describe una sola vez el resultado y los límites. COLVO los hace cumplir en cada versión y en cada acción en directo.
Tu backend de confianza declara quién puede hacer qué y con qué límites: las reglas dentro de las que debe quedarse el agente.
El agente propone acciones a través del contrato HTTP de COLVO. Stripe y n8n funcionan desde el primer momento.
Ejecuta la suite en la sandbox; en producción, Guard evalúa cada acción antes de que se ejecute.
COLVO lee el estado real de forma independiente y muestra exactamente qué ha pasado frente a lo que estaba permitido.
Tu asistente gestiona reembolsos y cancelaciones en Stripe. Quieres ponerlo en producción, pero una acción incorrecta cuesta dinero real y un cliente real.
Creas y operas asistentes para varios clientes. Cada uno necesita su propio aislamiento, sus propios límites y un informe que el cliente pueda leer.
Prueba tu agente antes de lanzarlo y protege cada acción real una vez en producción. Primero, en una copia segura de tu mundo.