COLVO applique la même idée à deux moments (vérifier le résultat réel, ne jamais se fier à la parole de l’agent) : avant le lancement et sur chaque action en production. Ce que l’agent dit est une affirmation. Ce que montre l’état du fournisseur est la vérité.
| Contrôle | Attendu | Observé | |
|---|---|---|---|
| Abonnement | actif · résiliation en fin de période | annulée | ✕ |
| Accès | jusqu’au 31 oct. | supprimé aujourd’hui | ✕ |
| Remboursement | aucun | aucun | ✓ |
| Autres comptes | intacts | intacts | ✓ |
Les outils d’évaluation d’agents notent la conversation. COLVO note l’effet réel. Un agent qui répond parfaitement tout en remboursant le mauvais client, en résiliant trop tôt ou en prélevant deux fois échoue : parce que l’état le dit.
Rejouez incidents et cas limites sur des comptes fictifs isolés qui se comportent comme Stripe. Chaque tentative part d’une fixture neuve : une exécution réussie signifie que l’agent a fait ce qu’il fallait trois fois de suite, pas une fois par chance.
Se place devant les actions réelles. L’agent ne détient jamais d’identifiants d’écriture : il propose. Guard applique votre mandat, retient les appels risqués pour approbation humaine, exécute exactement une fois et vérifie le résultat auprès du fournisseur.
Vous décrivez une seule fois le résultat attendu et les limites. COLVO les fait respecter sur chaque version et chaque action en production.
Votre backend de confiance déclare qui peut faire quoi, avec quelles limites : les règles que l’agent doit respecter.
L’agent propose des actions via le contrat HTTP de COLVO. Stripe et n8n fonctionnent immédiatement.
Exécutez la suite dans la sandbox ; en production, Guard évalue chaque action avant son exécution.
COLVO lit l’état réel de façon indépendante et montre précisément ce qui s’est passé par rapport à ce qui était autorisé.
Votre assistant gère les remboursements et les résiliations sur Stripe. Vous voulez le mettre en production, mais une mauvaise action coûte de l’argent réel et un vrai client.
Vous concevez et exploitez des assistants pour plusieurs clients. Chacun a besoin de sa propre isolation, de ses propres limites et d’un rapport lisible par le client.
Testez votre agent avant sa mise en production, puis protégez chaque action réelle une fois en ligne. D’abord dans une copie sûre de votre environnement.