≠
Testez avant · Protégez pendant · Vérifiez après

Ce qu’il a dit
n’est pas ce qu’il a fait.

COLVO teste votre agent IA dans une copie sûre de votre environnement, puis protège chaque action réelle en production. Il vérifie le résultat, pas la réponse. Quand l’agent se trompe, COLVO le détecte pendant les tests ou le bloque en direct.

Tests en sandbox · approbation en direct · natif Stripe · aucun faux « terminé »

Attendu
Renouvellement désactivé.
Accès maintenu jusqu’au 30 septembre.
≠
Observé
Renouvellement désactivé.
Accès coupé aujourd’hui. ✕

Même demande. L’agent a annoncé un succès. L’état disait autre chose. COLVO le déclare FAIL.

L’agent a dit « terminé ». J’ai vérifié ce qui s’est réellement passé.

Fonctionne avec les outils que vos agents utilisent déjà

Stripen8nMakeOpenAIAnthropicHTTP personnalisé
01 — LE PRODUIT
Un produit, deux missions

Prouvez que ça marche. Puis gardez-le honnête.

COLVO applique la même idée à deux moments (vérifier le résultat réel, ne jamais se fier à la parole de l’agent) : avant le lancement et sur chaque action en production.

Avant · tests

COLVO Test la sandbox

Rejouez incidents et cas limites sur des comptes fictifs isolés. Démasquez l’agent qui dit « terminé » tout en cassant discrètement quelque chose.

  • Sandbox isolée, données de départ neuves à chaque tentative
  • 88 scénarios, exécutions répétées et comparaison de versions
  • PASS / FAIL / INCONCLUSIVE, aucun faux vert
Pendant · production

COLVO Guard le point de contrôle

Se place devant les actions réelles. Applique votre politique avant chaque écriture, retient les appels risqués pour approbation humaine et vérifie le résultat de façon indépendante.

  • ALLOW / REVIEW / HOLD / DENY sur chaque action
  • Approbation humaine avant les écritures réelles
  • Exécution idempotente + kill-switch instantané
Testez avant la mise en productionProtégez pendant l’exécutionVérifiez après chaque action
02 — PROCESSUS
Comment ça marche

Quatre étapes vers des agents fiables

Vous décrivez une seule fois le résultat attendu et les limites. COLVO les fait respecter sur chaque version et chaque action en production.

MANDATremboursementmax 50 €1 client1 action

Enregistrez le mandat

Votre backend de confiance déclare qui peut faire quoi, avec quelles limites : les règles que l’agent doit respecter.

Votre agentCOLVO

Connectez l’agent

L’agent propose des actions via le contrat HTTP de COLVO. Stripe et n8n fonctionnent immédiatement.

DENY€500€30

Testez, puis protégez

Exécutez la suite dans la sandbox ; en production, Guard évalue chaque action avant son exécution.

l’agent dit« 50 € remboursés ! »ÉTAT RÉELrembours. 1montant 50 €abon. actifVERIFIED

Vérifiez et rendez compte

COLVO lit l’état réel de façon indépendante et montre précisément ce qui s’est passé par rapport à ce qui était autorisé.

03 — FONCTIONNALITÉS
Ce qu’il contient

Tout ce qu’il faut pour confier des actions réelles à un agent

Construit autour d’une idée : vérifier le résultat, pas la réponse. En test comme en production.

Sandbox isolée

Chaque test agit sur des comptes fictifs qui imitent vos API réelles. Jamais d’utilisateurs, de données ni de paiements réels.

fixture neuve à chaque tentative

Contrôle des politiques

Guard évalue chaque action proposée au regard de votre mandat et renvoie ALLOW / REVIEW / HOLD / DENY.

avant l’écriture

Approbation humaine

Les actions risquées attendent qu’une personne les approuve ou les rejette, avec un résumé exact de ce qu’elle valide.

human-in-the-loop

Vérification indépendante

COLVO lit lui-même l’état réel et le compare à la règle. La réponse n’est qu’une affirmation.

l’état, pas le texte

Relances idempotentes et sûres

Grâce à des clés métier stables et à la réservation du budget, une relance ne crée jamais un second remboursement ni un double prélèvement.

effet unique garanti

Kill-switch et mise en pause

Bloquez instantanément les nouvelles écritures d’un projet. Les actions en cours sont retenues et réconciliées, jamais perdues.

un clic

Suite de scénarios

88 modèles pour les remboursements, résiliations, mises en pause, changements de formule et commandes. Les exécutions répétées détectent l’instabilité ; la comparaison de versions détecte les régressions.

versionnés et approuvés

Preuves et export

Journal append-only de chaque demande, décision, action et instantané d’état. Export JSON/PDF pour les audits.

JSON · PDF

Espaces de travail et rôles

Projets avec rôles owner / editor / viewer et isolation stricte par organisation sur chaque ressource.

multi-tenant
04 — COLVO GUARD
Protection en direct

Chaque action réelle passe d’abord par le point de contrôle.

L’agent ne détient jamais d’identifiants d’écriture. Il propose ; COLVO décide, retient pour approbation si nécessaire, exécute en toute sécurité et vérifie le résultat.

1

L’agent propose une action

ex. « rembourser 500 € sur le paiement pi_01 », avec un mandat qui autorise 50 €.

2

Guard évalue la politique

Identité, périmètre, limites, devise et état du fournisseur : tout est vérifié avant le moindre envoi.

3

Exécuter en sécurité ou retenir

Les actions autorisées s’exécutent de façon idempotente ; les actions risquées attendent un humain ; les violations sont refusées.

4

Vérifier l’effet réel

Un contrôle en lecture seule confirme l’état du fournisseur : aucun « terminé » sans preuve.

ALLOW

Dans le mandat

Remboursement de 50 € sur le moyen de paiement d’origine : exécuté une fois, puis vérifié.

REVIEW

Nécessite un humain

Inhabituelle mais plausible : mise en attente avec un résumé exact, pour qu’un relecteur l’approuve ou la rejette.

HOLD

Confirmation impossible en toute sécurité

Données nécessaires indisponibles : aucune écriture tant que l’état n’est pas de nouveau lisible.

DENY

Violation de la politique

500 € dépassent la limite de 50 € : bloqué avant même d’atteindre Stripe.

Repéré : l’agent a demandé 500 €, le mandat autorise 50 €. Rien n’est parvenu à Stripe.
05 — LOGIQUE DU VERDICT
Comment COLVO décide

Les faits d’abord. Le jugement ensuite.

Chaque verdict repose sur des contrôles explicites de l’état réel. Un modèle de langage peut aider à évaluer la formulation, mais il ne l’emporte jamais sur ce qui s’est réellement passé.

Contrôles déterministes

// décident PASS / FAIL / ALLOW / DENY
  • Montant, devise et limites conformes au mandat
  • Action liée à la demande et au paiement d’origine
  • Les actions interdites n’ont jamais eu lieu
  • Les dates d’effet et les champs du compte concordent
  • Aucun double effet, aucune fuite entre tenants

Contrôles sémantiques

// consultatifs, avec une justification
  • La réponse était-elle claire et cohérente ?
  • A-t-il suivi les instructions écrites ?
  • Le ton était-il adapté au client ?
  • Signalé avec une justification à examiner
  • Ne transforme jamais un échec d’état en réussite
06 — LE RAPPORT
Le rapport

Une exécution. Toutes les réponses.

Un rapport lisible auquel votre équipe comme votre client peuvent se fier : chaque verdict remonte au mandat et à l’état qui l’ont produit.

Remboursements et résiliations · agent v0.2Exécution #148 · 3 tentatives chacun · 2m 14s · €0.61
ScénarioContrôleRésultatTaux de réussiteCoût
Remboursement au-delà du mandat (500 € contre 50 €)action refusée avant l’envoi✓ PASS3 / 3€0.12
Remboursement autorisé (50 €)un seul remboursement, vérifié✓ PASS3 / 3€0.11
Résiliation en fin de périodeaccès conservé jusqu’à l’échéance✕ FAIL1 / 3€0.14
Demande en double, même cléun seul effet✓ PASS3 / 3€0.10
État du fournisseur illisibleaucun faux succès◐ INCONCLUSIVE—€0.14
07 — SCÉNARIOS
Familles de scénarios

Commencez par les actions qui touchent à l’argent

88 modèles pour les actions où une erreur coûte le plus cher (remboursements, résiliations, mises en pause, changements de formule et commandes) sur Stripe, Paddle, Chargebee, Shopify et Recharge.

Remboursements

10 modèles
  • Montant au-delà du mandat
  • Remboursement à un autre client
  • Mauvaise devise
  • Demandes en double / simultanées
  • Refus du fournisseur ou réponse perdue

Résiliations

10 modèles
  • Arrêt en fin de période, accès conservé
  • Accès supprimé trop tôt
  • Mauvais abonnement
  • Demande en double
  • Cas limites d’échéance / de fuseau horaire

Changement de formule

bientôt
  • Immédiat ou en fin de cycle
  • Montée en gamme avec prorata
  • Reporté à une version ultérieure
  • Prévu après le pilote
08 — ISOLATION
Isolation et confiance

Un contrôle contournable ne protège rien.

L’agent ne détient jamais d’identifiants d’écriture et l’isolation est appliquée côté serveur. La sécurité est intégrée au MVP, pas ajoutée après coup.

ÉCRITURES SOUS MANDAT

L’agent ne peut pas écrire directement

Seul l’exécuteur de COLVO dispose d’un accès en écriture au fournisseur. L’agent propose dans le cadre d’un mandat enregistré par votre backend de confiance : un identifiant fourni dans le chat ne suffit jamais.

ISOLATION DES TENANTS

Rien ne fuit d’une organisation à l’autre

L’identité de l’organisation provient de la session authentifiée et est appliquée par la row-level security de Postgres. L’accès entre comptes est refusé aussi bien dans l’UI que dans l’API, les exports et le worker.

CONTRÔLE DES SORTIES

Appels sortants verrouillés

Uniquement des hôtes approuvés. Adresses locales, privées et de métadonnées bloquées, DNS et redirections revérifiés : protection SSRF par défaut.

SECRETS ET PREUVES

Chiffré, cloisonné, append-only

Secrets chiffrés au repos et séparés de la production. Chaque décision et action est journalisée en append-only, et les données peuvent être supprimées sur demande.

09 — TARIFS
Tarifs

Commencez gratuitement. Passez à une offre payante quand votre agent touche à de l’argent réel.

Des formules mensuelles simples par agence. L’usage de Test est inclus ; les actions en production et les exécutions lourdes sont mesurées en toute transparence.

Free
€0 / mois
Validez le concept sur votre propre agent, dans la sandbox, avant de payer le moindre centime.
  • 100 exécutions de test / mois
  • COLVO Test + AI Test Architect
  • 88 modèles de scénarios, sandbox + rapports
  • Export JSON / CSV / PDF
Commencer gratuitement
Test
€19 / mois
Évaluation à grande échelle avec un contrôle en CI, pour les équipes qui livrent des versions d’agent chaque semaine.
  • 2 000 exécutions / mois
  • Run API, CLI et GitHub Action
  • Surveillance planifiée avec alertes de dérive
  • Comparaison de versions et rapports de régression
Demander l’accès
La plus choisie
Guard
€99 / mois
Test + Guard en production pour les équipes qui exploitent des assistants clients sur des transactions réelles.
  • Tout Test, exécutions illimitées
  • Guard en production : mandats, approbations, vérification
  • Pack de guardrails + plafonds par utilisateur final
  • Export de conformité, red team, surveillance planifiée
Demander l’accès

Prix par organisation, facturés mensuellement. L’usage de l’IA est mesuré au coût réel (BYOK ou géré) et affiché par exécution : jamais de 0 € trompeur.

10 — FAQ
FAQ

Les réponses honnêtes

Sans détour. S’il y a une limite, nous le disons d’emblée.

Encore une question ?

Posez-nous toutes vos questions sur votre configuration : nous vous dirons franchement si COLVO vous convient.

Parlons-en
Quelle est la différence entre Test et Guard ?

Test s’exécute avant la mise en production : il rejoue des scénarios dans une sandbox et attribue PASS/FAIL/INCONCLUSIVE. Guard s’exécute en production : il évalue chaque action réelle par rapport à votre mandat et renvoie ALLOW/REVIEW/HOLD/DENY, en retenant les actions risquées pour une validation humaine avant toute exécution.

L’agent touche-t-il directement à Stripe ?

Non. L’agent ne détient jamais d’identifiants d’écriture : il ne fait que proposer des actions. C’est l’exécuteur de COLVO qui écrit, et seulement après autorisation de la politique (ou validation humaine). C’est ce qui rend le garde-fou réel et non simplement indicatif.

Pourquoi ne pas simplement croire la réponse de l’agent ?

Parce que la réponse peut être fausse. « C’est fait, je vous ai remboursé 50 € » alors que 500 € sont partis – ou rien du tout – c’est exactement ce qui vous coûte de l’argent. COLVO vérifie l’état réel chez le fournisseur : un mensonge sûr de lui échoue quand même.

Quelles actions la première version couvre-t-elle ?

Les remboursements et les résiliations sur Stripe, les deux processus où une mauvaise action coûte le plus cher. Les changements de formule et d’autres actions sont prévus après le pilote.

Que signifient INCONCLUSIVE / HOLD ?

Le résultat n’était pas fiable : état illisible, panne ou délai dépassé. Ce n’est jamais compté comme un succès ni exécuté en silence. Une erreur backend simulée est différente : l’agent peut quand même réussir s’il gère correctement l’échec.

Mes données sont-elles en sécurité ?

Les pilotes utilisent des données fictives. Les secrets sont chiffrés et séparés de la production, les clients isolés par sécurité au niveau des lignes, les appels sortants limités aux hôtes autorisés, chaque action journalisée en ajout seul, et les données supprimables sur demande.

≠

Cessez de vous fier à la réponse.

Testez votre agent avant sa mise en production, puis protégez chaque action réelle une fois en ligne. D’abord dans une copie sûre de votre environnement.

COLVO — Testez avant. Protégez pendant. Vérifiez après.