Construit autour d’une idée : vérifier le résultat, pas la réponse, en test comme en production. Voici la liste complète, regroupée selon le moment où chaque fonction travaille pour vous.
Chaque tentative agit sur des comptes fictifs neufs qui imitent Stripe. Jamais d’utilisateurs, de données ni de paiements réels.
fixture neuve à chaque tentative88 modèles pour les remboursements, résiliations, mises en pause, changements de formule et commandes ; les exécutions répétées détectent l’instabilité, la comparaison de versions les régressions.
versionnés et approuvésDécrivez votre agent ; COLVO rédige des scénarios (demande, règle approuvée, données de départ). Un humain approuve avant toute exécution.
mesuré, consultatifGénère des entrées hostiles et des cas limites (tentatives d’injection, montants à la limite, résiliations ambiguës) et signale ce qui est passé.
bloqués vs passésPASS / FAIL / INCONCLUSIVE issus de contrôles explicites de l’état. Un juge sémantique peut commenter ; il ne renverse jamais un FAIL.
aucun faux vertExécutez la suite depuis la CI ou selon une planification ; faites échouer le build sur FAIL ; soyez alerté des régressions.
cli · cronChaque action proposée est évaluée au regard du mandat et renvoie ALLOW / REVIEW / HOLD / DENY avec les motifs.
avant l’écritureLes actions risquées attendent une personne, qui signe l’empreinte exacte de ce qui va se produire.
human-in-the-loopCOLVO lit lui-même l’état réel et le compare à la règle. La réponse n’est qu’une affirmation.
l’état, pas le texteClés métier stables, réservations et outbox : une relance ne crée jamais un second remboursement.
effet unique garantiDétection des injections de prompt et des données personnelles avec masquage en entrée ; ancrage factuel et toxicité en sortie ; mode bloquant ou consultatif pour chaque guardrail.
entrée · sortieActions et dépenses par client sur des fenêtres glissantes : HOLD ou DENY lorsqu’un utilisateur final les dépasse.
par sujetArrêtez instantanément les nouvelles écritures d’un projet ; les actions en cours sont retenues et réconciliées, jamais perdues.
un clicMISMATCH, UNVERIFIABLE et TEST_FAIL ouvrent des incidents avec preuves ; alertes Slack, e-mail et webhook.
ouvert → résoluJournal append-only de chaque demande, décision, action et instantané d’état. JSON, CSV et PDF pour chaque exécution.
JSON · CSV · PDFPar organisation et par période : décisions, approbations, déclenchements de guardrails, vérifications. Chaînés en SHA-256 et recalculables.
inviolableTaux de réussite dans le temps, instabilité, taux de blocage, coût par exécution, points où l’agent échoue de façon récurrente.
tendancesChaque appel IA est mesuré : coût connu via la passerelle ou estimé d’après le catalogue, jamais de 0 € trompeur. Plafonds au niveau de l’organisation et de la plateforme.
BYOK ou géréProjets avec rôles owner / editor / viewer et isolation stricte par organisation sur chaque ressource.
multi-tenantQui a fait quoi et quand (connexions, modifications de clés, changements de formule, décisions), pour votre équipe et pour les revues de sécurité.
auditFree ne comprend que Test, avec 100 exécutions par mois. Test ajoute le contrôle en CI et les planifications. Guard ajoute la protection en production, les guardrails, les plafonds, l’export de conformité et la red team. Comparer les formules →
Testez votre agent avant sa mise en production, puis protégez chaque action réelle une fois en ligne. D’abord dans une copie sûre de votre environnement.