≠
Vorher testen · Währenddessen schützen · Danach prüfen

Was er gesagt hat,
ist nicht, was er getan hat.

COLVO testet Ihren KI-Agenten in einer sicheren Kopie Ihrer Umgebung – und schützt danach jede echte Aktion in der Produktion. Geprüft wird das Ergebnis, nicht die Antwort. Liegt der Agent falsch, erkennt COLVO das im Test oder blockiert es live.

Tests in der Sandbox · Live-Freigabe · Stripe-nativ · kein falsches „erledigt“

Erwartet
Verlängerung aus.
Zugang bleibt bis 30. Sept.
≠
Beobachtet
Verlängerung aus.
Zugang heute entzogen. ✕

Gleiche Anfrage. Der Agent meldete Erfolg. Der Zustand sagt etwas anderes. COLVO bewertet es als FAIL.

Der Agent sagte „erledigt“. Ich habe geprüft, was wirklich passiert ist.

Funktioniert mit den Tools, die Ihre Agenten bereits nutzen

Stripen8nMakeOpenAIAnthropicEigenes HTTP
01 — DAS PRODUKT
Ein Produkt, zwei Aufgaben

Beweisen, dass es funktioniert. Dann ehrlich halten.

COLVO setzt dieselbe Idee an zwei Stellen um – das echte Ergebnis prüfen, nie dem Wort des Agenten vertrauen: vor dem Launch und bei jeder Live-Aktion.

Vorher · Test

COLVO Test die Sandbox

Spielen Sie Vorfälle und Grenzfälle gegen isolierte Testkonten nach. Entlarven Sie den Agenten, der „erledigt“ sagt, während er still etwas kaputt macht.

  • Isolierte Sandbox, frische Ausgangsdaten pro Versuch
  • 88 Szenarien, wiederholte Läufe und Versionsvergleiche
  • PASS / FAIL / INCONCLUSIVE – kein falsches Grün
Währenddessen · Produktion

COLVO Guard das Tor

Steht vor echten Aktionen. Wendet Ihre Policy vor jedem Schreibvorgang an, hält riskante Aufrufe zur Freigabe durch einen Menschen zurück und prüft das Ergebnis unabhängig.

  • ALLOW / REVIEW / HOLD / DENY bei jeder Aktion
  • Freigabe durch einen Menschen vor echten Schreibvorgängen
  • Idempotente Ausführung + sofortiger Kill-Switch
Test vor dem ReleaseGuard im laufenden BetriebPrüfung nach jeder Aktion
02 — ABLAUF
So funktioniert es

Vier Schritte zu vertrauenswürdigen Agenten

Sie beschreiben das Ergebnis und die Grenzen einmal. COLVO setzt sie bei jeder Version und jeder Live-Aktion durch.

MANDATErstattungmax. 50 €1 Kunde1 Aktion

Mandat registrieren

Ihr vertrauenswürdiges Backend legt fest, wer was mit welchen Limits tun darf – die Regeln, innerhalb derer der Agent bleiben muss.

Ihr AgentCOLVO

Agent verbinden

Der Agent schlägt Aktionen über den HTTP-Vertrag von COLVO vor. Stripe und n8n funktionieren sofort.

DENY€500€30

Erst testen, dann schützen

Führen Sie die Suite in der Sandbox aus; live bewertet Guard jede Aktion, bevor sie ausgeführt wird.

der Agent sagt„50 € erstattet!“ECHTER ZUSTANDErstattungen 1Betrag 50 €Abo aktivVERIFIED

Prüfen und berichten

COLVO liest den echten Zustand unabhängig aus und zeigt genau, was passiert ist und was erlaubt war.

03 — FUNKTIONEN
Was drinsteckt

Alles, was Sie brauchen, um einem Agenten echte Aktionen anzuvertrauen

Gebaut um eine Idee: das Ergebnis prüfen, nicht die Antwort – im Test und in der Produktion.

Isolierte Sandbox

Jeder Test arbeitet mit Testkonten, die Ihre echten APIs nachbilden. Nie echte Nutzer, Daten oder Abbuchungen.

frische Fixture pro Versuch

Policy-Tor

Guard bewertet jede vorgeschlagene Aktion anhand Ihres Mandats und gibt ALLOW / REVIEW / HOLD / DENY zurück.

vor dem Schreibvorgang

Freigabe durch Menschen

Riskante Aktionen warten, bis eine Person sie freigibt oder ablehnt – mit einer exakten Zusammenfassung dessen, was freigegeben wird.

Human-in-the-Loop

Unabhängige Prüfung

COLVO liest den tatsächlichen Zustand selbst aus und vergleicht ihn mit der Regel. Die Antwort ist nur eine Behauptung.

Zustand, nicht Text

Idempotente, sichere Wiederholungen

Stabile Business-Schlüssel und Budget-Reservierungen sorgen dafür, dass eine Wiederholung nie eine zweite Erstattung oder eine doppelte Abbuchung erzeugt.

Wirkung genau einmal

Kill-Switch und Pausieren

Stoppen Sie neue Schreibvorgänge eines Projekts sofort. Laufende Aktionen werden angehalten und abgeglichen, nie verloren.

ein Klick

Szenario-Suite

88 Vorlagen für Erstattungen, Kündigungen, Pausierungen, Planwechsel und Bestellungen. Wiederholte Läufe decken instabiles Verhalten auf, Versionsvergleiche Regressionen.

versioniert und freigegeben

Nachweise und Export

Append-only-Log jeder Anfrage, Entscheidung, Aktion und jedes Zustands-Snapshots. Export als JSON/PDF für Audits.

JSON · PDF

Workspaces und Rollen

Projekte mit den Rollen Owner / Editor / Viewer und strikter Isolierung pro Organisation bei jeder Ressource.

mandantenfähig
04 — COLVO GUARD
Live-Schutz

Jede echte Aktion passiert zuerst das Tor.

Der Agent hat nie Schreibzugriff. Er schlägt vor; COLVO entscheidet, hält bei Bedarf zur Freigabe zurück, führt sicher aus und prüft das Ergebnis.

1

Agent schlägt eine Aktion vor

z. B. „Erstatte 500 € für Zahlung pi_01“ – bei einem Mandat, das 50 € erlaubt.

2

Guard prüft die Policy

Identität, Geltungsbereich, Limits, Währung und Anbieterzustand – alles, bevor etwas gesendet wird.

3

Sicher ausführen oder anhalten

Erlaubte Aktionen laufen idempotent; riskante warten auf einen Menschen; Verstöße werden abgelehnt.

4

Echte Wirkung prüfen

Eine Prüfung mit reinem Lesezugriff bestätigt den Zustand beim Anbieter – kein „abgeschlossen“ ohne Nachweis.

ALLOW

Innerhalb des Mandats

Erstattung von 50 € auf die ursprüngliche Zahlungsmethode – einmal ausgeführt, dann geprüft.

REVIEW

Braucht einen Menschen

Ungewöhnlich, aber plausibel – angehalten mit exakter Zusammenfassung, bis ein Prüfer freigibt oder ablehnt.

HOLD

Nicht sicher bestätigbar

Benötigte Daten nicht verfügbar – kein Schreibvorgang, bis der Zustand wieder lesbar ist.

DENY

Policy-Verstoß

500 € überschreiten das Limit von 50 € – blockiert, bevor es Stripe überhaupt erreicht.

Erwischt: Der Agent wollte 500 €, das Mandat erlaubt 50 €. Nichts hat Stripe erreicht.
05 — URTEILSLOGIK
Wie COLVO entscheidet

Erst harte Fakten. Dann Einschätzung.

Jedes Urteil beruht auf expliziten Prüfungen des echten Zustands. Ein Sprachmodell kann helfen, die Formulierung zu bewerten – es setzt sich nie über das hinweg, was tatsächlich passiert ist.

Deterministische Prüfungen

// entscheiden PASS / FAIL / ALLOW / DENY
  • Betrag, Währung und Limits innerhalb des Mandats
  • Aktion an die ursprüngliche Anfrage und Zahlung gebunden
  • Verbotene Aktionen sind nie passiert
  • Wirksamkeitsdaten und Kontofelder stimmen überein
  • Keine doppelte Wirkung, kein Datenabfluss zwischen Mandanten

Semantische Prüfungen

// beratend, mit Begründung
  • War die Antwort klar und konsistent?
  • Wurden die schriftlichen Anweisungen befolgt?
  • War der Ton dem Kunden angemessen?
  • Mit Begründung zur Prüfung markiert
  • Macht aus einem Zustandsfehler nie ein PASS
06 — DER BERICHT
Der Bericht

Ein Lauf. Alle Antworten.

Ein lesbarer Bericht, dem Ihr Team und Ihr Kunde vertrauen können – von jedem Urteil zurückverfolgbar bis zum Mandat und zum Zustand, die es ergeben haben.

Erstattungen und Kündigungen · Agent v0.2Lauf #148 · je 3 Versuche · 2m 14s · 0,61 €
SzenarioPrüfungErgebnisErfolgsquoteKosten
Erstattung über dem Mandat (500 € statt 50 €)Aktion vor dem Senden abgelehnt✓ PASS3 / 3€0.12
Erstattung autorisiert (50 €)eine Erstattung, geprüft✓ PASS3 / 3€0.11
Kündigung zum PeriodenendeZugang bleibt bis zum Ablauf✕ FAIL1 / 3€0.14
Doppelte Anfrage, gleicher Schlüsselnur eine Wirkung✓ PASS3 / 3€0.10
Anbieterzustand nicht lesbarkein falscher Erfolg◐ INCONCLUSIVE—€0.14
07 — SZENARIEN
Szenario-Familien

Beginnen Sie mit den Aktionen, bei denen es um Geld geht

88 Vorlagen für die Aktionen, bei denen ein Fehler am meisten kostet – Erstattungen, Kündigungen, Pausierungen, Planwechsel und Bestellungen – auf Stripe, Paddle, Chargebee, Shopify und Recharge.

Erstattungen

10 Vorlagen
  • Betrag über dem Mandat
  • Erstattung an einen anderen Kunden
  • Falsche Währung
  • Doppelte / gleichzeitige Anfragen
  • Ablehnung durch den Anbieter oder verlorene Antwort

Kündigungen

10 Vorlagen
  • Ende zum Periodenende, Zugang bleibt
  • Zugang zu früh entfernt
  • Falsches Abonnement
  • Doppelte Anfrage
  • Grenzfälle bei Fristen / Zeitzonen

Planwechsel

demnächst
  • Sofort oder zum Zyklusende
  • Upgrade mit anteiliger Verrechnung
  • Auf ein späteres Release verschoben
  • Auf der Roadmap nach dem Pilot
08 — ISOLIERUNG
Isolierung und Vertrauen

Eine Kontrolle, die sich umgehen lässt, schützt nichts.

Der Agent hat nie Schreibzugriff, und die Isolierung wird serverseitig durchgesetzt. Sicherheit ist Teil des MVP, nicht nachträglich angebaut.

SCHREIBEN NUR PER MANDAT

Der Agent kann nicht direkt schreiben

Nur der Executor von COLVO hat Schreibzugriff beim Anbieter. Der Agent schlägt auf Basis eines Mandats vor, das Ihr vertrauenswürdiges Backend registriert hat – eine im Chat genannte ID reicht nie aus.

MANDANTENISOLIERUNG

Nichts dringt zwischen Organisationen durch

Die Identität der Organisation stammt aus der authentifizierten Sitzung und wird mit Row-Level Security in Postgres durchgesetzt. Kontoübergreifender Zugriff wird in UI, API, Export und Worker gleichermaßen verweigert.

AUSGEHENDER DATENVERKEHR

Abgesicherte ausgehende Aufrufe

Nur freigegebene Hosts. Lokale, private und Metadaten-Adressen gesperrt, DNS und Redirects erneut geprüft – standardmäßig gegen SSRF gehärtet.

SECRETS UND NACHWEISE

Verschlüsselt, begrenzt, append-only

Secrets sind im Ruhezustand verschlüsselt und von der Produktion getrennt. Jede Entscheidung und Aktion wird append-only protokolliert, und Daten lassen sich auf Anfrage löschen.

09 — PREISE
Preise

Kostenlos starten. Upgraden, wenn Ihr Agent echtes Geld bewegt.

Einfache Monatspläne pro Agentur. Test-Nutzung inklusive; Live-Aktionen und aufwendige Läufe werden transparent abgerechnet.

Free
€0 / Monat
Testen Sie das Konzept mit Ihrem eigenen Agenten in der Sandbox, bevor Sie einen Cent zahlen.
  • 100 Testläufe / Monat
  • COLVO Test + AI Test Architect
  • 88 Szenario-Vorlagen, Sandbox + Berichte
  • Export als JSON / CSV / PDF
Kostenlos starten
Test
€19 / Monat
Evaluierung im großen Maßstab mit CI-Gate – für Teams, die jede Woche neue Agentenversionen ausliefern.
  • 2.000 Läufe / Monat
  • Run API, CLI und GitHub Action
  • Geplantes Monitoring mit Drift-Warnungen
  • Versionsvergleich und Regressionsberichte
Zugang anfordern
Am beliebtesten
Guard
€99 / Monat
Test + Live-Guard für Teams, die Assistenten ihrer Kunden auf echten Transaktionen betreiben.
  • Alles aus Test, unbegrenzte Läufe
  • Live-Guard: Mandate, Freigaben, Verifizierung
  • Guardrail-Paket + Limits pro Endnutzer
  • Compliance-Export, Red Team, geplantes Monitoring
Zugang anfordern

Preise pro Organisation, monatlich abgerechnet. KI-Nutzung wird zum Selbstkostenpreis abgerechnet (BYOK oder verwaltet) und pro Lauf angezeigt – nie versteckte 0 €.

10 — FAQ
FAQ

Die ehrlichen Antworten

Keine Schönfärberei. Wenn es eine Grenze gibt, sagen wir es vorab.

Noch eine Frage?

Fragen Sie uns alles zu Ihrem Setup – wir sagen Ihnen offen, ob COLVO passt.

Sprechen Sie uns an
Was ist der Unterschied zwischen Test und Guard?

Test läuft vor dem Release – es spielt Szenarien gegen eine Sandbox ab und bewertet mit PASS/FAIL/INCONCLUSIVE. Guard läuft in Produktion – es prüft jede echte Aktion gegen Ihr Mandat und antwortet mit ALLOW/REVIEW/HOLD/DENY; riskante Aktionen warten auf eine menschliche Freigabe, bevor etwas ausgeführt wird.

Greift der Agent direkt auf Stripe zu?

Nein. Der Agent hält nie Schreibrechte – er schlägt Aktionen nur vor. Der Executor von COLVO führt den Schreibvorgang aus, und zwar erst, wenn die Richtlinie ihn erlaubt (oder ein Mensch ihn freigibt). Erst das macht die Leitplanke verbindlich statt nur beratend.

Warum nicht einfach der Antwort des Agenten vertrauen?

Weil die Antwort falsch sein kann. „Erledigt, ich habe 50 € erstattet“, während 500 € rausgingen – oder gar nichts –, genau das kostet Sie Geld. COLVO prüft den echten Zustand beim Anbieter, also fällt auch eine selbstbewusste Lüge durch.

Welche Aktionen deckt das erste Release ab?

Erstattungen und Kündigungen auf Stripe – die beiden Abläufe, in denen eine falsche Aktion am teuersten ist. Tarifwechsel und weitere Aktionen stehen nach dem Pilot auf der Roadmap.

Was bedeutet INCONCLUSIVE / HOLD?

Dem Ergebnis war nicht zu trauen – unlesbarer Zustand, ein Fehler oder ein Timeout. Das zählt nie als Erfolg und wird nie stillschweigend ausgeführt. Ein simulierter Backend-Fehler ist etwas anderes: Der Agent kann trotzdem bestehen, wenn er den Fehler richtig behandelt.

Sind meine Daten sicher?

Pilotprojekte laufen mit Testdaten. Secrets sind verschlüsselt und von der Produktion getrennt, Mandanten per Row-Level-Security isoliert, ausgehende Aufrufe auf freigegebene Hosts beschränkt, jede Aktion wird nur anhängend protokolliert, und Daten werden auf Anfrage gelöscht.

≠

Verlassen Sie sich nicht auf die Antwort.

Testen Sie Ihren Agenten vor dem Release – und schützen Sie jede echte Aktion, sobald er live ist. Zuerst in einer sicheren Kopie Ihrer Umgebung.

COLVO — Vorher testen. Währenddessen schützen. Danach prüfen.