Was drinsteckt

Alles, was Sie brauchen, um einem Agenten zu vertrauen, wenn es um echte Aktionen geht.

Gebaut um eine Idee: das Ergebnis prüfen, nicht die Antwort – im Test und in der Produktion. Hier die vollständige Liste, gruppiert danach, wann sie für Sie arbeitet.

01 — TEST
Test

Den Agenten vor dem Release prüfen

Isolierte Sandbox

Jeder Versuch arbeitet mit frischen Testkonten, die Stripe nachbilden. Nie echte Nutzer, Daten oder Abbuchungen.

frische Fixture pro Versuch

Szenario-Suite

88 Vorlagen für Erstattungen, Kündigungen, Pausierungen, Planwechsel und Bestellungen; wiederholte Läufe decken Instabilität auf, Versionsvergleiche Regressionen.

versioniert und freigegeben

AI Test Architect

Beschreiben Sie Ihren Agenten; COLVO entwirft Szenarien – Anfrage, freigegebene Regel, Ausgangsdaten. Ein Mensch gibt frei, bevor etwas läuft.

nutzungsbasiert, beratend

Red Team

Erzeugt feindliche Eingaben und Grenzfälle – Injection-Versuche, Grenzbeträge, mehrdeutige Kündigungen – und meldet, was durchgekommen ist.

blockiert vs. durchgekommen

Deterministische Urteile

PASS / FAIL / INCONCLUSIVE aus expliziten Prüfungen des Zustands. Ein semantischer Bewerter kann kommentieren; ein FAIL kippt er nie.

kein falsches Grün

CI-Gate und Zeitpläne

Führen Sie die Suite aus der CI oder nach Zeitplan aus; lassen Sie den Build bei FAIL scheitern; erhalten Sie Warnungen bei Regressionen.

cli · cron
02 — PRODUKTION
Produktion

Jede echte Aktion schützen

Policy-Tor

Jede vorgeschlagene Aktion wird anhand des Mandats bewertet und liefert ALLOW / REVIEW / HOLD / DENY mit Begründung.

vor dem Schreibvorgang

Freigabe durch Menschen

Riskante Aktionen warten auf eine Person, die eine exakte Zusammenfassung dessen abzeichnet, was passieren wird.

Human-in-the-Loop

Unabhängige Prüfung

COLVO liest den tatsächlichen Zustand selbst aus und vergleicht ihn mit der Regel. Die Antwort ist nur eine Behauptung.

Zustand, nicht Text

Idempotente, sichere Wiederholungen

Stabile Business-Schlüssel, Reservierungen und ein Outbox: Eine Wiederholung erzeugt nie eine zweite Erstattung.

Wirkung genau einmal

Guardrails

Erkennung von Prompt Injection und personenbezogenen Daten mit Schwärzung bei der Eingabe; Faktentreue und Toxizität bei der Ausgabe; pro Guardrail durchsetzend oder beratend.

Eingabe · Ausgabe

Limits pro Endkunde

Aktionen und Ausgaben pro Kunde in gleitenden Zeitfenstern – HOLD oder DENY, wenn ein einzelner Endnutzer sie überschreitet.

pro Subjekt

Kill-Switch und Pausieren

Stoppen Sie neue Schreibvorgänge eines Projekts sofort; laufende Aktionen werden angehalten und abgeglichen, nie verloren.

ein Klick

Vorfälle und Warnungen

MISMATCH, UNVERIFIABLE und TEST_FAIL eröffnen Vorfälle mit Nachweisen; Warnungen per Slack, E-Mail und Webhook.

offen → gelöst
03 — VERTRAUEN UND BETRIEB
Vertrauen und Betrieb

Nachweise, Einblick und Kontrolle

Nachweise und Export

Append-only-Log jeder Anfrage, Entscheidung, Aktion und jedes Zustands-Snapshots. JSON, CSV und PDF pro Lauf.

JSON · CSV · PDF

Compliance-Bericht

Pro Organisation und Zeitraum: Entscheidungen, Freigaben, Guardrail-Treffer, Prüfungen – per SHA-256 verkettet und nachrechenbar.

manipulationssicher

Analytics

Erfolgsquote über die Zeit, Instabilität, Blockierungsrate, Kosten pro Lauf, wo der Agent immer wieder scheitert.

Trends

Abgerechnete KI-Kosten

Jeder KI-Aufruf wird erfasst: bekannt vom Gateway oder geschätzt anhand des Katalogs, nie versteckte 0 €. Limits auf Organisations- und Plattformebene.

BYOK oder verwaltet

Workspaces und Rollen

Projekte mit den Rollen Owner / Editor / Viewer und strikter Isolierung pro Organisation bei jeder Ressource.

mandantenfähig

Aktivitätsprotokoll

Wer hat was wann getan – Anmeldungen, Schlüsseländerungen, Planwechsel, Entscheidungen – für Ihr Team und für Sicherheitsprüfungen.

Audit
Pläne

Dieselbe Ehrlichkeit in jedem Plan

Free ist nur Test, mit 100 Läufen im Monat. Test ergänzt das CI-Gate und Zeitpläne. Guard ergänzt Live-Schutz, Guardrails, Limits, Compliance-Export und das Red Team. Pläne vergleichen →

≠

Verlassen Sie sich nicht auf die Antwort.

Testen Sie Ihren Agenten vor dem Release – und schützen Sie jede echte Aktion, sobald er live ist. Zuerst in einer sicheren Kopie Ihrer Umgebung.

Funktionen — alles, um einem Agenten echte Aktionen anzuvertrauen · COLVO