Was wir beim Testen von KI-Agenten lernen, die erstatten, kündigen und Pläne wechseln – und was schiefgeht, wenn niemand nachprüft.

Ein Agent kann höflich, selbstsicher und völlig falsch darin sein, was er getan hat. Deshalb liest COLVO nach jeder Aktion das Konto selbst aus.
Beitrag lesen →
GuardEine höflich erbetene Erstattung von 120 € liegt trotzdem 70 € über dem Limit. Wie COLVO aus „der Kunde war verärgert“ ein ALLOW, REVIEW oder DENY macht – ohne KI in der Entscheidung.
ProduktAuf Chargebee erstattet ein Agent eine Rechnung, keine Zahlung – und Chargebee merkt sich einen Wiederholungsversuch nur 30 Minuten lang. Was das für einen KI-Agenten bedeutet und wie COLVO damit umgeht.
ProduktPaddle prüft Erstattungen vor der Auszahlung, und seine API kennt keine Idempotenzschlüssel. Zwei Gründe, warum ein KI-Agent auf Paddle dem Kunden das Falsche sagen – oder doppelt erstatten – kann.
ProduktStripe sah perfekt aus. Der Agent hatte trotzdem zweimal versucht zu kündigen. Warum wir jetzt den OpenTelemetry-Trace des Agenten lesen – und warum ein fehlender Trace nie einen Test scheitern lässt.
ProduktFreigabe-Buttons, die COLVO genau bei der betreffenden Anfrage öffnen. Warum in Slack selbst nichts freigegeben wird.
LaunchWas wir gebaut haben, für wen es ist, und die drei Momente, auf die es ankommt: vor dem Launch, im Moment der Aktion und danach.