Guardrails und Limits

Guardrails sind Sicherheitsprüfungen innerhalb der Guard-Pipeline: auf der Eingabe vor dem Modell, auf der Ausgabe vor dem Kunden. Jede Rail liefert ALLOW, REVIEW, DENY oder REDACT und wird mit der Richtlinienentscheidung zusammengeführt. Limits begrenzen, was ein einzelner Endkunde auslösen kann.

Direkt aus dem Code geschrieben · aktualisiert am 26 Sept. 2026 · Fehlt etwas oder ist etwas falsch? Schreib uns

Rails

idPhaseWieErlaubte Aktionen
prompt_injectioninputdeterministische Muster + optionaler KI-Richter, nur auf den natürlichsprachlichen KontextREVIEW, DENY
pii_inputinputdeterministisch: E-Mails, Karten, Telefonnummern, IBANsREDACT, REVIEW, DENY
groundednessoutputKI-Richter: Ist die Antwort durch den abgerufenen Kontext und den realen Zustand gedeckt?REVIEW, DENY
toxicityoutputKI-Richter: richtlinienwidrige oder beleidigende FormulierungenREVIEW, DENY
pii_outputoutputdeterministische SchwärzungREDACT, REVIEW, DENY
  • Deterministische Rails benötigen keine KI. KI-Richter laufen nur mit einem konfigurierten Schlüssel, werden abgerechnet und benötigen 75 % Konfidenz, um als Treffer zu zählen.
  • enforce ändert die Entscheidung (DENY > REVIEW > REDACT > ALLOW beim Zusammenführen mit der Richtlinie). advisory protokolliert den Treffer und zeigt ihn an, ohne die Entscheidung zu ändern. Plattform-Standards: Eingabe-Rails enforce, Ausgabe-Richter-Rails advisory.
  • REDACT maskiert den Text, und der Ablauf geht weiter; es ist eine Rail-Aktion, nie eine Entscheidung über eine Operation.
  • Jeder Treffer wird in die Append-only-Nachweise geschrieben und auf der Guardrails-Seite aufgelistet (standardmäßig Produktionsumfang).

Konfiguration

GET /v1/guardrails?project_id=… · PUT /v1/guardrails Backend-API-Schlüssel oder Sitzung (Editor+) · GET /v1/guardrails/hits (Keyset-Paginierung). Erfordert die Guardrails-Funktion.

{ "project_id": "…", "rails": [
  { "id": "prompt_injection", "enabled": true, "action_on_hit": "DENY",   "mode": "enforce" },
  { "id": "pii_input",        "enabled": true, "action_on_hit": "REDACT", "mode": "enforce" },
  { "id": "groundedness",     "enabled": true, "action_on_hit": "REVIEW", "mode": "advisory" }
] }

Übergeben Sie den Gesprächstext mit dem Vorschlag (context.user_message, context.agent_reply, context.retrieved[]), damit die Rails etwas zu lesen haben; Parameter werden immer deterministisch geprüft.

Limits pro Endkunde

Bis zu sechs Limits pro Projekt, angewendet auf die customer_id des Mandatsgegenstands über gleitende Zeitfenster (hour, day, month): max_actions und/oder max_amount_minor, mit action_on_exceed HOLD (Standard) oder DENY. Konfigurieren Sie sie auf der Projektseite oder per PUT /v1/projects/{id}/end-user-caps. Siehe Mandate.

Ausgabenlimits

KI-Ausgaben sind pro Organisation (Einstellungen → KI-Provider) und pro Plattform begrenzt. Bei 80 % erhalten die Owner eine E-Mail; bei 100 % stoppen KI-Aufrufe, und die deterministischen Prüfungen laufen unbeeinträchtigt weiter.

Guardrails und Limits · Docs · COLVO