Guardrails und Limits
Guardrails sind Sicherheitsprüfungen innerhalb der Guard-Pipeline: auf der Eingabe vor dem Modell, auf der Ausgabe vor dem Kunden. Jede Rail liefert ALLOW, REVIEW, DENY oder REDACT und wird mit der Richtlinienentscheidung zusammengeführt. Limits begrenzen, was ein einzelner Endkunde auslösen kann.
Rails
| id | Phase | Wie | Erlaubte Aktionen |
|---|---|---|---|
| prompt_injection | input | deterministische Muster + optionaler KI-Richter, nur auf den natürlichsprachlichen Kontext | REVIEW, DENY |
| pii_input | input | deterministisch: E-Mails, Karten, Telefonnummern, IBANs | REDACT, REVIEW, DENY |
| groundedness | output | KI-Richter: Ist die Antwort durch den abgerufenen Kontext und den realen Zustand gedeckt? | REVIEW, DENY |
| toxicity | output | KI-Richter: richtlinienwidrige oder beleidigende Formulierungen | REVIEW, DENY |
| pii_output | output | deterministische Schwärzung | REDACT, REVIEW, DENY |
- Deterministische Rails benötigen keine KI. KI-Richter laufen nur mit einem konfigurierten Schlüssel, werden abgerechnet und benötigen 75 % Konfidenz, um als Treffer zu zählen.
- enforce ändert die Entscheidung (DENY > REVIEW > REDACT > ALLOW beim Zusammenführen mit der Richtlinie). advisory protokolliert den Treffer und zeigt ihn an, ohne die Entscheidung zu ändern. Plattform-Standards: Eingabe-Rails enforce, Ausgabe-Richter-Rails advisory.
- REDACT maskiert den Text, und der Ablauf geht weiter; es ist eine Rail-Aktion, nie eine Entscheidung über eine Operation.
- Jeder Treffer wird in die Append-only-Nachweise geschrieben und auf der Guardrails-Seite aufgelistet (standardmäßig Produktionsumfang).
Konfiguration
GET /v1/guardrails?project_id=… · PUT /v1/guardrails Backend-API-Schlüssel oder Sitzung (Editor+) · GET /v1/guardrails/hits (Keyset-Paginierung). Erfordert die Guardrails-Funktion.
{ "project_id": "…", "rails": [
{ "id": "prompt_injection", "enabled": true, "action_on_hit": "DENY", "mode": "enforce" },
{ "id": "pii_input", "enabled": true, "action_on_hit": "REDACT", "mode": "enforce" },
{ "id": "groundedness", "enabled": true, "action_on_hit": "REVIEW", "mode": "advisory" }
] }Übergeben Sie den Gesprächstext mit dem Vorschlag (context.user_message, context.agent_reply, context.retrieved[]), damit die Rails etwas zu lesen haben; Parameter werden immer deterministisch geprüft.
Limits pro Endkunde
Bis zu sechs Limits pro Projekt, angewendet auf die customer_id des Mandatsgegenstands über gleitende Zeitfenster (hour, day, month): max_actions und/oder max_amount_minor, mit action_on_exceed HOLD (Standard) oder DENY. Konfigurieren Sie sie auf der Projektseite oder per PUT /v1/projects/{id}/end-user-caps. Siehe Mandate.
Ausgabenlimits
KI-Ausgaben sind pro Organisation (Einstellungen → KI-Provider) und pro Plattform begrenzt. Bei 80 % erhalten die Owner eine E-Mail; bei 100 % stoppen KI-Aufrufe, und die deterministischen Prüfungen laufen unbeeinträchtigt weiter.