Guardrails et plafonds
Les guardrails sont des contrôles de sécurité intégrés au pipeline de Guard : sur l’entrée avant le modèle, sur la sortie avant le client. Chaque rail renvoie ALLOW, REVIEW, DENY ou REDACT et se combine avec la décision de la politique. Les plafonds limitent ce qu’un même client final peut déclencher.
Rails
| id | Étape | Méthode | Actions autorisées |
|---|---|---|---|
| prompt_injection | input | motifs déterministes + juge IA facultatif, uniquement sur le contexte en langage naturel | REVIEW, DENY |
| pii_input | input | déterministe : e-mails, cartes, téléphones, IBAN | REDACT, REVIEW, DENY |
| groundedness | output | juge IA : la réponse est-elle étayée par le contexte récupéré et l’état réel ? | REVIEW, DENY |
| toxicity | output | juge IA : formulation hors politique ou injurieuse | REVIEW, DENY |
| pii_output | output | masquage déterministe | REDACT, REVIEW, DENY |
- Les rails déterministes ne nécessitent aucune IA. Les juges IA ne s’exécutent qu’avec une clé configurée, sont facturés à l’usage et exigent une confiance de 75 % pour compter comme un déclenchement.
- enforce modifie la décision (DENY > REVIEW > REDACT > ALLOW lorsqu’il est combiné avec la politique). advisory enregistre le déclenchement et l’affiche, sans modifier la décision. Valeurs par défaut de la plateforme : rails d’entrée en enforce, rails juges de sortie en advisory.
- REDACT masque le texte et le flux se poursuit ; c’est une action du rail, jamais une décision sur l’opération.
- Chaque déclenchement est consigné dans les preuves en ajout seul (append-only) et listé sur la page Guardrails (périmètre production par défaut).
Configuration
GET /v1/guardrails?project_id=… · PUT /v1/guardrails clé API backend ou session (éditeur+) · GET /v1/guardrails/hits (pagination keyset). Nécessite la fonctionnalité guardrails.
{ "project_id": "…", "rails": [
{ "id": "prompt_injection", "enabled": true, "action_on_hit": "DENY", "mode": "enforce" },
{ "id": "pii_input", "enabled": true, "action_on_hit": "REDACT", "mode": "enforce" },
{ "id": "groundedness", "enabled": true, "action_on_hit": "REVIEW", "mode": "advisory" }
] }Transmettez le texte de la conversation avec la proposition (context.user_message, context.agent_reply, context.retrieved[]) afin que les rails aient quelque chose à lire ; les paramètres sont toujours analysés de manière déterministe.
Plafonds par client final
Jusqu’à six plafonds par projet, appliqués au customer_id du sujet du mandat sur des fenêtres glissantes (hour, day, month) : max_actions et/ou max_amount_minor, avec action_on_exceed HOLD (par défaut) ou DENY. Configurez-les depuis la page du projet ou via PUT /v1/projects/{id}/end-user-caps. Voir mandats.
Plafonds de dépenses
Les dépenses IA sont plafonnées par organisation (Paramètres → Fournisseur IA) et par plateforme. À 80 %, les owners reçoivent un e-mail ; à 100 %, les appels IA s’arrêtent et les contrôles déterministes se poursuivent sans être affectés.