Guardrails et plafonds

Les guardrails sont des contrôles de sécurité intégrés au pipeline de Guard : sur l’entrée avant le modèle, sur la sortie avant le client. Chaque rail renvoie ALLOW, REVIEW, DENY ou REDACT et se combine avec la décision de la politique. Les plafonds limitent ce qu’un même client final peut déclencher.

Rédigé à partir du code · mis à jour le 26 sept. 2026 · Une erreur ou un oubli ? Écrivez-nous

Rails

idÉtapeMéthodeActions autorisées
prompt_injectioninputmotifs déterministes + juge IA facultatif, uniquement sur le contexte en langage naturelREVIEW, DENY
pii_inputinputdéterministe : e-mails, cartes, téléphones, IBANREDACT, REVIEW, DENY
groundednessoutputjuge IA : la réponse est-elle étayée par le contexte récupéré et l’état réel ?REVIEW, DENY
toxicityoutputjuge IA : formulation hors politique ou injurieuseREVIEW, DENY
pii_outputoutputmasquage déterministeREDACT, REVIEW, DENY
  • Les rails déterministes ne nécessitent aucune IA. Les juges IA ne s’exécutent qu’avec une clé configurée, sont facturés à l’usage et exigent une confiance de 75 % pour compter comme un déclenchement.
  • enforce modifie la décision (DENY > REVIEW > REDACT > ALLOW lorsqu’il est combiné avec la politique). advisory enregistre le déclenchement et l’affiche, sans modifier la décision. Valeurs par défaut de la plateforme : rails d’entrée en enforce, rails juges de sortie en advisory.
  • REDACT masque le texte et le flux se poursuit ; c’est une action du rail, jamais une décision sur l’opération.
  • Chaque déclenchement est consigné dans les preuves en ajout seul (append-only) et listé sur la page Guardrails (périmètre production par défaut).

Configuration

GET /v1/guardrails?project_id=… · PUT /v1/guardrails clé API backend ou session (éditeur+) · GET /v1/guardrails/hits (pagination keyset). Nécessite la fonctionnalité guardrails.

{ "project_id": "…", "rails": [
  { "id": "prompt_injection", "enabled": true, "action_on_hit": "DENY",   "mode": "enforce" },
  { "id": "pii_input",        "enabled": true, "action_on_hit": "REDACT", "mode": "enforce" },
  { "id": "groundedness",     "enabled": true, "action_on_hit": "REVIEW", "mode": "advisory" }
] }

Transmettez le texte de la conversation avec la proposition (context.user_message, context.agent_reply, context.retrieved[]) afin que les rails aient quelque chose à lire ; les paramètres sont toujours analysés de manière déterministe.

Plafonds par client final

Jusqu’à six plafonds par projet, appliqués au customer_id du sujet du mandat sur des fenêtres glissantes (hour, day, month) : max_actions et/ou max_amount_minor, avec action_on_exceed HOLD (par défaut) ou DENY. Configurez-les depuis la page du projet ou via PUT /v1/projects/{id}/end-user-caps. Voir mandats.

Plafonds de dépenses

Les dépenses IA sont plafonnées par organisation (Paramètres → Fournisseur IA) et par plateforme. À 80 %, les owners reçoivent un e-mail ; à 100 %, les appels IA s’arrêtent et les contrôles déterministes se poursuivent sans être affectés.

Guardrails et plafonds · Docs · COLVO