Limites de débit
Les limites appliquées par ce déploiement, rendues depuis le tableau que lit le limiteur, avec ce que compte chaque compartiment.
| Compartiment | Limite | Fenêtre | Compté |
|---|---|---|---|
| key_chat appels d'inférence effectués avec une clé API |
600 | 1 min | par clé API |
| org_chat appels d'inférence sur l'ensemble d'une organisation |
1800 | 1 min | par organisation |
| platform appels à l'API de plateforme : organisation, clés, utilisation, traces, politiques |
300 | 1 min | par clé API |
| public_chat appels anonymes au playground |
20 | 1 h | par adresse IP |
| public_page requêtes vers les pages publiques |
300 | 1 h | par adresse IP |
| public_card_request requêtes de fiche de modèle envoyées depuis le formulaire public |
5 | 1 h | par adresse IP |
| auth tentatives de connexion, d'inscription, de récupération et de réinitialisation de mot de passe |
20 | 15 min | par adresse IP |
Concurrence
Au plus 8 requêtes peuvent être en cours sur une clé API à la fois. Une requête au-delà attend au lieu d'échouer, jusqu'à ce que la file d'attente soit pleine.
À quoi ressemble un refus
429 avec le code rate_limit_exceeded et le type rate_limit_error. Il n'y a aujourd'hui aucun en-tête x-ratelimit-* ni retry-after : le message indique l'heure de réinitialisation de la fenêtre, et c'est le seul signal. Traitez un 429 comme réessayable avec un backoff ; traitez toute autre erreur de cette documentation comme une requête qui doit changer avant de pouvoir réussir.
Où réside le compteur
Les fenêtres sont comptées dans le processus API et réécrites en base de données toutes les quelques secondes, ainsi un redémarrage poursuit la fenêtre au lieu d'attribuer un nouveau budget. Le plafond qui en découle est énoncé plutôt que découvert : le compteur est par nœud API, donc deux nœuds doublent chaque limite effective. REDIS_URL est réservé à la version partagée et rien ne le lit encore — exécutez un seul nœud API, ou acceptez les limites par nœud.