Limites de débit

Les limites appliquées par ce déploiement, rendues depuis le tableau que lit le limiteur, avec ce que compte chaque compartiment.

Compartiment Limite Fenêtre Compté
key_chat
appels d'inférence effectués avec une clé API
600 1 min par clé API
org_chat
appels d'inférence sur l'ensemble d'une organisation
1800 1 min par organisation
platform
appels à l'API de plateforme : organisation, clés, utilisation, traces, politiques
300 1 min par clé API
public_chat
appels anonymes au playground
20 1 h par adresse IP
public_page
requêtes vers les pages publiques
300 1 h par adresse IP
public_card_request
requêtes de fiche de modèle envoyées depuis le formulaire public
5 1 h par adresse IP
auth
tentatives de connexion, d'inscription, de récupération et de réinitialisation de mot de passe
20 15 min par adresse IP

Concurrence

Au plus 8 requêtes peuvent être en cours sur une clé API à la fois. Une requête au-delà attend au lieu d'échouer, jusqu'à ce que la file d'attente soit pleine.

À quoi ressemble un refus

429 avec le code rate_limit_exceeded et le type rate_limit_error. Il n'y a aujourd'hui aucun en-tête x-ratelimit-* ni retry-after : le message indique l'heure de réinitialisation de la fenêtre, et c'est le seul signal. Traitez un 429 comme réessayable avec un backoff ; traitez toute autre erreur de cette documentation comme une requête qui doit changer avant de pouvoir réussir.

Où réside le compteur

Les fenêtres sont comptées dans le processus API et réécrites en base de données toutes les quelques secondes, ainsi un redémarrage poursuit la fenêtre au lieu d'attribuer un nouveau budget. Le plafond qui en découle est énoncé plutôt que découvert : le compteur est par nœud API, donc deux nœuds doublent chaque limite effective. REDIS_URL est réservé à la version partagée et rien ne le lit encore — exécutez un seul nœud API, ou acceptez les limites par nœud.