Limites de taxa
Os limites que esta implementação aplica, apresentados a partir da tabela que o limitador lê, com o que cada bucket conta.
| Bucket | Limite | Janela | Contabilizado |
|---|---|---|---|
| key_chat chamadas de inferência feitas com uma chave de API |
600 | 1 min | por chave de API |
| org_chat chamadas de inferência em toda uma organização |
1800 | 1 min | por organização |
| platform chamadas à API da plataforma: organização, chaves, utilização, traces, políticas |
300 | 1 min | por chave de API |
| public_chat chamadas anónimas ao playground |
20 | 1 h | por endereço IP |
| public_page pedidos de páginas públicas |
300 | 1 h | por endereço IP |
| public_card_request pedidos de model card enviados a partir do formulário público |
5 | 1 h | por endereço IP |
| auth tentativas de início de sessão, registo, recuperação e redefinição de palavra-passe |
20 | 15 min | por endereço IP |
Concorrência
No máximo 8 pedidos podem estar em curso numa chave de API ao mesmo tempo. Um pedido acima disso espera em vez de falhar, até a fila estar cheia.
Como é uma recusa
429 com o código rate_limit_exceeded e o tipo rate_limit_error. Hoje não existem cabeçalhos x-ratelimit-* ou retry-after: a mensagem indica o momento de reinício da janela, e esse é o único sinal. Trate um 429 como repetível com backoff; trate qualquer outro erro nesta documentação como um pedido que tem de mudar antes de poder ter sucesso.
Onde fica o contador
As janelas são contabilizadas no processo da API e escritas de volta na base de dados a cada poucos segundos, por isso um reinício continua a janela em vez de atribuir um orçamento novo. O limite máximo daí resultante é declarado em vez de descoberto: o contador é por nó de API, por isso dois nós duplicam todos os limites efetivos. REDIS_URL está reservado para a versão partilhada e nada o lê ainda — execute um nó de API, ou aceite limites por nó.