Limites de taxa

Os limites que esta implementação aplica, apresentados a partir da tabela que o limitador lê, com o que cada bucket conta.

Bucket Limite Janela Contabilizado
key_chat
chamadas de inferência feitas com uma chave de API
600 1 min por chave de API
org_chat
chamadas de inferência em toda uma organização
1800 1 min por organização
platform
chamadas à API da plataforma: organização, chaves, utilização, traces, políticas
300 1 min por chave de API
public_chat
chamadas anónimas ao playground
20 1 h por endereço IP
public_page
pedidos de páginas públicas
300 1 h por endereço IP
public_card_request
pedidos de model card enviados a partir do formulário público
5 1 h por endereço IP
auth
tentativas de início de sessão, registo, recuperação e redefinição de palavra-passe
20 15 min por endereço IP

Concorrência

No máximo 8 pedidos podem estar em curso numa chave de API ao mesmo tempo. Um pedido acima disso espera em vez de falhar, até a fila estar cheia.

Como é uma recusa

429 com o código rate_limit_exceeded e o tipo rate_limit_error. Hoje não existem cabeçalhos x-ratelimit-* ou retry-after: a mensagem indica o momento de reinício da janela, e esse é o único sinal. Trate um 429 como repetível com backoff; trate qualquer outro erro nesta documentação como um pedido que tem de mudar antes de poder ter sucesso.

Onde fica o contador

As janelas são contabilizadas no processo da API e escritas de volta na base de dados a cada poucos segundos, por isso um reinício continua a janela em vez de atribuir um orçamento novo. O limite máximo daí resultante é declarado em vez de descoberto: o contador é por nó de API, por isso dois nós duplicam todos os limites efetivos. REDIS_URL está reservado para a versão partilhada e nada o lê ainda — execute um nó de API, ou aceite limites por nó.