Limite de rată

Limitele aplicate de această implementare, redate din tabelul pe care îl citește limitatorul, cu ceea ce numără fiecare bucket.

Bucket Limită Fereastră Contorizate
key_chat
apeluri de inferență făcute cu o singură cheie API
600 1 min per cheie API
org_chat
apeluri de inferență pentru o întreagă organizație
1800 1 min per organizație
platform
apeluri API de platformă: organizație, chei, utilizare, trace-uri, politici
300 1 min per cheie API
public_chat
apeluri anonime din playground
20 1 h per adresă IP
public_page
cereri pentru pagini publice
300 1 h per adresă IP
public_card_request
cereri pentru carduri de model trimise din formularul public
5 1 h per adresă IP
auth
încercări de autentificare, înregistrare, recuperare și resetare a parolei
20 15 min per adresă IP

Concurență

Cel mult 8 cereri pot fi în curs simultan pe o singură cheie API. O cerere peste acest număr așteaptă în loc să eșueze, până când coada este plină.

Cum arată un refuz

429 cu codul rate_limit_exceeded și tipul rate_limit_error. Astăzi nu există anteturi x-ratelimit-* sau retry-after: mesajul indică ora de resetare a ferestrei, iar acesta este singurul semnal. Tratează 429 ca reîncercabil cu backoff; tratează orice altă eroare din această documentație ca o cerere care trebuie modificată înainte de a putea reuși.

Unde se află contorul

Ferestrele sunt contorizate în procesul API și scrise înapoi în baza de date la fiecare câteva secunde, astfel încât o repornire continuă fereastra în loc să acorde un buget nou. Plafonul care rezultă este declarat, nu descoperit: contorul este per nod API, deci două noduri dublează fiecare limită efectivă. REDIS_URL este rezervat pentru versiunea partajată și nimic nu îl citește încă — rulează un singur nod API sau acceptă limitele per nod.