Limite de rată
Limitele aplicate de această implementare, redate din tabelul pe care îl citește limitatorul, cu ceea ce numără fiecare bucket.
| Bucket | Limită | Fereastră | Contorizate |
|---|---|---|---|
| key_chat apeluri de inferență făcute cu o singură cheie API |
600 | 1 min | per cheie API |
| org_chat apeluri de inferență pentru o întreagă organizație |
1800 | 1 min | per organizație |
| platform apeluri API de platformă: organizație, chei, utilizare, trace-uri, politici |
300 | 1 min | per cheie API |
| public_chat apeluri anonime din playground |
20 | 1 h | per adresă IP |
| public_page cereri pentru pagini publice |
300 | 1 h | per adresă IP |
| public_card_request cereri pentru carduri de model trimise din formularul public |
5 | 1 h | per adresă IP |
| auth încercări de autentificare, înregistrare, recuperare și resetare a parolei |
20 | 15 min | per adresă IP |
Concurență
Cel mult 8 cereri pot fi în curs simultan pe o singură cheie API. O cerere peste acest număr așteaptă în loc să eșueze, până când coada este plină.
Cum arată un refuz
429 cu codul rate_limit_exceeded și tipul rate_limit_error. Astăzi nu există anteturi x-ratelimit-* sau retry-after: mesajul indică ora de resetare a ferestrei, iar acesta este singurul semnal. Tratează 429 ca reîncercabil cu backoff; tratează orice altă eroare din această documentație ca o cerere care trebuie modificată înainte de a putea reuși.
Unde se află contorul
Ferestrele sunt contorizate în procesul API și scrise înapoi în baza de date la fiecare câteva secunde, astfel încât o repornire continuă fereastra în loc să acorde un buget nou. Plafonul care rezultă este declarat, nu descoperit: contorul este per nod API, deci două noduri dublează fiecare limită efectivă. REDIS_URL este rezervat pentru versiunea partajată și nimic nu îl citește încă — rulează un singur nod API sau acceptă limitele per nod.