Hastighedsgrænser

De grænser, denne udrulning anvender, gengivet fra tabellen, som begrænseren læser, med hvad hver bucket tæller.

Bucket Grænse Vindue Tælles
key_chat
inference-kald foretaget med én API-nøgle
600 1 min pr. API-nøgle
org_chat
inference-kald på tværs af en hel organisation
1800 1 min pr. organisation
platform
platform-API-kald: organisation, nøgler, forbrug, spor, politikker
300 1 min pr. API-nøgle
public_chat
anonyme playground-kald
20 1 h pr. IP-adresse
public_page
anmodninger til offentlige sider
300 1 h pr. IP-adresse
public_card_request
model card-anmodninger sendt fra den offentlige formular
5 1 h pr. IP-adresse
auth
forsøg på login, tilmelding, gendannelse og nulstilling af adgangskode
20 15 min pr. IP-adresse

Samtidighed

Højst 8 anmodninger kan være i gang på én API-nøgle ad gangen. En anmodning derover venter i stedet for at fejle, indtil køen er fuld.

Sådan ser en afvisning ud

429 med koden rate_limit_exceeded og typen rate_limit_error. Der er ingen x-ratelimit-* eller retry-after-headere i dag: meddelelsen angiver vinduets nulstillingstid, og det er det eneste signal. Behandl en 429 som en, der kan forsøges igen med backoff; behandl alle andre fejl i denne dokumentation som en anmodning, der skal ændres, før den kan lykkes.

Hvor tælleren ligger

Vinduer tælles i API-processen og skrives tilbage til databasen hvert par sekunder, så en genstart fortsætter vinduet i stedet for at uddele et frisk budget. Den øvre grænse, der følger, er angivet i stedet for opdaget: tælleren er pr. API-node, så to noder fordobler hver effektiv grænse. REDIS_URL er reserveret til den delte version, og intet læser den endnu — kør én API-node, eller accepter grænser pr. node.