Límites de velocidad
Los límites que aplica este despliegue, renderizados a partir de la tabla que lee el limitador, con lo que cuenta cada bucket.
| Bucket | Límite | Ventana | Contado |
|---|---|---|---|
| key_chat llamadas de inferencia realizadas con una clave de API |
600 | 1 min | por clave de API |
| org_chat llamadas de inferencia en toda una organización |
1800 | 1 min | por organización |
| platform llamadas a la API de plataforma: organización, claves, uso, trazas, políticas |
300 | 1 min | por clave de API |
| public_chat llamadas anónimas al playground |
20 | 1 h | por dirección IP |
| public_page solicitudes a páginas públicas |
300 | 1 h | por dirección IP |
| public_card_request solicitudes de tarjetas de modelo enviadas desde el formulario público |
5 | 1 h | por dirección IP |
| auth intentos de inicio de sesión, registro, recuperación y restablecimiento de contraseña |
20 | 15 min | por dirección IP |
Concurrencia
Como máximo 8 solicitudes pueden estar en vuelo en una clave de API a la vez. Una solicitud por encima de eso espera en lugar de fallar, hasta que la cola se llena.
Cómo se ve un rechazo
429 con código rate_limit_exceeded y tipo rate_limit_error. Hoy no hay cabeceras x-ratelimit-* ni retry-after: el mensaje indica el tiempo de reinicio de la ventana, y esa es la única señal. Trate un 429 como reintentable con retroceso; trate cualquier otro error en esta documentación como una solicitud que debe cambiar antes de poder tener éxito.
Dónde vive el contador
Las ventanas se cuentan en el proceso de la API y se escriben de nuevo en la base de datos cada pocos segundos, por lo que un reinicio continúa la ventana en lugar de repartir un presupuesto nuevo. El techo que sigue se declara en lugar de descubrirse: el contador es por nodo de API, por lo que dos nodos duplican cada límite efectivo. REDIS_URL está reservado para la versión compartida y nada lo lee todavía — ejecute un nodo de API, o acepte límites por nodo.