Límites de velocidad

Los límites que aplica este despliegue, renderizados a partir de la tabla que lee el limitador, con lo que cuenta cada bucket.

Bucket Límite Ventana Contado
key_chat
llamadas de inferencia realizadas con una clave de API
600 1 min por clave de API
org_chat
llamadas de inferencia en toda una organización
1800 1 min por organización
platform
llamadas a la API de plataforma: organización, claves, uso, trazas, políticas
300 1 min por clave de API
public_chat
llamadas anónimas al playground
20 1 h por dirección IP
public_page
solicitudes a páginas públicas
300 1 h por dirección IP
public_card_request
solicitudes de tarjetas de modelo enviadas desde el formulario público
5 1 h por dirección IP
auth
intentos de inicio de sesión, registro, recuperación y restablecimiento de contraseña
20 15 min por dirección IP

Concurrencia

Como máximo 8 solicitudes pueden estar en vuelo en una clave de API a la vez. Una solicitud por encima de eso espera en lugar de fallar, hasta que la cola se llena.

Cómo se ve un rechazo

429 con código rate_limit_exceeded y tipo rate_limit_error. Hoy no hay cabeceras x-ratelimit-* ni retry-after: el mensaje indica el tiempo de reinicio de la ventana, y esa es la única señal. Trate un 429 como reintentable con retroceso; trate cualquier otro error en esta documentación como una solicitud que debe cambiar antes de poder tener éxito.

Dónde vive el contador

Las ventanas se cuentan en el proceso de la API y se escriben de nuevo en la base de datos cada pocos segundos, por lo que un reinicio continúa la ventana en lugar de repartir un presupuesto nuevo. El techo que sigue se declara en lugar de descubrirse: el contador es por nodo de API, por lo que dos nodos duplican cada límite efectivo. REDIS_URL está reservado para la versión compartida y nada lo lee todavía — ejecute un nodo de API, o acepte límites por nodo.