État de la plateforme

Les régions d'endpoint décrivent une configuration, pas une géolocalisation indépendante. L'inférence simulée n'exécute aucun poids de modèle et signale dev-mock. L'inférence réelle nécessite un backend configuré pour la région de l'endpoint ; la localisation européenne et la propriété européenne sont distinctes.

de-ber

ModèlesRuntimeÉtat de la plateformeuptime
measured over the last 1 hour · 12 checks
p50 latency
Devstral Small 2 (24B) mock Opérationnel 100% 0 ms
EuroLLM-22B-Instruct (2512) mock Opérationnel 100% 0 ms

de-fra

ModèlesRuntimeÉtat de la plateformeuptime
measured over the last 1 hour · 12 checks
p50 latency
EuroLLM-1.7B-Instruct mock Opérationnel 100% 0 ms
EuroLLM-9B-Instruct (2512) mock Opérationnel 100% 0 ms
Whisper large-v3 mock Opérationnel 100% 0 ms

fr-par

ModèlesRuntimeÉtat de la plateformeuptime
measured over the last 1 hour · 12 checks
p50 latency
Mistral Small 4 (119B-A6B) mock Opérationnel 100% 0 ms

Feature flags

FlagStateMeaning
gpu_enabled off First-party GPU inference is available (VLLM_BASE_URL set)
partner_endpoints off Partner endpoints may be routed to
public_playground on The public playground is rate limited and open
public_signup on Anyone may create an account
stripe_enabled off Card payments are enabled on this deployment

Ce déploiement peut exécuter de l'inférence simulée : une réponse peut provenir d'un modèle de substitution plutôt que du modèle nommé dans la requête. Quand le mode simulé est activé, la console et la trace le disent, et aucun frais de token n'est facturé.