Docs

Rate limits

Los rate limits van por API key — RPM y concurrencia — no por tokens totales.

Límites por key

LímiteValor
Peticiones por minuto100 rpm
Concurrencia5 procesos concurrentes por modelo, 10 en GLM 5.3, GLM 5.3 Flash, GLM 5.2, DeepSeek V4 Flash y Qwen 3.8 Flash
Tokens por minuto2M tpm (modelos de lenguaje)

Las keys consolidadas multiplican cada límite por asiento.

Los modelos de embeddings y voz tienen sus propios límites de petición. Consulta Modelos. GLM 5.3 es un add-on con límites y cupo propios, más abajo en esta página.

Volumen mensual

Los modelos open eficientes son ilimitados en todos los planes. Los modelos de clase frontier — DeepSeek V4 Flash y GLM 5.3 Flash — cuentan contra una cuota mensual que escala con tu plan:

PlanCuota mensual
Starter5B tokens
Growth15B tokens
Scale35B tokens
EnterprisePersonalizada

GLM 5.3 (el add-on) lleva su propio cupo aparte — 2B / 6,5B / 18B tokens según el plan — más abajo en esta página; las dos cuotas nunca tiran la una de la otra.

Si superas tu cuota, te avisamos antes de cobrarte el exceso. Consulta Precios para el desglose completo.

Imágenes

La generación de imágenes tiene su propia bolsa mensual, por organización, y no sale de la cuota de tokens de arriba:

PlanImágenes al mes
Starter300
Growth600
Scale1.200
EnterpriseA medida

Dos cosas deciden a qué velocidad se gasta:

  • La cuota cuenta imágenes producidas, no peticiones. Una llamada con n: 4 gasta cuatro.
  • Borrar una imagen no la devuelve. El consumo del mes es lo que se generó, no lo que conservas.

Una bolsa por organización, compartida por todas las superficies: las imágenes hechas en el panel y las hechas por /v1/images/* salen del mismo total.

GLM 5.3

GLM 5.3 es un add-on por key de 150 € al mes, y ningún plan lo cubre. Tiene sus propios límites por key:

LímiteValor
Peticiones por minuto100 rpm
Concurrencia10 procesos concurrentes
Tokens por minuto3M tpm
Contexto1M por petición

Su cupo mensual es de la organización y se comparte entre todas las keys con GLM 5.3. Va aparte de la cuota de arriba y nunca tira de ella:

PlanTokens de GLM 5.3 al mes
Starter2B tokens
Growth6,5B tokens
Scale18B tokens

Cuando se agota el cupo, GLM 5.3 se pausa hasta el siguiente ciclo de facturación y todo lo que cubre tu plan sigue respondiendo. Aquí no hay cargos por exceso: es imposible gastar más de lo contratado. Consulta Modelos.

Gestionar el 429

Cuando superas un límite, la API devuelve 429 Too Many Requests. Haz backoff y reintenta. La mayoría de SDK de OpenAI ya lo hacen por ti con backoff exponencial — la cabecera Retry-After te dice cuánto esperar.

# el SDK de OpenAI reintenta los 429 automáticamente — ajusta el número si hace falta
client = OpenAI(
    base_url="https://api.helmcode.com/v1",
    api_key="sk-your-key-here",
    max_retries=5,
)

¿Necesitas límites más altos?

Las cargas de alta demanda pueden obtener más RPM y concurrencia unificada bajo petición. Los planes Dedicated y Enterprise además corren sobre hardware reservado para ti, con rendimiento garantizado. Habla con nosotros.