Docs

Rate limits

Los rate limits van por API key — RPM y concurrencia — no por tokens totales.

Límites por key

LímiteValor
Peticiones por minuto100 rpm
Concurrencia5 peticiones simultáneas
Tokens por minuto2M tpm (modelos de lenguaje)

Los modelos de embeddings y voz tienen sus propios límites de petición. Consulta Modelos. GLM 5.2 es un add-on con límites y cupo propios, más abajo en esta página.

Búsqueda web

La herramienta de búsqueda web (/v1/search) tiene sus propios límites, independientes de tu presupuesto de tokens de chat:

LímiteValor
Peticiones por minuto60 rpm
Búsquedas por día3.000 / día
Concurrencia10 peticiones simultáneas

Si superas cualquiera de ellos, el endpoint devuelve 429 con una cabecera Retry-After. Las consultas idénticas repetidas en ~15 minutos se sirven desde caché y no llegan a un proveedor externo, pero siguen contando contra tu límite de peticiones y tu cuota diaria. Consulta la Referencia API para el formato completo de petición y respuesta.

Volumen mensual

Los modelos open eficientes son ilimitados en todos los planes — los modelos más grandes, de clase frontier, cuentan contra una cuota mensual que escala con tu plan:

PlanCuota mensual
Starter5B tokens
Growth15B tokens
Scale35B tokens
EnterprisePersonalizada

Si superas tu cuota, te avisamos antes de cobrarte el exceso. Consulta Precios para el desglose completo.

GLM 5.2

GLM 5.2 es un add-on por key de 150 € al mes, y ningún plan lo cubre. Tiene sus propios límites por key:

LímiteValor
Peticiones por minuto100 rpm
Concurrencia5 peticiones simultáneas
Tokens por minuto3M tpm
Contexto500K por petición

Su cupo mensual es de la organización y se comparte entre todas las keys con GLM 5.2. Va aparte de la cuota de arriba y nunca tira de ella:

PlanTokens de GLM 5.2 al mes
Starter2B tokens
Growth6,5B tokens
Scale18B tokens

Cuando se agota el cupo, GLM 5.2 se pausa hasta el siguiente ciclo de facturación y todo lo que cubre tu plan sigue respondiendo. Aquí no hay cargos por exceso: es imposible gastar más de lo contratado. Consulta Modelos.

Gestionar el 429

Cuando superas un límite, la API devuelve 429 Too Many Requests. Haz backoff y reintenta. La mayoría de SDK de OpenAI ya lo hacen por ti con backoff exponencial — la cabecera Retry-After te dice cuánto esperar.

# el SDK de OpenAI reintenta los 429 automáticamente — ajusta el número si hace falta
client = OpenAI(
    base_url="https://api.helmcode.com/v1",
    api_key="sk-your-key-here",
    max_retries=5,
)

¿Necesitas límites más altos?

Las cargas de alta demanda pueden obtener más RPM y concurrencia unificada bajo petición. Los planes Dedicated y Enterprise además corren sobre hardware reservado para ti, con rendimiento garantizado. Habla con nosotros.