Rate limits
Los rate limits van por API key — RPM y concurrencia — no por tokens totales.
Límites por key
| Límite | Valor |
|---|---|
| Peticiones por minuto | 100 rpm |
| Concurrencia | 5 peticiones simultáneas |
| Tokens por minuto | 2M tpm (modelos de lenguaje) |
Los modelos de embeddings y voz tienen sus propios límites de petición. Consulta Modelos. GLM 5.2 es un add-on con límites y cupo propios, más abajo en esta página.
Búsqueda web
La herramienta de búsqueda web (/v1/search) tiene sus propios límites, independientes de tu presupuesto de tokens de chat:
| Límite | Valor |
|---|---|
| Peticiones por minuto | 60 rpm |
| Búsquedas por día | 3.000 / día |
| Concurrencia | 10 peticiones simultáneas |
Si superas cualquiera de ellos, el endpoint devuelve 429 con una cabecera Retry-After. Las consultas idénticas repetidas en ~15 minutos se sirven desde caché y no llegan a un proveedor externo, pero siguen contando contra tu límite de peticiones y tu cuota diaria. Consulta la Referencia API para el formato completo de petición y respuesta.
Volumen mensual
Los modelos open eficientes son ilimitados en todos los planes — los modelos más grandes, de clase frontier, cuentan contra una cuota mensual que escala con tu plan:
| Plan | Cuota mensual |
|---|---|
| Starter | 5B tokens |
| Growth | 15B tokens |
| Scale | 35B tokens |
| Enterprise | Personalizada |
Si superas tu cuota, te avisamos antes de cobrarte el exceso. Consulta Precios para el desglose completo.
GLM 5.2
GLM 5.2 es un add-on por key de 150 € al mes, y ningún plan lo cubre. Tiene sus propios límites por key:
| Límite | Valor |
|---|---|
| Peticiones por minuto | 100 rpm |
| Concurrencia | 5 peticiones simultáneas |
| Tokens por minuto | 3M tpm |
| Contexto | 500K por petición |
Su cupo mensual es de la organización y se comparte entre todas las keys con GLM 5.2. Va aparte de la cuota de arriba y nunca tira de ella:
| Plan | Tokens de GLM 5.2 al mes |
|---|---|
| Starter | 2B tokens |
| Growth | 6,5B tokens |
| Scale | 18B tokens |
Cuando se agota el cupo, GLM 5.2 se pausa hasta el siguiente ciclo de facturación y todo lo que cubre tu plan sigue respondiendo. Aquí no hay cargos por exceso: es imposible gastar más de lo contratado. Consulta Modelos.
Gestionar el 429
Cuando superas un límite, la API devuelve 429 Too Many Requests. Haz backoff y reintenta. La mayoría de SDK de OpenAI ya lo hacen por ti con backoff exponencial — la cabecera Retry-After te dice cuánto esperar.
# el SDK de OpenAI reintenta los 429 automáticamente — ajusta el número si hace falta
client = OpenAI(
base_url="https://api.helmcode.com/v1",
api_key="sk-your-key-here",
max_retries=5,
)
¿Necesitas límites más altos?
Las cargas de alta demanda pueden obtener más RPM y concurrencia unificada bajo petición. Los planes Dedicated y Enterprise además corren sobre hardware reservado para ti, con rendimiento garantizado. Habla con nosotros.