Rate limits
Los rate limits van por API key — RPM y concurrencia — no por tokens totales.
Límites por key
| Límite | Valor |
|---|---|
| Peticiones por minuto | 100 rpm |
| Concurrencia | 5 procesos concurrentes por modelo, 10 en GLM 5.3, GLM 5.3 Flash, GLM 5.2, DeepSeek V4 Flash y Qwen 3.8 Flash |
| Tokens por minuto | 2M tpm (modelos de lenguaje) |
Las keys consolidadas multiplican cada límite por asiento.
Los modelos de embeddings y voz tienen sus propios límites de petición. Consulta Modelos. GLM 5.3 es un add-on con límites y cupo propios, más abajo en esta página.
Volumen mensual
Los modelos open eficientes son ilimitados en todos los planes. Los modelos de clase frontier — DeepSeek V4 Flash y GLM 5.3 Flash — cuentan contra una cuota mensual que escala con tu plan:
| Plan | Cuota mensual |
|---|---|
| Starter | 5B tokens |
| Growth | 15B tokens |
| Scale | 35B tokens |
| Enterprise | Personalizada |
GLM 5.3 (el add-on) lleva su propio cupo aparte — 2B / 6,5B / 18B tokens según el plan — más abajo en esta página; las dos cuotas nunca tiran la una de la otra.
Si superas tu cuota, te avisamos antes de cobrarte el exceso. Consulta Precios para el desglose completo.
Imágenes
La generación de imágenes tiene su propia bolsa mensual, por organización, y no sale de la cuota de tokens de arriba:
| Plan | Imágenes al mes |
|---|---|
| Starter | 300 |
| Growth | 600 |
| Scale | 1.200 |
| Enterprise | A medida |
Dos cosas deciden a qué velocidad se gasta:
- La cuota cuenta imágenes producidas, no peticiones. Una llamada con
n: 4gasta cuatro. - Borrar una imagen no la devuelve. El consumo del mes es lo que se generó, no lo que conservas.
Una bolsa por organización, compartida por todas las superficies: las imágenes hechas en el panel y las hechas por /v1/images/* salen del mismo total.
GLM 5.3
GLM 5.3 es un add-on por key de 150 € al mes, y ningún plan lo cubre. Tiene sus propios límites por key:
| Límite | Valor |
|---|---|
| Peticiones por minuto | 100 rpm |
| Concurrencia | 10 procesos concurrentes |
| Tokens por minuto | 3M tpm |
| Contexto | 1M por petición |
Su cupo mensual es de la organización y se comparte entre todas las keys con GLM 5.3. Va aparte de la cuota de arriba y nunca tira de ella:
| Plan | Tokens de GLM 5.3 al mes |
|---|---|
| Starter | 2B tokens |
| Growth | 6,5B tokens |
| Scale | 18B tokens |
Cuando se agota el cupo, GLM 5.3 se pausa hasta el siguiente ciclo de facturación y todo lo que cubre tu plan sigue respondiendo. Aquí no hay cargos por exceso: es imposible gastar más de lo contratado. Consulta Modelos.
Gestionar el 429
Cuando superas un límite, la API devuelve 429 Too Many Requests. Haz backoff y reintenta. La mayoría de SDK de OpenAI ya lo hacen por ti con backoff exponencial — la cabecera Retry-After te dice cuánto esperar.
# el SDK de OpenAI reintenta los 429 automáticamente — ajusta el número si hace falta
client = OpenAI(
base_url="https://api.helmcode.com/v1",
api_key="sk-your-key-here",
max_retries=5,
)
¿Necesitas límites más altos?
Las cargas de alta demanda pueden obtener más RPM y concurrencia unificada bajo petición. Los planes Dedicated y Enterprise además corren sobre hardware reservado para ti, con rendimiento garantizado. Habla con nosotros.