El modelo más potente de la plataforma se vende aparte, encima del plan que tengas. Trae su propia cuota mensual de tokens para la organización, compartida entre tus keys y separada del cap de SOTA, así que exprimir GLM nunca se come el resto de tu capacidad.
cuota mensual, por plan
- Starter2B
- Growth6.5B
- Scale18B
Por key: 100 peticiones/min; 5 procesos concurrentes por modelo, 10 en GLM 5.3, GLM 5.3 Flash, GLM 5.2, DeepSeek V4 Flash y Qwen 3.8 Flash; 3M tokens/min; 1M de contexto por petición. Las keys consolidadas multiplican cada límite por asiento.
Un proceso con volumen y criterio estable puede convertirse en un modelo pequeño y especializado, con los pesos a tu nombre y corriendo en mucho menos hardware. especialización_de_modelos →