El techo abierto, servido en infraestructura europea
El 25 de agosto, Z.ai publicó los pesos de GLM 5.3. En el Intelligence Index de Artificial Analysis puntúa 60, que es exactamente lo que marca Kimi K3. Por primera vez hay dos modelos empatados en lo más alto de lo que puedes descargar, pero lo más importante es que uno de ellos cabe en la cuarta parte del hardware.
Desde hoy, GLM 5.3 sustituye a GLM 5.2 en todas las cuentas Enterprise de Helmcode.
La misma infraestructura europea, los mismos zero logs, los mismos 150 euros al mes por API-key. Esto no cambia, pero el modelo sí.
Dos cosas mejoran el modelo:
- Siete puntos de inteligencia. GLM 5.2 marcaba 53 en ese índice. GLM 5.3 marca 60.
- El millón de tokens de contexto entero. Antes servíamos 500K de la ventana de 1M de GLM 5.2. En 5.3 servimos el millón completo.
Si ya tienes una key con GLM 5.2, desde hoy responde con GLM 5.3. No hay nada que migrar más allá del id del modelo. Y ambos estarán disponibles durante un mes: ese es el plazo que tienen las cuentas Enterprise para pasar de GLM 5.2 a GLM 5.3.
GLM 5.3 en un minuto
GLM 5.3 está construido sobre la misma base que GLM 5.2: un MoE de unos 744.000 millones de parámetros, de los que se activan unos 40.000 millones por token, 78 capas y 256 expertos con 8 activos a la vez. Mantiene los dos modos de razonamiento, High y Max.
Lo que ha cambiado es el postentrenamiento. Lo que se ha movido es cuánto aguanta el modelo trabajando sin perder el hilo y por eso los benchmarks que gana son los largos y los que empata son los cortos.
Dos datos que hemos leído del repositorio del propio modelo:
- `max_position_embeddings` es 1048576. El millón de tokens de contexto es la configuración del modelo.
- 755,6 GB de pesos repartidos en 141 safetensors en FP8 nativo, más un checkpoint aparte en BF16 de 1.506,7 GB. Ese es el número que decide cuántas GPUs necesita cualquiera para correrlo.
Una cosa que no ha cambiado: GLM 5.3 es solo texto. Sin visión y sin audio. El pipeline en Hugging Face es text-generation y en el repositorio no hay configuración de visión. Si necesitas un modelo que lea imágenes o páginas escaneadas, eso es Qwen3.6 o Gemma 4, y tu plan ya cubre los dos sin coste añadido. Y muy pronto añadiremos GLM-5.3-Flash, que es multimodal.
Los benchmarks
Todo lo de esta sección es la tabla publicada por el propio Z.ai. La cobertura independiente de un modelo de nueve días es escasa todavía.
Frente a Kimi K3, el modelo con el que ahora empata en el índice:
| Benchmark | GLM 5.3 | Kimi K3 | GLM 5.2 |
|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | 88,3 | 81,0 |
| Terminal Bench 3.0 | 28,3 | 17,4 | 4,6 |
| DeepSWE v1.1 | 66,9 | 67,5 | 46,2 |
| Humanity's Last Exam, con herramientas | 62,5 | 59,8 | 54,7 |
| Toolathlon | 73,0 | 76,5 | no publicado |
| CyberGym | 84,5 | no publicado | no publicado |
Lo que podemos leer de la tabla:
En los benchmarks agénticos cortos los dos modelos son el mismo modelo. Solo que GLM 5.3 es mucho más barato de servir.
En los benchmarks largos la diferencia es real y va a favor de GLM 5.3. Terminal Bench 3.0 es el sucesor más duro y más largo del 2.1, y 28,3 frente a 17,4 es una ventaja del 60%. Humanity's Last Exam con herramientas, que es razonar a lo largo de muchos pasos con algo a lo que llamar, queda 62,5 frente a 59,8.
K3 sigue ganando Toolathlon. Si tu carga es orquestación pesada entre muchas herramientas, mide los dos antes de elegir.
Y para tener escala, frente a GLM 5.2: 28,3 contra 4,6 en Terminal Bench 3.0. GLM 5.2 sencillamente no podía con ese benchmark. Solo por eso, este cambio merece la pena.
GLM 5.3 vs Kimi K3
Cuando lanzamos GLM 5.2 tuvimos que conceder que Kimi K3 era mejor, pero que GLM 5.2 era más barato y muy bueno. Ese argumento se ha acabado. Los dos modelos tienen ahora mismo una puntuación y un desempeño muy similar.
Hardware. GLM 5.3 son 755 GB de pesos. Kimi K3 son 1.561 GB. En la práctica eso son unas 16 GPUs de clase H200 o B300 frente a unas 64 para K3.
Coste por tarea. Artificial Analysis mide 0,68 dólares por tarea completada en GLM 5.3 frente a 0,84 en K3.
Las licencias, y aquí la distancia se ha acortado. GLM 5.2 era MIT puro frente a la licencia propia de K3. GLM 5.3 ya no es MIT puro.
Visión. K3 lee imágenes y vídeo. GLM 5.3 no. Si ese es tu caso, K3 gana de verdad. Pero pronto incluiremos GLM-5.3-Flash en Enterprise para que puedas tener multimodal de fallback.
La licencia ha cambiado
Lo que contiene el fichero LICENSE es el texto de MIT palabra por palabra, más una condición añadida: quien opere un negocio Model as a Service con más de 10.000 millones de dólares de ingresos en cualquier periodo de doce meses tiene que pasar antes una revisión de seguridad de Z.ai.
Es casi seguro que a ti no te afecta. Si lees esto como empresa que quiere correr o comprar inferencia, el umbral son 10.000 millones de dólares de ingresos de un negocio de servir modelos. Esa cláusula apunta a cuatro o cinco compañías en el mundo.
A nosotros nos afecta en teoría y no en la práctica. Helmcode es un negocio Model as a Service, así que somos el tipo de licenciatario que la cláusula nombra. Estamos lejísimos de los 10.000 millones.
Nadie te la puede revocar. Los pesos están publicados y la concesión MIT de debajo está intacta. Nadie te quita este modelo y nadie empieza a registrar tus prompts de forma retroactiva.
Qué gano tirando de Helmcode en vez de la API de origen de Z.ai
Usas el mejor modelo abierto del momento sin que tus datos vayan a la API de Z.ai . Lo servimos desde nuestra infraestructura europea, no almacenamos logs y ni un token sale de nuestras máquinas.
Con las sanciones del AI Act aplicándose desde el 2 de agosto, dónde y cómo se sirve tu inferencia dejó de ser un detalle técnico hace tiempo.
El precio
No cambia. 150 euros al mes por API-key, como add-on en cualquier plan enterprise.
En el lanzamiento de 5.2 dijimos que un modelo de este tamaño no puede entrar en los planes base sin mover el precio de todo el mundo, y sigue siendo verdad: 755 GB de pesos no son un redondeo en una factura de GPU. Así que sigue siendo opcional. Añade las keys con GLM 5.3 que necesites, y solo esas keys cuestan de más.
Cada key con GLM 5.3 incluye 100 requests por minuto, 5 procesos concurrentes, 3M tokens por minuto y contexto de hasta 1M por petición.
Cuánto pueden consumir esas keys al mes lo marca tu tier, como un cupo de tokens compartido entre todas las keys de la cuenta. Tampoco cambia:
| Plan | Tokens al mes | Media diaria en un mes laborable |
|---|---|---|
| Starter | 2.000M | unos 95M al día |
| Growth | 6.500M | unos 310M al día |
| Scale | 18.000M | unos 860M al día |
Cuando se agota el cupo, el uso se pausa hasta el siguiente ciclo de facturación. No hay cargos por exceso: es imposible gastar más de lo contratado.
¿Cuándo te compensa frente a pagar por token?
Hemos vuelto a hacer las cuentas, porque el mercado por token se ha movido desde junio. Supuesto: ratio input/output 3:1, precios leídos el 3 de septiembre de 2026, convertidos al tipo de referencia del BCE del 2 de septiembre.
| Consumo mensual | Proveedor más barato en OpenRouter (unos 1,47 €/M) | API Z.ai (unos 1,86 €/M) | Helmcode (tarifa plana) |
|---|---|---|---|
| 100M tokens | 147 € | 186 € | 150 €, prácticamente empate |
| 400M tokens | 588 € | 744 € | 150 € |
| 2.000M tokens (el cupo de Starter) | 2.940 € | 3.720 € | 150 € |
| 6.500M tokens (el cupo de Growth) | 9.555 € | 12.090 € | 150 € |
| 18.000M tokens (el cupo de Scale) | 26.460 € | 33.480 € | 150 € |
Respuesta sencilla: a partir de unos 100M de tokens al mes la tarifa se paga sola, y eso comparando con el router más barato que hemos encontrado. Frente a la propia API de Z.ai se paga sola en unos 80M.
Una sola key que agote el cupo de Starter está pagando 0,075 €/M efectivos, y una key que se coma un cupo entero de Scale baja de 0,01 €/M. Ninguna API por token llega a esos números.
Y la respuesta que te daríamos si nos preguntaras: si tu volumen es bajo y tus datos pueden viajar a un router americano, el router te saldrá más barato. Este producto es para quien consume volumen, necesita los datos en Europa o necesita presupuestar sin sustos.
Cómo activarlo
Lo tienes ya disponible en los planes starter, growth y scale.
- Si ya tienes una key con GLM 5.2, desde hoy responde con GLM 5.3. Apunta el id del modelo a
glm-5.3. Tu precio, tus límites y tu cupo no cambian. - Si eres cliente de Helmcode y no tienes ninguna, entra en tu dashboard y genera una key nueva. Podrás asignarla a GLM 5.3 y el coste se añade a tu siguiente factura.
- Si todavía no eres cliente, al seleccionar tu plan el siguiente paso te pregunta cuántas API-keys con GLM 5.3 necesitas.
El endpoint es OpenAI-compatible:
from openai import OpenAI
client = OpenAI(base_url="https://api.helmcode.com/v1", api_key="TU_KEY")
resp = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "..."}],
) Docs completos aquí: helmcode.com/docs
El mejor modelo abierto del tablero es ahora el que tienes en tu plan, con el millón de tokens de contexto entero y la misma factura que el mes pasado. Ve a usarlo.