GLM 5.2 ya disponible en Helmcode

GLM 5.2 ya disponible en Helmcode

GLM 5.2, el modelo abierto MIT de 744B, ya corre en la infraestructura europea de Helmcode con zero logs y tarifa plana de 150 euros al mes.

El modelo abierto más equilibrado, servido en infraestructura europea

El 17 de junio, Z.ai liberó bajo licencia MIT el modelo abierto más potente publicado hasta ese momento.

Desde hoy, GLM 5.2 está disponible para todas las cuentas Enterprise de Helmcode.

Corre en nuestra infraestructura alojada en Europa, con zero logs y por 150 euros al mes por cada API-key que uses con él. Tarifa plana con cupo mensual de tokens para que no te lleves sorpresas.

Llevamos más de 3 semanas haciendo pruebas, optimizándolo y usándolo antes de ofrecerlo. Ha estado disponible durante dos semanas en la comunidad de NaN para poder testear la concurrencia y capacidad de carga.

Nuestro resumen: es el modelo abierto más equilibrado en coste-beneficio y está a la altura de Claude Opus 4.8 en coding agéntico. Ofrece una calidad enorme para tareas de desarrollo y orquestación de agentes sin las ataduras ni los inconvenientes que tienen los modelos cerrados frontera.

GLM 5.2 en un minuto

GLM 5.2 es el flagship de Z.ai : un MoE de 744.000 millones de parámetros de los que solo unos 40.000 millones se activan por token. Viene con un contexto de 1 millón de tokens y dos modos de razonamiento: High y Max.

Las dos partes más innovadoras de este modelo:

  • El IndexShare : hace usable ese contexto de 1 millón de tokens. Reutiliza el mismo indexador de atención que GLM 5.1, cada cuatro capas. Esto reduce el cómputo por token 2,9 veces a contexto completo.
  • MTP (Multi Token Prediction) mejorado en un 20%. El modelo genera más rápido y consume menos con el mismo cómputo. Aunque la ablación se ha hecho con GLM 5.1, la misma técnica se ha aplicado a este modelo nuevo.

El resto de la arquitectura la puedes ver en el post de lanzamiento de Z.ai .

La parte importante es que todos los pesos se han publicado bajo licencia MIT, lo que nos permite correrlo y disponibilizarlo en nuestra infraestructura de manera privada para nuestros clientes. Nadie puede quitar el acceso al modelo. Nadie registra los prompts y los outputs del modelo.

Esta es la lucha constante de Helmcode para que las empresas sean soberanas de sus herramientas y sus datos.

Benchmark de GLM 5.2

La mayoría de benchmarks disponibles los primeros días venían de Z.ai , pero hay 3 empresas en concreto, a las que les damos mayor credibilidad (Proximal, PostTrainBench y Abundant AI) que han medido el modelo con su contexto máximo de 1M de tokens y esfuerzo máximo.

  • En FrontierSWE (proyectos técnicos abiertos de decenas de horas) GLM 5.2 queda a un 1% de Claude Opus 4.8 y supera a GPT-5.5.
  • En PostTrainBench, segundo solo tras Opus 4.8, por delante de GPT-5.5.
  • Y en SWE-Marathon, el benchmark de ingeniería de horizonte ultra-largo (construir compiladores, optimizar kernels) es donde se ve la mayor diferencia: 13,0 de puntuación frente a 26,0 de Opus 4.8. La mitad.

Fuera de las mediciones de terceros, en la tabla del propio Z.ai hay un dato que merece mención: en matemáticas de competición (AIME 2026) consigue un 99,2, por encima de todos los modelos cerrados.

El perfil real: si juntamos los resultados con que es un modelo de pesos abiertos, tenemos una verdadera máquina en coding agéntico de contexto largo y matemática a una fracción del precio de los modelos cerrados.

Queda muy poco por debajo de los frontier en razonamiento científico general (91,2 en GPQA-Diamond frente a 93-94 de los cerrados, según la tabla de Z.ai ) y en las tareas de ingeniería más extremas.

GLM 5.2 no es el mejor modelo para todo. Pero está a la altura, y a veces supera, a los modelos frontera en lo que más importa a nuestros clientes.

¿Y Kimi K3?

Es la pregunta obligada. El 16 de julio, Moonshot lanzó Kimi K3 y en el Intelligence Index de Artificial Analysis puntúa por encima: 57 frente al 51 de GLM 5.2. En el índice global, K3 es hoy el modelo abierto más capaz. No vamos a discutir ese dato, porque la transparencia también es parte del producto.

Ahora, los matices, que aquí importan mucho:

  • La inteligencia es solo uno de los tres índices. En los otros dos de Artificial Analysis, el marcador se da la vuelta: GLM 5.2 corre a 179 tokens/segundo frente a los 35 de K3 (5 veces más rápido) y cuesta 0,59 dólares por tarea completada frente a 0,86 (un tercio menos). GLM 5.2 es más rápido y más económico.
  • La licencia no es comparable. GLM 5.2 es MIT puro: cualquiera puede correrlo, servirlo y construir negocio encima sin pedir permiso. K3 salió bajo una licencia propia con condiciones comerciales que se activan por ingresos. Para un proveedor de inferencia o para una empresa que quiera self-hostearlo con garantías, eso es una diferencia importante.
  • El tamaño tiene consecuencias. K3 son 2,8 billones de parámetros, casi 4 veces más que GLM 5.2. Eso se traduce en más hardware y más coste por token (su API cuesta en torno a 3 veces más en output). GLM 5.2 corre en una fracción del hardware y ese margen es justo lo que nos permite ofrecerlo a este precio en tarifa plana.
  • K3 trae visión nativa (imágenes y vídeo). GLM 5.2 es solo texto, aunque la gente de Baseten le ha añadido visión también .

¿Y en coding agéntico real, que es el caso de uso central de nuestros clientes? Ahí la diferencia práctica es mínima. Lo hemos medido nosotros.

Lo hemos probado en nuestra infraestructura

No nos quedamos en los benchmarks de otros. Hemos corrido Kimi K3 en nuestro propio hardware (4 GPUs B300, cuantizado en NVFP4, probado tanto en vLLM como en SGLang) y lo hemos enfrentado a GLM 5.2 en el terreno donde se supone que K3 destaca: tareas agénticas muy largas, de cientos de pasos consecutivos.

La prueba: dos proyectos completos (frontend, backend e infra) ejecutados en paralelo con equipos de agentes, uno sobre cada modelo, más una batería de evals públicos y propios. El resultado:

  • Ambos terminaron los proyectos en unas 5 horas con resultado excelente. Los dos siguieron los lineamientos, implementaron validaciones, tests y middlewares. K3 acabó unos 15 minutos antes y tiene algo más de gusto en frontend. GLM 5.2 quedó funcionalmente a la par.
  • El salto que prometen los benchmarks de K3 no aparece en proyectos reales. La diferencia práctica entre ambos es marginal.
  • La diferencia que sí es enorme: el cómputo. K3 necesitó casi el doble de cómputo que GLM 5.2 para el mismo throughput. En un proveedor de inferencia, eso significa casi el doble de coste de servir. Esa diferencia es exactamente la que separa poder ofrecer tarifa plana de no poder.

A igualdad de resultado en proyectos reales, GLM 5.2 cuesta la mitad de servir, tiene licencia MIT limpia para correrlo en infraestructura privada y hace posible un precio plano y predecible. En calidad/precio no hay partido. Por eso es nuestro buque insignia.

Dicho en corto: de los modelos abiertos con inteligencia de clase frontier (50 o más en el índice de Artificial Analysis) hoy existen tres. Nosotros servimos dos, GLM 5.2 y DeepSeek V4 Flash, y GLM 5.2 es el más rápido de los tres: 179 tokens por segundo frente a 123 y 35.

Los doce modelos con inteligencia de clase frontier comparados en tres paneles. En inteligencia, GLM 5.2 marca 51 y es el segundo de los abiertos, tras Kimi K3 con 57 y por delante de DeepSeek V4 Flash con 50. En velocidad, GLM 5.2 es segundo de la tabla entera con 179 tokens por segundo. En coste por tarea marca 0,59 dólares. Fuente: Artificial Analysis, índice v4.1, capturado el 3 de agosto de 2026.

Seguiremos publicando lo que midamos de K3. Si en algún momento su licencia y su coste de servir encajan con nuestro modelo, lo contaremos aquí con los mismos números en la mano.

Qué gano tirando de Helmcode en vez de la API de origen de Z.ai

Lo bueno de los modelos de pesos abiertos es esto. Puedes usar el mejor modelo abierto en MIT del momento sin tener que mandar tus datos a la API de Z.ai .

Ante la falta de modelos europeos, los modelos abiertos resuelven el problema de la soberanía de los datos.

Nosotros lo servimos desde nuestra infraestructura europea. No almacenamos logs, por lo que tu información es solo tuya. Ni un token sale de nuestras máquinas.

Con las sanciones del AI Act aplicándose desde el 2 de agosto, dónde y cómo se sirve tu inferencia ha dejado de ser un detalle técnico.

La alternativa es correrlo tú, en tus máquinas. Que también es algo que podemos hacer. Si tienes máquinas disponibles con unos 860 GB de VRAM (un nodo de 8x H200 para el checkpoint FP8), adelante. Nosotros podemos operar la infraestructura por ti.

El precio

Disponibilizar un modelo de este tamaño tiene una consecuencia: no podemos venderlo al mismo precio que vendemos el resto de modelos. La infraestructura necesaria es mucho más cara y los márgenes más estrechos.

Por eso, antes de subir el precio de todos los planes, hemos decidido que solo aquellos que lo quieran utilizar lo puedan añadir a su plan. Añade a tu plan las API-keys que necesites con GLM 5.2 y listo.

Cada API-key con GLM 5.2 son 150 euros al mes como add-on en cualquier plan enterprise.

Cada key con GLM 5.2 incluye: 100 requests/minuto, 5 procesos concurrentes, 3M tokens/minuto y contexto de hasta 500K por petición. El modelo admite 1M de contexto y servimos 500K a propósito: es lo que nos permite mantener la concurrencia alta y el precio en 150 euros.

Cuánto pueden consumir esas keys al mes lo marca tu tier, como un cupo de tokens compartido entre todas las keys de la cuenta:

PlanTokens al mesMedia diaria en un mes laborable
Starter2.000Munos 95M al día
Growth6.500Munos 310M al día
Scale18.000Munos 860M al día

Cuando se agota el cupo, el uso se pausa hasta el siguiente ciclo de facturación. No hay cargos por exceso: es imposible gastar más de lo contratado.

¿Cuándo te compensa frente a pagar por token?

Hemos hecho las cuentas (supuesto: ratio input/output 3:1, precios de julio 2026):

Consumo mensualOpenRouter (unos 0,80 €/M)API Z.ai (unos 2,00 €/M)Helmcode (tarifa plana)
100M tokens80 €200 €150 €, aquí aún no compensamos
400M tokens320 €800 €150 €
2.000M tokens (el cupo de Starter)1.600 €4.000 €150 €
6.500M tokens (el cupo de Growth)5.200 €13.000 €150 €
18.000M tokens (el cupo de Scale)14.400 €36.000 €150 €

Respuesta sencilla: a partir de unos 190M de tokens al mes la tarifa se paga sola, que es donde OpenRouter alcanza esos mismos 150 €. Todo lo demás es margen. Una sola key que agote el cupo de Starter está pagando 0,075 €/M efectivos, y si esa key se come un cupo entero de Scale el precio efectivo baja de 0,01 €/M. Ninguna API por token llega a esos números.

Y la respuesta que te daríamos si nos preguntaras: si tu volumen es bajo y tus datos pueden viajar a un router americano, OpenRouter te saldrá más barato. Este producto es para quien consume volumen, necesita los datos en Europa o necesita presupuestar sin sustos.

(Nota para la comunidad de NaN: GLM 5.2 llegará como tier propio de 200 euros al mes en los próximos días. El tier conservará el acceso al resto de modelos y se añadirá GLM 5.2).

Cómo activarlo

Lo tienes ya disponible en los planes starter, growth y scale.

  • Si ya eres cliente de Helmcode, entra en tu dashboard y genera una nueva key SoTA. Podrás asignarla a GLM 5.2 y se te añadirá el coste a tu siguiente factura.
  • Puedes entrar en Billing - SoTA Models y activar ahí para tod tu equipo o solo para keys concretas.
  • Si todavía no eres cliente pero quieres serlo, al seleccionar tu plan (starter, growth o scale) te aparecerá en el siguiente paso cuántas API-keys con GLM 5.2 necesitas.

Luego, operar es sencillo. El endpoint es OpenAI-compatible:

from openai import OpenAI

client = OpenAI(base_url="https://api.helmcode.com/v1", api_key="TU_KEY")
resp = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "..."}],
)

Docs completos aquí: helmcode.com/docs

Hemos puesto a disposición de todas las compañías el modelo más equilibrado del mercado al mejor precio. Ahora es tu momento de exprimirlo al máximo. Empieza a quemar tokens :)

undefined

El digest de Helmcode: modelos abiertos, novedades, actualidad de IA abierta, opiniones y sentido común. Se publica dos veces al mes, solo en inglés.