Helmcode sirve ocho modelos open-weight tras una sola API compatible con OpenAI en https://api.helmcode.com/v1. Cada modelo funciona igual: solo cambia el id de model . Siete están cubiertos por tu plan; GLM 5.2 es un add-on por key y tiene su propia sección más abajo. Usa el id exactamente como se muestra. Para límites y cuotas, consulta Rate limits.
Modelos de lenguaje
Zglm-5.2sotaflagship744B MoE · 40B active · 500K context
El modelo abierto más potente que servimos: coding agéntico de horizonte largo sobre un repo real, además de matemática de competición. Se contrata por key a 150 € al mes en vez de ir cubierto por tu plan, y tiene su propia sección más abajo.
Capacidades
Tool calling · razonamiento (High y Max) · streaming (SSE)
Ideal para
Coding agéntico, orquestación de agentes, análisis de contexto largo
deepseek-v4-flashsotaflagship284B MoE · 21B active · NVFP4 · 1M context
Flagship para trabajo complejo y agéntico: documentos largos, codebases grandes y uso de herramientas en varios pasos.
Capacidades
Tool calling · razonamiento · streaming (SSE)
Ideal para
Razonamiento, agentes, análisis de contexto largo
qwen3.635B MoE · 3B active · NVFP4 · 256K context
Pensado para rendimiento: el speculative decoding entrega ~2× tokens por segundo.
whisper-large-v399+ languages · 3.2% WER (Spanish)
Voz a texto con detección automática de idioma.
Capacidades
25MB / ~2 min por petición · 10 rpm · OGG/Opus, MP3
Ideal para
Transcripción, notas de reunión, búsqueda por voz
En los planes Dedicated y On-premise también puedes correr modelos custom o fine-tuned en hardware reservado para ti. Mira Ejemplos para ver cómo llamar a cada familia.
add-on · 150 € por key al mes · corre en la UE
GLM 5.2, se contrata por key
El modelo open-weight más potente que servimos, y el que el catálogo de arriba no describe bien: corre en nuestro hardware en la UE con zero logs, como todo lo anterior, pero ningún plan lo cubre. Añades tantas keys con GLM 5.2 como necesites, a 150 € al mes cada una, sobre cualquier plan enterprise.
Qué incluye una key
Precio
150 € por key al mes, sobre cualquier plan enterprise
Requests por minuto
100 rpm
Concurrencia
5 peticiones concurrentes
Tokens por minuto
3M tpm
Contexto
500K por petición
El modelo admite 1M de contexto. Servimos 500K, que es lo que nos permite mantener la concurrencia alta y el precio en 150 €.
El cupo mensual es el de tu tier, no el de la key
El volumen se limita por organización y se comparte entre todas las keys de la cuenta, aparte de la cuota de plan que cubre los modelos de arriba:
Plan
Tokens de GLM 5.2 al mes
Starter
2.000M
Growth
6.500M
Scale
18.000M
Cuando se agota el cupo, GLM 5.2 se pausa hasta el siguiente ciclo de facturación y todo lo demás sigue respondiendo. No hay cargos por exceso.
oferta aparte · se paga con crédito · corre fuera de la UE
Modelos de frontera de OpenAI, Anthropic y Google
La misma API sirve además nueve modelos de frontera de tres proveedores estadounidenses. Es una oferta aparte del catálogo open-weight de arriba, y se diferencian en las dos cosas que deciden un modelo para casi cualquier comprador: quién opera el hardware y qué paga los tokens.
Nada de lo anterior cambia. Nuestros modelos siguen corriendo en hardware que operamos en la UE, y el plan mensual sigue cubriéndolos a tarifa plana.
Corren en la infraestructura del proveedor, en Estados Unidos
Cada uno de estos modelos corre en Anthropic, Google u OpenAI. Tus mensajes, tus adjuntos y las respuestas se envían al que de ellos sirva el modelo que elijas, y se procesan en la infraestructura de ese proveedor, fuera de la UE. Nuestros modelos corren en hardware que operamos en la UE y nada sale de ahí. La consola muestra el mismo aviso junto al modelo que estás eligiendo, porque ese es el momento en que se toma la decisión.
Se pagan por token, desde crédito prepago
Ningún plan mensual los cubre, en ningún nivel, ni aunque le quede cuota mensual sin consumir. Una organización con plan y sin crédito los sigue viendo y puede seleccionarlos, y la petición se rechaza hasta que recargue el saldo. La cuota de tu plan queda intacta y sigue funcionando con nuestros modelos.
Precio de lista del proveedor, sin margen sobre la inferencia
En entrada, salida y lecturas de caché pasamos el precio de lista de cada proveedor sin añadir nada. Lo que publicamos es exactamente lo que cobramos, y eso es lo que te permite reconciliar un extracto contra la lista de tarifas línea a línea. Nuestro ingreso en estos modelos es la comisión al comprar crédito, no tu consumo.
Los nueve modelos
El mismo catálogo y la misma clave que todo lo anterior. El endpoint que lista modelos los devuelve junto a los nuestros, y lo único que cambia es el id.
Modelo
Proveedor
claude-fable-5
Anthropic US
claude-opus-5
Anthropic US
claude-sonnet-5
Anthropic US
claude-haiku-4-5
Anthropic US
gpt-5.6-sol
OpenAI US
gpt-5.6-terra
OpenAI US
gpt-5.6-luna
OpenAI US
gemini-3.6-flash
Google US
gemini-3.5-flash-lite
Google US
Los nueve aparecen en la misma lista de modelos que los nuestros, en la consola.
Dónde está el precio, y por qué se mueve
Las tarifas no se publican aquí, y es deliberado. Una tarifa vive en un solo sitio, y ese sitio es lo que la cobra: tu consola, en Créditos, pestaña Private models. Ahí tienes la lista de precios completa, las cuatro tarifas de cada modelo (entrada, salida, entrada en caché y escritura de caché) y lo que te ha costado cada uno hasta ahora.
La lista de precios en la consola: nueve modelos, su proveedor, la marca de residencia US y las cuatro tarifas. Ese es el precio al que se cobran tus peticiones.
Esas tarifas se mueven, y conviene saber por qué para que un cambio no parezca un capricho nuestro. Pasamos el precio de lista de cada proveedor sin margen, o sea que no somos nosotros quienes lo fijamos: cuando un proveedor lo cambia, el nuestro lo sigue el mismo día. Y como cobramos en euros mientras los proveedores publican en dólares, el importe en euros sigue además al tipo de cambio euro-dólar. Las dos cosas están fuera de nuestro control, y por eso el número tiene que estar en un único sitio siempre actualizado y no en una página que se queda vieja en silencio entre despliegues.
Anthropic cobra por escribir en la caché de prompt, los otros dos no
Una caché de prompt permite a un modelo releer un prefijo largo (un system prompt, un documento, un codebase) sin volver a pagar por él la tarifa de entrada completa. OpenAI y Google cobran una tarifa reducida por leerla y nada en absoluto por crearla. Anthropic cobra un recargo por escribir y un descuento por leer, lo que convierte la escritura en una cuarta clase facturable y no en un descuento, y por eso la lista de precios lleva una columna de escritura de caché que en los otros seis modelos está vacía.
Publicamos y cobramos una sola tarifa de escritura de caché en Anthropic, sea cual sea la vida de la entrada. Anthropic cobra menos por una caché de vida corta, así que en esas escrituras nuestra tarifa queda por encima de la suya. La publicamos en lugar de disolverla en la tarifa de entrada, porque una tarifa que cobramos y no mostramos sería un margen con otro nombre. Tu extracto lista las cuatro cantidades por separado, así que la cuenta se puede comprobar: cantidad por tarifa publicada, en cada una de las cuatro, suma lo que se cobró.
Cómo se llama a uno
La misma URL base, la misma clave, el mismo cuerpo de petición. Solo cambia el id del modelo.
Si el saldo se agota, la API responde 402 credits_exhausted y solo se rechazan estos modelos: todo lo que cubre tu plan sigue respondiendo, así que un rechazo no es una caída. El saldo nunca baja de cero. Cuando una petición cuesta más de lo que queda, cobramos lo que había y absorbemos la diferencia.