// modelos
Modelos abiertos.
Resultados de frontera.
La frontera open ya cubre el trabajo real de las empresas: recuperación, código, agentes, extracción. Comparados con los labs cerrados, probados en producción, servidos solo desde la UE.
// nuestros modelos
Los modelos que servimos en Helmcode.
El catálogo completo del cluster Shared: 8 modelos detrás de una sola API compatible con OpenAI, todos open-weight y todos servidos desde la UE. Los IDs de modelo van tal cual: cópialos directamente en tu código.
Modelos de lenguaje
glm-5.2 MIT 744B MoE · 40B active · 500K ctx · add-on Coding agéntico de horizonte largo y matemática dura. Por key, 150 € al mes. deepseek-v4-flash MIT 284B MoE · 21B active · NVFP4 · 1M ctx Razonamiento, agentes y análisis de contexto largo. Tool calling nativo. qwen3.6 Apache 2.0 35B MoE · 3B active · NVFP4 · 256K ctx RAG de alto volumen, clasificación y código. Entrada multimodal. gemma4 Gemma 26B MoE · 4B active · NVFP4 · 256K ctx Asistentes eficientes, documentos y escaneados. Entrada multimodal. Embeddings y reranking
qwen3-embedding Apache 2.0 8B · 4096 dims · Float32 · MMTEB 70.58 La capa de recuperación de un pipeline RAG, 100+ idiomas. rerank Apache 2.0 Qwen3-Reranker-8B · BF16 · /v1/rerank Reordena los top-k recuperados por relevancia real. Voz
whisper-large-v3 MIT 99+ languages · 3.2% WER (Spanish) Voz a texto para llamadas, reuniones y medios. kokoro Apache 2.0 82M params · <1s latency · 67 voices Texto a voz para agentes en vivo e IVR, español incluido. Todos estos modelos corren hoy en Helmcode. En los planes Dedicated y On-premise servimos además modelos open-weight custom o fine-tuned en hardware reservado para ti.
Referencia completa de modelos en la documentación// el 80 / 20
Los modelos abiertos cubren el 80% de la inferencia enterprise.
El trabajo que mueve el negocio (RAG, clasificación, generación de código, asistentes internos) lo resuelven hoy los modelos open-weight. El 20% donde de verdad necesitas un modelo cerrado de frontera es más estrecho de lo que parece.
Razonamiento puntero en el límite mismo de la capacidad. Real, pero específico, y rara vez la carga que un equipo regulado necesita mantener en casa. Preferimos ser honestos con ese límite a fingir que no existe.
// benchmark · artificial analysis
Inteligencia de frontera, precios open-weight.
El Artificial Analysis Intelligence Index es un compuesto de nueve evaluaciones exigentes: GPQA Diamond, SciCode, Terminal-Bench, Humanity's Last Exam y más. Los modelos open-weight ya están justo por debajo de la frontera cerrada.
Kimi K3 lidera ahora los pesos abiertos con 57, por delante de Claude Opus 4.8 (56) y GPT-5.5 (55), la frontera cerrada del ciclo anterior. GLM-5.2 le sigue con 51, a la altura de GPT-5.6 Luna (51.2), y lo servimos: es el modelo con mejor puntuación de la plataforma, como add-on por key. Detrás quedan los que cubre tu plan: DeepSeek V4 Flash (40), Qwen3.6 35B (32) y Gemma 4 26B (26). DeepSeek V4 Flash marca 40 a $0.14 / $0.28 por millón de tokens, frente a los $5.00 / $25.00 de Claude Opus 5, eso es ~35x más barato para lectura y ~90x para escritura, con el 66% de la inteligencia del líder del índice.
Fuente: artificialanalysis.ai · Intelligence Index v4.1 · July 2026 · compuesto de 9 evaluaciones · precio = API de primera parte, por 1M tokens (input · output), redondeado a puntos enteros. Las filas marcadas on helmcode, GLM-5.2, DeepSeek V4 Flash, Qwen3.6 35B y Gemma 4 26B, son las que servimos, con GLM-5.2 por key y no cubierto por el plan. Kimi K3 y DeepSeek V4 Pro son open-weight pero no están en la plataforma: K3 pide unas 64 GPUs de clase H100 o B200 para servirlo, y sus pesos salen con la licencia K3 propia de Moonshot, no con una aprobada por la OSI.
// probado en producción
Los datos en producción.
En la propia plataforma, casi toda la inferencia ya corre en modelos abiertos, y la mayoría en uno solo de 35B.
333.8B
Tokens en producción
acumulado
76%
Corre en Qwen 3.6 (35B)
el caballo de batalla abierto
99.5%
De tokens en modelos abiertos
tráfico LLM
// el lineup
Lo que de verdad mueve el 80%.
Los tres modelos de lenguaje, ordenados por cuota real de tokens en producción. Un modelo abierto de 35B absorbe la mayor parte, el resto entra para razonamiento, escala y multimodal.
qwen3.6 35B MoE · 256K ctx 76.1% RAG de alto volumen, clasificación, código deepseek-v4-flash 284B MoE · 1M ctx 12.4% Razonamiento, agentes, contexto largo gemma4 26B MoE · 256K ctx 2.4% Asistentes eficientes, documentos Más embeddings y reranking (qwen3-embedding, rerank) y voz (kokoro, whisper-large-v3), ocho modelos en una API. Referencia completa de modelos →
// faq de modelos
Modelos abiertos, respondidos.
Las preguntas que todo el mundo nos hace antes de confiar en modelos abiertos en producción.
¿Son los modelos abiertos lo bastante buenos?
Para el trabajo del día a día de las empresas, sí. En el Intelligence Index de Artificial Analysis, el mejor modelo open-weight, Kimi K3, marca 57 frente a los 61 del líder cerrado, Claude Opus 5, y el modelo que servimos, DeepSeek V4 Flash, da en torno a dos tercios de la inteligencia del líder por céntimos por millón de tokens. En producción, el 99,5% de los tokens en Helmcode ya pasan por modelos abiertos. La brecha restante es un conjunto estrecho de tareas de frontera que la mayoría de equipos no necesitan.
¿Qué modelo conviene usar?
Empieza con Qwen 3.6: absorbe tres cuartas partes del tráfico de producción y es el camino más rápido y barato para RAG, clasificación y código. Para razonamiento difícil, agentes o contexto de 1M tokens, DeepSeek V4-Flash. Para entrada de imagen y audio, Qwen 3.6 y Gemma 4 son multimodales. Misma API, solo cambia el id del modelo.
¿Y el 20% que de verdad necesita un modelo de frontera?
Existe, y es más específico de lo que se asume: razonamiento de frontera en el límite mismo de la capacidad. Helmcode es honesto con ese límite: cubrimos el 80% que mueve el negocio, en privado y a tarifa plana, no la última milla del leaderboard.
¿Cómo de actuales son estos benchmarks?
Las cifras son puntuaciones publicadas a julio de 2026: modelos abiertos servidos en Helmcode, cifras de los cerrados según cada proveedor. Los benchmarks cambian en cada release; conviene tratarlos como direccionales. Lo que no cambia es dónde se procesan los datos: siempre la UE, siempre sin logs.
¿Se puede correr un modelo que no esté en la lista?
En los planes Dedicated y On-premise, sí, modelos open-weight custom o fine-tuned en hardware reservado. El cluster Shared sirve el lineup curado de arriba.
// empezar
EMPIEZA A QUEMAR TOKENS
Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.
Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.