Hemos publicado una guía con 80 casos de uso empresariales y el modelo abierto correspondiente que mejor resuelve cada uno.
Este artículo explica cómo hemos creado la guía: con qué criterios se asigna un modelo a un caso, por qué el mejor en los rankings casi nunca es el que deberías desplegar o usar y cómo puedes decidir tú cuando salga el siguiente.
La brecha con los modelos cerrados
El techo del mercado son exactamente 63 puntos en el Índice de Inteligencia de Artificial Analysis. Domina Claude Opus 5 desde el 24 de julio de 2026. Justo debajo hay varios modelos cerrados: Claude Fable 5 con 62 y GPT-5.6 Sol y Grok 4.6 con 61.
El mejor modelo abierto que puedes descargar, instalar y auditar tiene una puntuación de 60. En realidad son dos: Kimi K3 y GLM-5.3. Tres puntos de diferencia con Opus 5 y uno solo con Grok 4.6 y GPT-5.6 Sol.
En meses la distancia se ve mejor. La realidad es que no ha habido un salto enorme en los modelos de estos últimos meses. Esos 60 puntos son los que marcaba GPT-5.5 cuando lideraba el índice con 60,2 en abril de 2026, para que te hagas una idea. Los modelos cerrados no han avanzado tanto, pero los abiertos se han puesto a su altura.
| Modelo | Tipo | Índice | $ por tarea | Pesos | Licencia |
|---|---|---|---|---|---|
| Claude Opus 5 | Cerrado | 63 | 2,34 | no aplica | propietaria |
| Claude Fable 5 | Cerrado | 62 | 3,14 | no aplica | propietaria |
| GPT-5.6 Sol | Cerrado | 61 | 0,95 | no aplica | propietaria |
| Grok 4.6 | Cerrado | 61 | 0,94 | no aplica | propietaria |
| Kimi K3 | Abierto | 60 | 2,30 | 1.560,9 GB | propia (custom) |
| GLM-5.3 | Abierto | 60 | 0,90 | 755,6 GB | GLM-5.3 (custom) |
| GPT-5.6 Terra | Cerrado | 57 | 0,53 | no aplica | propietaria |
| GLM-5.3-Flash | Abierto | 57 | 0,10 | 328,3 GB | MIT |
| DeepSeek V4 Flash 0731 | Abierto | 52 | 0,11 | 166,9 GB | MIT |
*Índice de Inteligencia de Artificial Analysis y coste por tarea del índice, en dólares, leídos el 31 de agosto de 2026. Los pesos son el total de safetensors publicado en Hugging Face, que es lo que decide cuántas GPUs necesitas para servir el modelo.*
Pero vamos a entrar en costes, no solo en los benchmarks.
Claude Fable 5 cuesta 3,14 dólares por cada tarea del índice, y su tarifa es de 10 dólares por millón de tokens de entrada y 50 de salida.
GLM-5.3, que marca dos puntos menos, cuesta 0,90 por tarea y además se descarga.
GPT-5.6 Terra marca 57 y cuesta 0,53 por tarea.
GLM-5.3-Flash marca el mismo 57, cuesta 0,10, pesa 328 GB y viene con licencia MIT.
Dos puntos de índice valen 3,5 veces el coste por tarea, y cinco puntos valen treinta y una veces.
Y una cifra nuestra para cerrar, que sale de nuestros datos abiertos : el 99,5% de los tokens que pasan por Helmcode en producción corre en modelos abiertos y en producción real.
La brecha existe, aunque breve, en el borde de la frontera pero es que casi ningún trabajo real vive allí.
Los tres ejes que deciden qué modelo escoger
Casi todo el mundo elige modelo mirando una tabla de puntuaciones. Muchos modelos están creados para romper los benchmarks pero no para el trabajo diario. Esos son los tres ejes que usamos nosotros para recomendar modelos para cada caso de uso.
Eje 1. La calidad que tu caso necesita, contra el coste por tarea
Los 63 puntos de Opus 5 cuestan 2,34 dólares por tarea. Los 57 de GLM-5.3-Flash cuestan 0,10.
Lo que decide qué modelo usar es si tu caso nota la diferencia entre 57 y 63. Clasificar un ticket de soporte, no la nota y lo va a hacer cuarenta mil veces al mes. Analizar tu mercado, cinco competidores, sus precios, documentación y movimientos del último año antes de decidir dónde invertir sí puede notarla, y quizá lo haces una vez al trimestre.
Así es como recomendamos el reparto del presupuesto. La carga de volumen de trabajo para el modelo lo suficientemente listo y a la vez barato.
Eje 2. El contexto real del trabajo
Qué entra de verdad en cada petición y cuántas veces al día.
Un contrato de cuarenta páginas mil veces al mes y una investigación que cruza cientos de documentos, informes y fuentes para preparar una decisión estratégica parecen igualmente "documentos largos", pero son dos decisiones opuestas: la primera se optimiza por coste por página y la segunda por capacidad de razonar entre fuentes.
Aquí hay una confusión que sale cara y tiene que ver con la ventana de contexto. No es lo mismo lo que cabe en el modelo que lo que razona y entiende el modelo. Existen ventanas de 10 millones de tokens en modelos que no razonan. Para saber quién entiende de verdad un expediente entero, hay que mirar una evaluación de razonamiento sobre contexto largo y ahí el mejor abierto es Kimi K3 con un 82,7% en AA-LCR.
Eje 3. La restricción de despliegue que en modelos abierto se mide en cómputo
Un modelo cerrado se paga por token y no ocupa espacio; pero uno abierto hay que sostenerlo. La unidad práctica es el nodo de ocho GPUs que es como se compra:
- GLM-5.3-Flash, 57 puntos, 328 GB de pesos: un nodo.
- GLM-5.3, 60 puntos, 755 GB: dos nodos.
- Kimi K3, los mismos 60 puntos, 1,56 TB: unos ocho nodos.
Tres puntos de índice pueden costar el doble u ocho veces más de infraestructura según a quién le compres. Este cálculo se suele olvidar una vez nos hemos enamorado de los números de los benchmarks.
La base: once modelos llevan los 80 casos
De los 80 casos de la guía, once modelos se llevan al menos uno y con siete ya cubres el 95%. Esa concentración es algo bueno porque te permite llegar a la mayoría de tareas con pocos modelos. Pensar que el mismo modelo vale para todo es una utopía. O un despilfarro de dinero. Lo más importante es el criterio para saber a quién delegar en cada momento para que se cubra todo el trabajo.
DeepSeek V4 Flash 0731, el caballo de batalla (26 casos)
La salida de DeepSeek V4 Flash 0731 marcó un hito en lo que en Helmcode llamamos modelos todoterreno. Son modelos que tienen mucha capacidad y cuestan poco. Como en su momento lo fue Opus 4.6 o Qwen 3.6. 1M de contexto, 122 tokens por segundo y 0,11 dólares por tarea.
Es el modelo que más trabajo hace en la guía porque la mayoría del trabajo de una empresa es extraer, resumir, recuperar y traducir a volumen.
Para qué sí: resúmenes, RAG, traducción masiva, análisis sobre documentos enteros, creación de tareas desde correos.
Para qué no: texto que firma una persona y sale de la empresa y agentes largos de muchos pasos.
Su hermano mayor, DeepSeek V4 Pro 0813 (53 en el índice), se queda con un solo caso, la generación de código acotada, porque es el único que tiene publicada la cifra que mide eso: 80,6% en SWE-bench Verified.
Qwen3.8-27B, cabe en una máquina (23 casos)
Es el mejor escritor abierto que entra en una sola máquina y además multimodal: admite hasta 16.384 tokens visuales por imagen, que es lo que le permite leer un A4 escaneado con letra pequeña.
Para qué sí: propuestas comerciales, políticas, screening de CVs, facturas escaneadas, contenido de marketing.
Para qué no: ejecuciones agénticas largas, donde se queda corto frente a los GLM.
GLM-5.3-Flash, el mejor razonamiento (15 casos)
Se llevó de golpe todos los casos que sostenía GLM-5.2. Ha sido una mejora grande en coding y razonamiento. En coding agéntico Z.ai publica un 84,3 en Terminal Bench 2.1 y un 63,4 en DeepSWE.
Para qué sí: contratos, fraude, estrategia, jurisprudencia, agentes de coding autónomos.
Para qué no: cualquier caso que no requiera razonamiento. Los casos donde entra mejor un modelo más pequeño.
Gemma 4 12B, trabaja en milisegundos (6 casos)
Licencia propia de Google con restricciones de uso, 22 puntos en el índice. Puntúa bajo y no importa, porque en su trabajo lo suples tú con tu criterio escrito en el prompt.
Para qué sí: clasificar y enrutar tickets, priorizar la bandeja, detectar urgencia, marcar datos personales, todo en una GPU modesta y afinable con tu histórico.
Para qué no: nada que requiera razonamiento.
De la misma familia, Gemma 4 26B hace moderación multimodal al coste de un modelo mediano, con 280 tokens visuales por imagen: de sobra para un gráfico y muy corto para una nómina escaneada. Lo servimos en tarifa plana.
Qwen3.8-Flash-Next, el techo multimodal (2 casos)
56 en el índice pero con entrada de imagen y de vídeo.
Para qué sí: inspección de calidad desde fotos o vídeo, análisis de imágenes de producto. Es una alternativa también para casos de uso de GLM-5.3, incluso para coding.
Whisper large-v3-turbo, la voz de entrada (2 casos)
99 idiomas y ningún tope de duración de grabación. Es el modelo de voz más descargado que existe y el más barato de ejecutar. Nosotros servimos su hermano mayor, large-v3, con el doble de tamaño.
Para qué sí: transcribir reuniones y llamadas de clientes sin que el audio salga de tu red.
Para la voz de salida entra Chatterbox Multilingual (MIT, 500M), que habla 23 idiomas, el español incluido, y clona una voz con unos segundos de referencia. La alternativa obvia, Kokoro, solo habla inglés.
qwen3-embedding y su reranker, el 50% olvidado (2 casos)
No son un LLM y deciden más que el LLM: en un sistema de preguntas sobre documentación interna, la calidad de la recuperación pesa más que el modelo que redacta la respuesta.
Para qué sí: búsqueda semántica y reordenado de resultados. Si tu RAG responde mal, empieza mirando aquí.
Kimi K3, frontera pero pesado y caro (1 caso)
60 puntos en el índice. Lo probamos y decidimos no servirlo: demasiado pesado y demasiado caro para un resultado que GLM-5.3 iguala. K3 ocupa el doble de disco y cuesta 2,30 dólares por tarea contra 0,90. Pero es un muy buen modelo.
Y aun así sigue siendo nuestra recomendación en un caso, una due diligence con cientos de documentos, porque ahí manda razonar entre miles de documentos y K3 lidera entre los abiertos con ese 82,7% en AA-LCR.
GLM-5.3, el techo abierto en texto (0 casos)
60 en el índice, empate con K3 con la mitad de disco y las mejores cifras abiertas en agéntico que hay publicadas (88,2 en Terminal Bench 2.1 y 66,9 en DeepSWE, medidas por su fabricante).
No lleva ningún caso de la guía por tres razones concretas: no lee imágenes, cuesta siete veces más por tarea que su hermano Flash y pide dos nodos en vez de uno.
Lo recomendamos para coding agéntico con mucho contexto, igual que Kimi K3. Pero GLM-5.3-Flash te valdrá para el 99% de los casos.
Quince casos, con su modelo y su alternativa
De los ochenta, quince que cubren las diez áreas y las tres complejidades de la guía. Cada uno tiene su ficha completa en la guía, con el razonamiento y el despliegue en detalle, y la rejilla se filtra por área y por modelo.
| Caso | Modelo | Por qué | Alternativa |
|---|---|---|---|
| Resumir documentos muy largos | V4 Flash 0731 | 1M de contexto se traga el informe entero, sin trocearlo | Kimi K3 |
| Transcribir y resumir reuniones | Whisper turbo y V4 Flash | Dos modelos encadenados, sin tope de duración | Whisper large-v3 |
| Búsqueda semántica en la KB | qwen3-embedding | Aquí decide el recuperador, no el generador | V4 Flash |
| Generación de código | V4 Pro 0813 | 80,6% en SWE-bench Verified, la única cifra publicada | GLM-5.3-Flash |
| Agentes de coding autónomos | GLM-5.3-Flash | Otro trabajo y otro líder: 84,3 en Terminal Bench 2.1 | GLM-5.3 con cluster |
| Voicebots y síntesis de voz | Chatterbox | 23 idiomas con clonado, porque Kokoro solo habla inglés | Kokoro, solo inglés |
| Propuestas comerciales | Qwen3.8-27B | Escritura persuasiva larga que firma una persona | GLM-5.3-Flash |
| Contenido de marketing | Qwen3.8-27B | Tono de marca a volumen, en una sola máquina | Qwen 3.6 35B |
| Clasificar y enrutar tickets | Gemma 4 12B | El criterio lo escribes tú, gana el rápido y barato | V4 Flash |
| Screening de CVs | Qwen3.8-27B | Datos de candidatos, RGPD, despliegue local | GLM-5.3-Flash |
| Facturas y gastos | Qwen3.8-27B | 16.384 tokens visuales contra 280: la letra pequeña decide el importe | Gemma 4 26B |
| Análisis financiero y reporting | V4 Flash 0731 | Un punto por detrás de V4 Pro a menos de la mitad de coste | V4 Pro 0813 |
| Análisis de contratos y cláusulas | GLM-5.3-Flash | El máximo matiz abierto que cabe en un rack, con MIT y model card | GLM-5.2 |
| Due diligence en data room | Kimi K3 | Miles de documentos que solo significan algo leídos juntos | GLM-5.3, mitad de pesos |
| Inspección de calidad desde fotos | Qwen3.8-Flash-Next | Lee la foto de la línea, o el vídeo, y redacta el informe | Qwen3.8-27B |
Las seis categorías de trabajo que publica la guía
Los modelos cambian, tu trabajo no. Cualquier caso de empresa cae en una de seis familias, y cada familia tiene su propia lógica de asignación.
1. Clasificación y extracción
El criterio, las reglas y el contexto lo escribes tú, así que el modelo no necesita ser listo: necesita ser rápido, barato y estar dentro de tu red, porque va a ver cada mensaje que entra. Un modelo pequeño afinado con tu histórico gana a cualquier modelo grande sin afinar. Sube de tamaño solo cuando la entrada es un documento entero o una imagen.
La señal: ¿cabe el prompt en una página? Entonces modelo pequeño.
2. Generación de texto
Un correo interno o mil variantes de un anuncio toleran el modelo más barato del catálogo. Una propuesta comercial o una evaluación de rendimiento las lee alguien que juzga a quien las manda y ahí merece la pena que tengas al mejor escritor por coste.
La señal: ¿sale de la empresa con una firma debajo?
3. Razonamiento sobre documentos largos
La familia donde el modelo enorme se justifica y donde hay que mirar la evaluación correcta. Un millón de tokens de contexto en un modelo que no razona lee mucho y no concluye nada. Pero ojo, tres ejecuciones anuales no pagan un cluster. Quizás para trabajos concretos te merece la pena pagar el mejor modelo por API.
La señal: ¿el valor está en un documento o en la relación entre miles de ellos?
4. Código y agentes
La división real va por autonomía y no por lenguaje: generar una función o un test acotado, contra un agente que da veinte pasos con terminal y herramientas. Son líderes distintos medidos con benchmarks distintos. Por eso en la guía la generación de código y los agentes de coding van a modelos diferentes.
La señal: ¿cuántas veces decide el modelo sin que tú mires?
5. Multimodal
Aquí manda el presupuesto de tokens visuales por imagen. Con 280 tokens se lee un gráfico. Una nómina o un A4 escaneado con letra de seis puntos necesita 16.384. Dos modelos con índices casi idénticos fallan de forma completamente distinta sobre el mismo escaneo, así que fíjate en cuántos puntos de entrada tiene la visión.
La señal: ¿la respuesta está en letra pequeña o emborronado?
6. Voz
Aquí nunca hay un solo modelo: son dos o tres encadenados, transcribir, razonar y responder con voz. Y lo que descarta es la duración máxima por llamada y los idiomas soportados. El modelo más preciso del mercado abierto se queda fuera de nuestra guía por cortar a 30 minutos y cubrir 8 idiomas, cuando los dos trabajos más habituales son reuniones y llamadas de clientes. Si tu trabajo no requiere llamadas de más de 30 minutos, Voxtral de Mistral es europeo.
La señal: ¿cuánto dura la grabación y en qué idioma habla tu cliente?
Empieza por un caso de uso y comprueba los dos resultados
La forma barata de comprobar todo esto es coger un caso de la guía, apuntar el mismo código a otro endpoint y leer las dos salidas una al lado de la otra. Te va a llevar 20 minutos a lo sumo y te permite comparar tu modelo cerrado actual con el modelo abierto recomendado.
Si quieres el mapa completo, los 80 casos con su modelo están publicados, se filtran por área y por modelo y puedes descargar la guía en PDF.
Y si prefieres que te digamos por dónde empezar con tu caso concreto, hablamos .
*Cifras de Artificial Analysis y de Hugging Face leídas el 31 de agosto de 2026.*
*Los tamaños de pesos son el total de safetensors publicado por Hugging Face, que es el número que decide cuántas GPUs necesitas.*
*Las cifras de coding agéntico de GLM y de SWE-bench de DeepSeek las publican sus fabricantes, así que valen como orientación y no como medida independiente.*