// opendata

Las cifras reales
de la plataforma.

Datos de uso de la plataforma de inferencia, agregados y anonimizados. Sin prompts, sin contenido; solo contadores a nivel de petición.

Actualización semanal · 30 Aug 2026

1.1T

Tokens procesados

acumulado

96.9M

Peticiones servidas

acumulado

20

Modelos activos

en producción

// modelos

Tokens por modelo.

Tokens acumulados por modelo. Un modelo abierto concentra la mayor parte de la carga, el stack completo está siempre disponible.

01 Qwen 3.6 48.8% 528.6 B · 82.6 M
02 DeepSeek V4-Flash 21.6% 233.9 B · 4.2 M
03 MiMo V2.5 14.2% 154.1 B · 2.2 M
04 deepseek-v4-flash-0731 5.5% 59.6 B · 512.6 K
05 glm5.2 5% 54.1 B · 617.6 K
06 Gemma 4 1.9% 20.6 B · 4.2 M
07 qwen3.8-flash 1.4% 14.9 B · 277.4 K
08 glm5.3-flash 1% 10.6 B · 96 K
09 Qwen3 Embedding 0.6% 6.9 B · 1.8 M
10 Qwen3 Coder <0.1% 142.8 M · 7.1 K
11 claude-opus-5 <0.1% 1.7 M · 533
12 claude-fable-5 <0.1% 2.2 K · 3
13 deepseek <0.1% 103 · 2
14 claude-haiku-4-5 <0.1% 43 · 3
15 Whisper Large v3 <0.1% 24 · 254.3 K
16 gpt-5.6-luna <0.1% 15 · 1
17 claude-sonnet-5 <0.1% 9 · 1
18 gemini-3.5-flash-lite <0.1% 7 · 1

// tokens

Entrada vs. salida.

La inferencia es mayoritariamente de lectura, prompts largos, recuperación y contexto, con una fracción menor de tokens generados.

Entrada · prompt 1.1 T 97.8%
Salida · generado 23.3 B 2.2%

// uso

Tokens por día.

Tokens procesados a diario en los últimos 90 días, con pico en 20.2 B/day.

0 6 B 12 B 18 B 24 B 20.2 B peak
hace 90 díashoy

// más allá del texto

Voz y reranking.

El stack va más allá de los LLM, transcripción, síntesis y reranking funcionan sobre la misma API.

Texto a voz Kokoro 92.3 K peticiones
Reranking Qwen3 Reranker 50.5 K peticiones

// clientes · últimos 7 días

Cómo se conectan los equipos.

Compatibilidad drop-in con OpenAI en producción real, el SDK oficial y OpenCode concentran la gran mayoría del tráfico.

// geografía · últimos 7 días

Origen de las peticiones.

El 70.1% del tráfico se origina en la UE, la audiencia para la que se ha construido esta infraestructura.

España 37.6% 2.6 M
AT 12.9% 885.8 K
Colombia 10.7% 739 K
Alemania 9.9% 677.8 K
México 7.9% 542.8 K
Estados Unidos 6.2% 426.6 K
Francia 4.5% 310.4 K
Finlandia 3.9% 266.7 K
Argentina 2.9% 200.9 K
Irlanda 0.9% 58.8 K
Países Bajos 0.6% 37.9 K
Chile 0.4% 30.5 K
Otros 1.7% 117 K

// rendimiento

Latencia y throughput.

Mediana de tiempo hasta el primer token y throughput sostenido por modelo, medido el 30 Aug 2026.

Modelo TTFT p50 Throughput
Qwen 3.6 n/a 30648 rpm
DeepSeek V4-Flash n/a 29989 rpm
MiMo V2.5 n/a 27761 rpm
Gemma 4 n/a 27743 rpm
glm5.3-flash n/a 3712 rpm
qwen3.8-flash n/a 1335 rpm
Kokoro n/a 47.7 rpm
Whisper Large v3 n/a 30.8 rpm
Qwen3 Embedding n/a 14.2 rpm
Qwen3 Reranker n/a 12.9 rpm
glm5.2 n/a 9.2 rpm
claude-opus-5 n/a n/a

TTFT p50 = mediana de tiempo hasta el primer token · Throughput = peticiones sostenidas por minuto.

// para quién

Dos formas de usar este stack.

Estas cifras vienen de cargas de trabajo reales, tanto de comunidad como de despliegues privados.

Builders y comunidad

Modelos frontier, precio justo, sin ceder datos.

Acceso a los últimos modelos abiertos a un coste razonable, sin compartir datos, a través de la comunidad NaN.

nan.builders →
Startups y empresas

Inferencia privada y dedicada con SLAs.

Infraestructura dedicada, soporte y SLAs contractuales, tarifa plana, datos en la UE, compatible con OpenAI.

ver_precios →

Metodología. Las cifras son contadores agregados y anonimizados recogidos a nivel de petición. Helmcode no guarda logs, nunca se almacena contenido de prompts ni respuestas. Las métricas acumuladas cubren toda la vida de la plataforma; las métricas por ventana se indican en cada sección.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.