// opendata

Las cifras reales
de la plataforma.

Datos de uso de la plataforma de inferencia, agregados y anonimizados. Sin prompts, sin contenido; solo contadores a nivel de petición.

Actualización semanal · 9 Aug 2026

788.5B

Tokens procesados

acumulado

76M

Peticiones servidas

acumulado

15

Modelos activos

en producción

// modelos

Tokens por modelo.

Tokens acumulados por modelo. Un modelo abierto concentra la mayor parte de la carga, el stack completo está siempre disponible.

01 Qwen 3.6 56% 441.4 B · 66.1 M
02 MiMo V2.5 16.4% 129 B · 1.7 M
03 DeepSeek V4-Flash 15.7% 123.8 B · 2.6 M
04 deepseek-v4-flash-0731 4.8% 37.7 B · 273.7 K
05 glm5.2 4.7% 36.9 B · 405.3 K
06 Gemma 4 2% 15.6 B · 3.3 M
07 Qwen3 Embedding 0.5% 3.9 B · 1.3 M
08 Qwen3 Coder <0.1% 142.8 M · 7.1 K
09 claude-fable-5 <0.1% 2.2 K · 3
10 claude-haiku-4-5 <0.1% 34 · 2
11 Whisper Large v3 <0.1% 24 · 204.9 K
12 gpt-5.6-luna <0.1% 15 · 1
13 gemini-3.5-flash-lite <0.1% 7 · 1

// tokens

Entrada vs. salida.

La inferencia es mayoritariamente de lectura, prompts largos, recuperación y contexto, con una fracción menor de tokens generados.

Entrada · prompt 771.4 B 97.8%
Salida · generado 17.1 B 2.2%

// uso

Tokens por día.

Tokens procesados a diario en los últimos 90 días, con pico en 15.9 B/day.

0 5 B 10 B 15 B 15.9 B peak
hace 90 díashoy

// más allá del texto

Voz y reranking.

El stack va más allá de los LLM, transcripción, síntesis y reranking funcionan sobre la misma API.

Texto a voz Kokoro 59.6 K peticiones
Reranking Qwen3 Reranker 40.1 K peticiones

// clientes · últimos 7 días

Cómo se conectan los equipos.

Compatibilidad drop-in con OpenAI en producción real, el SDK oficial y OpenCode concentran la gran mayoría del tráfico.

OpenAI SDK (Python) 32.5% 196 devs
curl 17.9% 108 devs
OpenAI SDK (JS) 16.3% 98 devs
Node.js 8.8% 53 devs
Python httpx 5.8% 35 devs
Vercel AI SDK 5.8% 35 devs
Go HTTP client 5.5% 33 devs
Python requests 4% 24 devs
Otros 3.5% 21 devs

// geografía · últimos 7 días

Origen de las peticiones.

El 71.3% del tráfico se origina en la UE, la audiencia para la que se ha construido esta infraestructura.

España 51.6% 2.8 M
Colombia 14.4% 795.8 K
Alemania 9.8% 537.5 K
Estados Unidos 8.1% 444.2 K
Finlandia 6% 328.1 K
Francia 3.3% 179.9 K
México 2.8% 156.9 K
Argentina 1.5% 83.3 K
Países Bajos 0.5% 27.9 K
Chile 0.4% 21.9 K
Peru 0.3% 15.6 K
Irlanda 0.2% 11.4 K
Otros 1.2% 65 K

// rendimiento

Latencia y throughput.

Mediana de tiempo hasta el primer token y throughput sostenido por modelo, medido el 9 Aug 2026.

Modelo TTFT p50 Throughput
Qwen 3.6 n/a 15611 rpm
DeepSeek V4-Flash n/a 12992 rpm
Gemma 4 n/a 12963 rpm
MiMo V2.5 n/a 12934 rpm
Whisper Large v3 n/a 16.3 rpm
Kokoro n/a 16.3 rpm
deepseek-v4-flash-0731 n/a 13.9 rpm
Qwen3 Embedding n/a 10 rpm
glm5.2 n/a 3.9 rpm
Qwen3 Reranker n/a 1.1 rpm

TTFT p50 = mediana de tiempo hasta el primer token · Throughput = peticiones sostenidas por minuto.

// para quién

Dos formas de usar este stack.

Estas cifras vienen de cargas de trabajo reales, tanto de comunidad como de despliegues privados.

Builders y comunidad

Modelos frontier, precio justo, sin ceder datos.

Acceso a los últimos modelos abiertos a un coste razonable, sin compartir datos, a través de la comunidad NaN.

nan.builders →
Startups y empresas

Inferencia privada y dedicada con SLAs.

Infraestructura dedicada, soporte y SLAs contractuales, tarifa plana, datos en la UE, compatible con OpenAI.

ver_precios →

Metodología. Las cifras son contadores agregados y anonimizados recogidos a nivel de petición. Helmcode no guarda logs, nunca se almacena contenido de prompts ni respuestas. Las métricas acumuladas cubren toda la vida de la plataforma; las métricas por ventana se indican en cada sección.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.