// precios

Precios

Paga por API key, no por token. Tokens ilimitados en Qwen y Gemma, sin permanencia, cancela cuando quieras.

Starter

€399/mes

Para equipos pequeños que empiezan a integrar IA en sus flujos de trabajo.


  • 5 API Keys
  • Tokens ilimitados · Qwen y Gemma
  • 2.5B tokens/mes · SOTA y DeepSeek
  • Compatible con la API de OpenAI
  • Sin logs · datos en la UE
  • Soporte por email

Scale

€3,199/mes

Para organizaciones con uso intensivo de IA y necesidades avanzadas.


  • 40 API Keys
  • Tokens ilimitados · Qwen y Gemma
  • 20B tokens/mes · SOTA y DeepSeek
  • Compatible con la API de OpenAI
  • Sin logs · datos en la UE
  • Soporte prioritario
  • SLA 99.9%
  • Acceso anticipado a nuevos modelos

Enterprise

A medida

Para organizaciones que necesitan GPUs dedicadas y configuración a medida.


  • +60 API Keys
  • Tokens ilimitados · Qwen y Gemma
  • Cap a medida · SOTA y DeepSeek
  • GPUs dedicadas
  • Modelos a medida
  • Sin logs · datos en la UE
  • SLA a medida
  • Onboarding dedicado

Todos los planes incluyen límites de RPM y concurrencia por API Key para garantizar la calidad del servicio.

// calculadora de roi

Cuánto ahorras al migrar.

Compara tu gasto en APIs cerradas con la tarifa plana de Helmcode sobre modelos abiertos. Tres preguntas, sin buscar facturas de tokens.

€/mes

precio de lista $5 / $30 por M

¿para qué lo usas? (puedes marcar varios)

Siempre queda al menos un caso de uso marcado.

Responde a las tres preguntas y pulsa calcular_ahorro para ver tu estimación.

Estimación orientativa para discusión interna. Parte de los precios de lista por millón de tokens (julio 2026) en dólares, convertidos a euros a 0,867 (tipo de referencia del BCE, 2026-08-13), y de tasas de caché típicas por caso de uso y proveedor. No modelamos el recargo por escritura de caché, así que la estimación se queda corta antes que larga. Helmcode no garantiza un ahorro concreto: tu descuento por volumen o tu patrón de uso pueden variar la cifra.

infraestructura dedicada

El stack de inferencia,
en tu datacenter.

Si tu caso de uso requiere soberanía total del dato, desplegamos y operamos el stack de inferencia completo dentro de tu propia infraestructura. Tus modelos, tus datos y tus prompts nunca salen de tu red.

hablemos →
Despliegue on-premise Instalamos y operamos el stack completo en tus servidores, con la misma API compatible con OpenAI.
Asesoría de hardware Te ayudamos a elegir las GPUs, la memoria y la red adecuadas para tu caso de uso y tu presupuesto.
Soberanía total del dato Tus datos y tus prompts nunca salen de tu red. Pensado para banca, salud y defensa.
En producción en

// faq de precios

Precios, explicados.

Todo sobre planes, límites y facturación, antes de que preguntes.

¿Pago por API key o por token?

Por API key, precio mensual fijo. Qwen y Gemma no llevan ningún cargo por token, y el resto corre contra una cuota que conoces de antemano. Una partida fija en la cuenta de resultados.

¿Cuál es la diferencia entre "tokens ilimitados" y el cap mensual de SOTA?

Qwen3.6 y Gemma 4 son ilimitados en todos los planes, igual que voz y embeddings. El cap mensual cubre los modelos donde el cómputo es más caro, y DeepSeek V4 Flash cuenta contra él. GLM 5.2 tiene su propia cuota aparte y nunca toca tu cap. Siempre avisamos antes de cualquier exceso. Nunca llega una factura sorpresa.

¿Cómo se factura GLM 5.2?

Como add-on sobre cualquier plan: 150 € por API key al mes. Incluye su propia cuota mensual de tokens para la organización, compartida entre tus keys: 2B en Starter, 6.5B en Growth y 18B en Scale. Esa cuota va aparte del cap de SOTA, así que usar GLM a fondo nunca se come el resto de tu capacidad, y no hay cargos por exceso: el uso se pausa hasta el siguiente ciclo de facturación.

¿Hay permanencia o lock-in?

No. Los planes son mes a mes y cancelas cuando quieras. Todo corre sobre modelos open-weight a los que siempre tendrás acceso. Ningún proveedor puede deprecar tu API ni cambiarte el precio de un día para otro.

¿Puedo cambiar de plan más adelante?

Sí. Subes o bajas de plan cuando quieras y los cambios se prorratean. Cuando crece el uso, subes de tier. La API y tu código se quedan exactamente igual.

¿Cómo funcionan los rate limits?

Los límites van por API key: peticiones por minuto y concurrencia, para garantizar calidad de servicio, no por tokens procesados. Una sola key mueve cientos de millones de tokens al mes.

¿Ofrecéis GPUs dedicadas u on-premise?

Sí, en Enterprise: hardware dedicado NVIDIA Blackwell, modelos custom con fine-tuning y despliegue on-premise completo dentro de tu datacenter. Contacta para un presupuesto a medida.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.