Docs

Modelos

Helmcode sirve siete modelos open-weight tras una sola API compatible con OpenAI en https://api.helmcode.com/v1. Cada modelo funciona igual: solo cambia el id de model . Usa el id exactamente como se muestra. Para límites y cuotas, consulta Rate limits.

Modelos de lenguaje

deepseek-v4-flash sota flagship 284B MoE · 21B active · FP8 · 1M context

Flagship para trabajo complejo y agéntico: documentos largos, codebases grandes y uso de herramientas en varios pasos.

Capacidades
Tool calling · razonamiento · streaming (SSE)
Ideal para
Razonamiento, agentes, análisis de contexto largo
qwen3.6 35B MoE · 3B active · FP8 · 256K context

Un solo modelo, tres tipos de entrada — imagen, audio, texto — y devuelve texto.

Capacidades
Visión · audio · tool calling · razonamiento (max_tokens ≥ 300)
Ideal para
Chat multimodal, comprensión de documentos + medios
gemma4 26B MoE · 4B active · FP8 · 256K context

Pensado para rendimiento: el speculative decoding entrega ~2× tokens por segundo.

Capacidades
Tool calling (XML) · razonamiento · visión · streaming
Ideal para
RAG de alto volumen, clasificación, autocompletado de código

Embeddings y reranking

qwen3-embedding 8B · 4096 dimensions · Float32 · MMTEB 70.58

Embeddings semánticos multilingües para recuperación y búsqueda.

Capacidades
100+ idiomas · 60 rpm · lote 32
Ideal para
Recuperación RAG, búsqueda semántica, clasificación
rerank Qwen3-Reranker-8B · BF16 · /v1/rerank

Reranking translingüe: reordena los pasajes recuperados por relevancia real.

Capacidades
100+ idiomas · 1000 rpm
Ideal para
El paso intermedio de RAG (embedding → rerank → LLM)

Voz

kokoro 82M params · <1s latency · 67 voices

Texto a voz en tiempo real con latencia por debajo del segundo.

Capacidades
Voces incl. ef_dora (ES), em_alex (ES), af_heart (EN) · 15 rpm
Ideal para
Agentes en vivo, IVR, interfaces de voz
whisper-large-v3 99+ languages · 3.2% WER (Spanish)

Voz a texto con detección automática de idioma.

Capacidades
25MB / ~2 min por petición · 10 rpm · OGG/Opus, MP3
Ideal para
Transcripción, notas de reunión, búsqueda por voz

En los planes Dedicated y On-premise también puedes correr modelos custom o fine-tuned en hardware reservado para ti. Mira Ejemplos para ver cómo llamar a cada familia.


oferta aparte · se paga con crédito · corre fuera de la UE

Modelos de frontera de OpenAI, Anthropic y Google

La misma API sirve además nueve modelos de frontera de tres proveedores estadounidenses. Es una oferta aparte del catálogo open-weight de arriba, y se diferencian en las dos cosas que deciden un modelo para casi cualquier comprador: quién opera el hardware y qué paga los tokens.

Nada de lo anterior cambia. Nuestros modelos siguen corriendo en hardware que operamos en la UE, y el plan mensual sigue cubriéndolos a tarifa plana.

Corren en la infraestructura del proveedor, en Estados Unidos

Cada uno de estos modelos corre en Anthropic, Google u OpenAI. Tus mensajes, tus adjuntos y las respuestas se envían al que de ellos sirva el modelo que elijas, y se procesan en la infraestructura de ese proveedor, fuera de la UE. Nuestros modelos corren en hardware que operamos en la UE y nada sale de ahí. La consola muestra el mismo aviso junto al modelo que estás eligiendo, porque ese es el momento en que se toma la decisión.

Se pagan por token, desde crédito prepago

Ningún plan mensual los cubre, en ningún nivel, ni aunque le quede cuota mensual sin consumir. Una organización con plan y sin crédito los sigue viendo y puede seleccionarlos, y la petición se rechaza hasta que recargue el saldo. La cuota de tu plan queda intacta y sigue funcionando con nuestros modelos.

Precio de lista del proveedor, sin margen sobre la inferencia

En entrada, salida y lecturas de caché pasamos el precio de lista de cada proveedor sin añadir nada. Lo que publicamos es exactamente lo que cobramos, y eso es lo que te permite reconciliar un extracto contra la lista de tarifas línea a línea. Nuestro ingreso en estos modelos es la comisión al comprar crédito, no tu consumo.

Los nueve modelos

El mismo catálogo y la misma clave que todo lo anterior. El endpoint que lista modelos los devuelve junto a los nuestros, y lo único que cambia es el id.

Modelo Proveedor
claude-fable-5 Anthropic US
claude-opus-5 Anthropic US
claude-sonnet-5 Anthropic US
claude-haiku-4-5 Anthropic US
gpt-5.6-sol OpenAI US
gpt-5.6-terra OpenAI US
gpt-5.6-luna OpenAI US
gemini-3.6-flash Google US
gemini-3.5-flash-lite Google US
El dashboard de la consola de Helmcode: la gráfica de uso por modelo de treinta días y la lista de modelos disponibles, donde los nueve revendidos aparecen junto a los nuestros.
Los nueve aparecen en la misma lista de modelos que los nuestros, en la consola.

Dónde está el precio, y por qué se mueve

Las tarifas no se publican aquí, y es deliberado. Una tarifa vive en un solo sitio, y ese sitio es lo que la cobra: tu consola, en Créditos, pestaña Private models. Ahí tienes la lista de precios completa, las cuatro tarifas de cada modelo (entrada, salida, entrada en caché y escritura de caché) y lo que te ha costado cada uno hasta ahora.

La lista de precios en la consola de Helmcode: nueve modelos con su proveedor, la marca de residencia US y cuatro columnas de tarifa para entrada, entrada en caché, escritura de caché y salida.
La lista de precios en la consola: nueve modelos, su proveedor, la marca de residencia US y las cuatro tarifas. Ese es el precio al que se cobran tus peticiones.

Abrir la lista de precios en la consola

Esas tarifas se mueven, y conviene saber por qué para que un cambio no parezca un capricho nuestro. Pasamos el precio de lista de cada proveedor sin margen, o sea que no somos nosotros quienes lo fijamos: cuando un proveedor lo cambia, el nuestro lo sigue el mismo día. Y como cobramos en euros mientras los proveedores publican en dólares, el importe en euros sigue además al tipo de cambio euro-dólar. Las dos cosas están fuera de nuestro control, y por eso el número tiene que estar en un único sitio siempre actualizado y no en una página que se queda vieja en silencio entre despliegues.

Anthropic cobra por escribir en la caché de prompt, los otros dos no

Una caché de prompt permite a un modelo releer un prefijo largo (un system prompt, un documento, un codebase) sin volver a pagar por él la tarifa de entrada completa. OpenAI y Google cobran una tarifa reducida por leerla y nada en absoluto por crearla. Anthropic cobra un recargo por escribir y un descuento por leer, lo que convierte la escritura en una cuarta clase facturable y no en un descuento, y por eso la lista de precios lleva una columna de escritura de caché que en los otros seis modelos está vacía.

Publicamos y cobramos una sola tarifa de escritura de caché en Anthropic, sea cual sea la vida de la entrada. Anthropic cobra menos por una caché de vida corta, así que en esas escrituras nuestra tarifa queda por encima de la suya. La publicamos en lugar de disolverla en la tarifa de entrada, porque una tarifa que cobramos y no mostramos sería un margen con otro nombre. Tu extracto lista las cuatro cantidades por separado, así que la cuenta se puede comprobar: cantidad por tarifa publicada, en cada una de las cuatro, suma lo que se cobró.

Cómo se llama a uno

La misma URL base, la misma clave, el mismo cuerpo de petición. Solo cambia el id del modelo.

curl https://api.helmcode.com/v1/chat/completions \
  -H "Authorization: Bearer $HELMCODE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Si el saldo se agota, la API responde 402 credits_exhausted y solo se rechazan estos modelos: todo lo que cubre tu plan sigue respondiendo, así que un rechazo no es una caída. El saldo nunca baja de cero. Cuando una petición cuesta más de lo que queda, cobramos lo que había y absorbemos la diferencia.

Cómo funciona el crédito: comprarlo, la comisión, agotarlo y reconciliarlo