deepseek-v4-flash sota flagship 284B MoE · 21B active · FP8 · 1M context Flagship para trabajo complejo y agéntico: documentos largos, codebases grandes y uso de herramientas en varios pasos.
Helmcode sirve siete modelos open-weight tras una sola API compatible con OpenAI en https://api.helmcode.com/v1. Cada modelo funciona igual: solo cambia el id de model . Usa el id exactamente como se muestra. Para límites y cuotas, consulta Rate limits.
deepseek-v4-flash sota flagship 284B MoE · 21B active · FP8 · 1M context Flagship para trabajo complejo y agéntico: documentos largos, codebases grandes y uso de herramientas en varios pasos.
qwen3.6 35B MoE · 3B active · FP8 · 256K context Un solo modelo, tres tipos de entrada — imagen, audio, texto — y devuelve texto.
gemma4 26B MoE · 4B active · FP8 · 256K context Pensado para rendimiento: el speculative decoding entrega ~2× tokens por segundo.
qwen3-embedding 8B · 4096 dimensions · Float32 · MMTEB 70.58 Embeddings semánticos multilingües para recuperación y búsqueda.
rerank Qwen3-Reranker-8B · BF16 · /v1/rerank Reranking translingüe: reordena los pasajes recuperados por relevancia real.
kokoro 82M params · <1s latency · 67 voices Texto a voz en tiempo real con latencia por debajo del segundo.
whisper-large-v3 99+ languages · 3.2% WER (Spanish) Voz a texto con detección automática de idioma.
En los planes Dedicated y On-premise también puedes correr modelos custom o fine-tuned en hardware reservado para ti. Mira Ejemplos para ver cómo llamar a cada familia.
oferta aparte · se paga con crédito · corre fuera de la UE
La misma API sirve además nueve modelos de frontera de tres proveedores estadounidenses. Es una oferta aparte del catálogo open-weight de arriba, y se diferencian en las dos cosas que deciden un modelo para casi cualquier comprador: quién opera el hardware y qué paga los tokens.
Nada de lo anterior cambia. Nuestros modelos siguen corriendo en hardware que operamos en la UE, y el plan mensual sigue cubriéndolos a tarifa plana.
Corren en la infraestructura del proveedor, en Estados Unidos
Cada uno de estos modelos corre en Anthropic, Google u OpenAI. Tus mensajes, tus adjuntos y las respuestas se envían al que de ellos sirva el modelo que elijas, y se procesan en la infraestructura de ese proveedor, fuera de la UE. Nuestros modelos corren en hardware que operamos en la UE y nada sale de ahí. La consola muestra el mismo aviso junto al modelo que estás eligiendo, porque ese es el momento en que se toma la decisión.
Se pagan por token, desde crédito prepago
Ningún plan mensual los cubre, en ningún nivel, ni aunque le quede cuota mensual sin consumir. Una organización con plan y sin crédito los sigue viendo y puede seleccionarlos, y la petición se rechaza hasta que recargue el saldo. La cuota de tu plan queda intacta y sigue funcionando con nuestros modelos.
Precio de lista del proveedor, sin margen sobre la inferencia
En entrada, salida y lecturas de caché pasamos el precio de lista de cada proveedor sin añadir nada. Lo que publicamos es exactamente lo que cobramos, y eso es lo que te permite reconciliar un extracto contra la lista de tarifas línea a línea. Nuestro ingreso en estos modelos es la comisión al comprar crédito, no tu consumo.
El mismo catálogo y la misma clave que todo lo anterior. El endpoint que lista modelos los devuelve junto a los nuestros, y lo único que cambia es el id.
| Modelo | Proveedor |
|---|---|
claude-fable-5 | Anthropic US |
claude-opus-5 | Anthropic US |
claude-sonnet-5 | Anthropic US |
claude-haiku-4-5 | Anthropic US |
gpt-5.6-sol | OpenAI US |
gpt-5.6-terra | OpenAI US |
gpt-5.6-luna | OpenAI US |
gemini-3.6-flash | Google US |
gemini-3.5-flash-lite | Google US |
Las tarifas no se publican aquí, y es deliberado. Una tarifa vive en un solo sitio, y ese sitio es lo que la cobra: tu consola, en Créditos, pestaña Private models. Ahí tienes la lista de precios completa, las cuatro tarifas de cada modelo (entrada, salida, entrada en caché y escritura de caché) y lo que te ha costado cada uno hasta ahora.
Abrir la lista de precios en la consola
Esas tarifas se mueven, y conviene saber por qué para que un cambio no parezca un capricho nuestro. Pasamos el precio de lista de cada proveedor sin margen, o sea que no somos nosotros quienes lo fijamos: cuando un proveedor lo cambia, el nuestro lo sigue el mismo día. Y como cobramos en euros mientras los proveedores publican en dólares, el importe en euros sigue además al tipo de cambio euro-dólar. Las dos cosas están fuera de nuestro control, y por eso el número tiene que estar en un único sitio siempre actualizado y no en una página que se queda vieja en silencio entre despliegues.
Una caché de prompt permite a un modelo releer un prefijo largo (un system prompt, un documento, un codebase) sin volver a pagar por él la tarifa de entrada completa. OpenAI y Google cobran una tarifa reducida por leerla y nada en absoluto por crearla. Anthropic cobra un recargo por escribir y un descuento por leer, lo que convierte la escritura en una cuarta clase facturable y no en un descuento, y por eso la lista de precios lleva una columna de escritura de caché que en los otros seis modelos está vacía.
Publicamos y cobramos una sola tarifa de escritura de caché en Anthropic, sea cual sea la vida de la entrada. Anthropic cobra menos por una caché de vida corta, así que en esas escrituras nuestra tarifa queda por encima de la suya. La publicamos en lugar de disolverla en la tarifa de entrada, porque una tarifa que cobramos y no mostramos sería un margen con otro nombre. Tu extracto lista las cuatro cantidades por separado, así que la cuenta se puede comprobar: cantidad por tarifa publicada, en cada una de las cuatro, suma lo que se cobró.
La misma URL base, la misma clave, el mismo cuerpo de petición. Solo cambia el id del modelo.
curl https://api.helmcode.com/v1/chat/completions \
-H "Authorization: Bearer $HELMCODE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Hello"}]
}' Si el saldo se agota, la API responde 402 credits_exhausted y solo se rechazan estos modelos: todo lo que cubre tu plan sigue respondiendo, así que un rechazo no es una caída. El saldo nunca baja de cero. Cuando una petición cuesta más de lo que queda, cobramos lo que había y absorbemos la diferencia.
Cómo funciona el crédito: comprarlo, la comisión, agotarlo y reconciliarlo