// casos de uso · agentes autonomos

Agentes que
no topan con un muro.

Agentes autónomos y automatización de procesos sobre modelos abiertos, tool calling, razonamiento y sin límites de tokens, para que un bucle largo no muera en un 429.

// cómo funciona

Planifica, actúa, observa, sin muro de tokens.

Tool calling, razonamiento y bucles sin contador en un único endpoint compatible con OpenAI, solo dentro de la UE.

paso 01

Define herramientas y objetivo

deepseek-v4-flash

Se le dan al agente las herramientas y el objetivo. El function calling nativo y el razonamiento dirigen el bucle, las mismas herramientas JSON que ya se usan con OpenAI.

paso 02

Ejecuta el bucle

qwen3.6

Planifica, actúa, observa, repite. Los agentes queman tokens en rafagas, y sin límites, el bucle no se atasca en un 429 a mitad de tarea.

paso 03

Escala en horizontal

deepseek-v4-flash

Se ejecutan muchos agentes en paralelo. Los límites son RPM y concurrencia por key, dimensionados a la carga sobre GPUs dedicadas, despliegue en abanico sin techo.

// drop-in

Cambia una línea. El bucle sigue igual.

El mismo bucle de agente que ya se escribe, apuntado a Helmcode. Herramientas y streaming incluidos, sobre modelos privados de la UE sin muro de tokens.

leer_los_docs
agent.py
from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.helmcode.com/v1")

# plan, act, observe, repeat — no token wall to hit
while not done:
    step = client.chat.completions.create(
        model="deepseek-v4-flash",
        messages=history,
        tools=tools,        # native tool calling
    )
    history += run_tools(step)   # act, then observe

// por qué helmcode

Pensado para cómo funcionan los agentes de verdad.

Los bucles de agente disparan picos enormes de tokens, justo el patron que las APIs con contador castigan con 429 y facturas sorpresa.

01

Sin límites, sin muros de 429.

Los agentes disparan rafagas enormes de tokens. Sin límites en el consumo total y sin muros de rate-limit a mitad del bucle, solo RPM y concurrencia por key.

02

Tool calling y razonamiento.

Function calling nativo y razonamiento, la base que un agente necesita para planificar y actuar, no solo para chatear. Modelos abiertos de referencia, pensados para el bucle.

03

Sin logs, por arquitectura.

Las trazas del agente, y el código y los datos que toca, no se almacenan nunca ni entrenan ningún modelo, ni el nuestro ni el de nadie.

04

Procesado en la UE.

Los agentes se ejecutan en infraestructura de la UE, no en hyperscalers de EE. UU. sujetos al Cloud Act. GDPR y AI Act nativos, incluso cuando acceden a sistemas sensibles.

05

Modelos abiertos, sin lock-in.

DeepSeek V4-Flash, Qwen 3.6, Gemma 4. Ningún proveedor puede deprecar el modelo del que dependen los agentes ni cambiar el precio de un día para otro.

06

Compatible con cualquier framework.

LangGraph, CrewAI, el OpenAI Agents SDK y bucles propios. Cambias la base URL y la key, herramientas y streaming incluidos.

En producción en
  • Dev tools y agentes de código
  • Telco
  • Productos AI-native
En producción en

// faq de agentes

Agentes, respondido.

Lo que preguntan los equipos de plataforma e ingeniería antes de llevar agentes a producción.

¿Por qué importa "sin límites" en el caso concreto de los agentes?

Los bucles de agente planifican, llaman herramientas y re-promptean, disparando picos enormes de tokens. Las APIs con contador estrangulan o devuelven 429 a mitad de tarea; Helmcode no tiene límites de tokens, solo RPM y concurrencia por key, así que el bucle se ejecuta hasta el final.

¿Soportáis tool / function calling?

Sí, function calling nativo con el mismo JSON schema que ya se usa con OpenAI, más razonamiento y streaming. La base que los agentes necesitan para actuar, no solo para responder.

¿Funciona con LangGraph, CrewAI o el OpenAI Agents SDK?

Sí. Basta con apuntar cualquier framework compatible con OpenAI a nuestra base URL con la API key, LangGraph, CrewAI, el Agents SDK y bucles a medida funcionan sin cambios.

¿Se pueden ejecutar muchos agentes en paralelo?

Sí. La concurrencia es por API key y se dimensiona a la carga, con GPUs dedicadas para flotas de agentes de alto rendimiento.

¿Almacenáis las trazas de los agentes o los datos que tocan?

No. Sin logs, los prompts, las trazas y el código y los datos que leen los agentes no se persisten nunca ni entrenan ningún modelo.

¿Pueden los agentes ejecutarse on-premise?

Sí. Se ejecutan en una GPU dedicada o totalmente on-premise dentro de tu datacenter, la misma API y el mismo código, con todo dentro de la red.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.