casos de uso · Investigación

Investigación que enseña sus fuentes

No una pregunta y una respuesta: un bucle que planifica, busca, lee y escribe, sobre tu propio corpus y la literatura pública, dejando una cita en cada afirmación. El trabajo que un analista hace en dos días, redactado en veinte minutos y comprobable línea a línea.

cómo funciona

Cómo se monta.

Tres pasos, con el componente que hace el trabajo en cada uno.

paso 01

Planificar la pregunta

glm-5.2

Una pregunta amplia se convierte en una lista de preguntas concretas. Este es el paso que decide si el informe vale algo y por eso un modelo de razonamiento se gana el sitio aquí aunque cueste más por token que el que redacta.

paso 02

Buscar y leer

qwen3-embedding + rerank

Recuperación sobre tus propios documentos y búsqueda web cuando la respuesta está fuera de ellos. Cada fuente se lee entera en vez de por el fragmento y ahí la tarifa plana cambia lo que te puedes permitir: leer cincuenta documentos cuesta lo mismo que leer cinco.

paso 03

Redactar, con la traza pegada

deepseek-v4-flash

El borrador lleva una referencia en cada afirmación, hasta el pasaje del que salió. Quien no se crea una frase puede abrir su fuente, que es la única versión de esto que sobrevive al contacto con un experto.

drop-in

Cambia una línea. El código se queda.

Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.

leer_los_docs
research.py
from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.helmcode.com/v1",  # one line changes
)

# 1 · plan the question into specific ones
plan = client.chat.completions.create(
    model="glm-5.2",
    messages=[{
        "role": "user",
        "content": "Break this into sub-questions: " + question,
    }],
)

# 2 · retrieve over your corpus, read each source whole
vectors = client.embeddings.create(
    model="qwen3-embedding",
    input=sources,
)

# 3 · write, with a reference on every claim
report = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": CITE_EVERY_CLAIM},
        *turns,
    ],
)

por qué aquí

Por qué en Helmcode.

Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.

01

Tu corpus no es el producto

Los prompts, los pasajes recuperados y los borradores no se almacenan ni entrenan ningún modelo. La investigación es donde pones tu material más sensible por definición, porque preguntas justo por lo que aún no has publicado.

02

El bucle es donde explota el coste

Una ejecución de investigación no es una llamada, son decenas: planificar, buscar, leer, releer, redactar, verificar. El precio por token hace que los equipos corten el bucle antes de tiempo, que es justo el sitio equivocado para ahorrar. La tarifa plana quita el motivo para cortarlo.

03

Contexto largo, bien usado

Hasta 1M de tokens de contexto significa meter un expediente entero de una vez cuando la recuperación sola fragmentaría el argumento. Primero recuperación y ventana de contexto cuando la pregunta atraviesa el documento en vez de estar en un párrafo.

sectores

Dónde se usa.

Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.

todos_los_sectores →

En producción en

// faq

Investigación, respondida.

Lo que preguntan los equipos de investigación y legal antes de apuntar un bucle a sus propias fuentes.

¿En qué se diferencia esto del RAG?

El RAG responde una pregunta a partir de tus documentos en una pasada. La investigación planifica un conjunto de preguntas, busca varias veces, lee las fuentes enteras, detecta lo que falta y vuelve a por ello, y luego redacta algo más largo que una respuesta. La misma recuperación por debajo, distinta cantidad de trabajo por encima.

¿Puede buscar en la web además de en nuestros documentos?

Sí. La plataforma expone un endpoint de búsqueda web, así que una ejecución puede mezclar tu corpus interno con fuentes públicas y citar ambas. Qué fuentes se permiten lo decides tú y para el trabajo más estricto puedes apagar la web y mantener el bucle enteramente dentro de tu material.

¿Podemos fiarnos de las citas?

Una cita apunta a un pasaje que se recuperó de verdad, así que se puede abrir y leer. Eso hace localizable una afirmación equivocada, que es la propiedad útil. No hace que el modelo tenga razón: quien revisa sigue siendo la persona y un informe de investigación es un borrador para un experto, no un sustituto de uno.

¿El dato de la investigación sale de nuestra red?

Solo si lo permites. Por defecto, inferencia solo en la UE con cero logs y el despliegue on-premise ejecuta los mismos modelos y la misma API dentro de tu datacenter, que es la elección habitual para I+D y para material sujeto a secreto.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.