casos de uso · Datos sintéticos

Prueba con datos que no son de nadie

Los entornos de staging corren con una copia de producción porque escribir datos realistas a mano es tedioso y esa copia es una brecha esperando una mala configuración. Genera datos con la forma de lo real y sin ninguna de sus personas.

cómo funciona

Cómo se monta.

Tres pasos, con el componente que hace el trabajo en cada uno.

paso 01

Describir la forma

schema + rules

Parte del esquema y de las restricciones que de verdad se cumplen: identificadores válidos, fechas plausibles, distribuciones parecidas a producción. El valor está en los casos límite, así que nómbralos explícitamente en vez de esperar que aparezcan.

paso 02

Generar a volumen

deepseek-v4-flash

El texto libre es la parte que ninguna librería de fixtures te da: relatos de reclamación, notas clínicas, hilos de soporte, descripciones de producto en tu propio registro. Ahí un modelo de lenguaje gana a un generador aleatorio y ahí el volumen se encarece por token.

paso 03

Validar, también contra fugas

qwen-3.6

Comprueba las distribuciones contra el conjunto real y comprueba que ningún registro generado reproduzca uno real. Un generador al que le pasas ejemplos reales puede repetirlos, así que este paso es un requisito y no un extra.

drop-in

Cambia una línea. El código se queda.

Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.

leer_los_docs
generate.py
from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.helmcode.com/v1",  # one line changes
)

# the schema, and the edge cases you want covered
rows = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{
        "role": "system",
        "content": schema + edge_cases,
    }],
    response_format={"type": "json_object"},
)

# then check the distributions, and that nothing echoes
assert no_overlap(rows, production_sample)

por qué aquí

Por qué en Helmcode.

Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.

01

El generador se pone junto al dato real

Para producir datos con tu forma, el modelo tiene que ver muestras tuyas. Eso convierte esto en otro caso que pertenece dentro de tu perímetro, con cero logs, y no en la API de otro.

02

Millones de filas, un precio

Un conjunto sintético útil no son mil filas, es del tamaño de lo que estás probando. El precio por token convierte eso en una petición de presupuesto; la tarifa plana lo convierte en una tarde.

03

Sintético no es anonimizado

Son dos cosas distintas y los reguladores las tratan distinto. El dato inventado a partir de una descripción no lleva a ninguna persona; el dato derivado de registros reales puede seguir teniendo riesgo de reidentificación. Ten claro cuál construiste y di cuál es.

sectores

Dónde se usa.

Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.

todos_los_sectores →

En producción en

// faq

Datos sintéticos, respondidos.

Lo que preguntan los equipos de plataforma y de datos antes de que staging deje de correr sobre una copia de producción.

¿Sirve el dato sintético para entrenar?

Para ampliar una clase con pocos ejemplos o cubrir un caso límite que apenas ves, muchas veces sí. Como sustituto completo del dato real, tiende a aplanar justo los patrones raros que querías que el modelo aprendiera. Trátalo como suplemento y mide contra un conjunto real de validación.

¿Podemos usarlo para probar sesgos sin tocar dato real?

Es útil para sondear: construye casos equivalentes que difieran en un atributo y mira si cambia la decisión. No sustituye medir el sesgo sobre resultados reales y bajo el artículo 10 del AI Act tratar características protegidas reales para eso tiene sus propias condiciones.

¿Produce identificadores y formatos españoles válidos?

Con las reglas de comprobación en el prompt, sí: letra de control de NIF y CIF, dígitos de control de IBAN, códigos postales que cuadran con la provincia. Pon la validación también en tu pipeline, porque un generador que acierta el 99% de las veces sigue rompiendo una suite de tests.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.