casos de uso · Anonimización

Quita la identidad, deja el significado

Un dataset que no puedes compartir es un dataset que no puedes usar dos veces. Detecta el dato personal en documentos, transcripciones y expedientes, sustitúyelo de forma consistente, y deja el texto útil para el análisis que querías hacer sobre él.

cómo funciona

Cómo se monta.

Tres pasos, con el componente que hace el trabajo en cada uno.

paso 01

Detectar, no solo buscar patrones

deepseek-v4-flash

Una expresión regular encuentra un teléfono. No encuentra "el paciente del martes cuyo hermano trabaja aquí", que identifica a una persona igual de bien. Leer la frase es la parte que necesita un modelo.

paso 02

Sustituir de forma consistente

pseudonym map

La misma persona pasa a ser el mismo token en todo el documento, así el texto sigue teniendo sentido y el análisis sigue funcionando. La consistencia es lo que separa un archivo pseudonimizado utilizable de una página llena de tachones.

paso 03

Verificar la salida, dos veces

qwen-3.6

Una segunda pasada sobre el texto redactado busca lo que dejó la primera. Este paso no es opcional: el coste de un fallo aquí es una notificación a la autoridad de control y una revisión por muestreo no encuentra el fallo del documento cuatrocientos.

drop-in

Cambia una línea. El código se queda.

Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.

leer_los_docs
redact.py
from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.helmcode.com/v1",  # one line changes
)

# 1 · find what identifies a person, not just a pattern
found = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": FIND_IDENTIFIERS},
        {"role": "user", "content": document},
    ],
    response_format={"type": "json_object"},
)

# 2 · same person, same token, everywhere in the file
clean = apply_pseudonyms(document, found)

# 3 · a second pass over the redacted text
check = client.chat.completions.create(
    model="qwen-3.6",
    messages=[{"role": "user", "content": clean}],
)

por qué aquí

Por qué en Helmcode.

Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.

01

Tiene que correr donde ya está el dato en bruto

La anonimización es el único trabajo cuya entrada es por definición la versión sin proteger. Mandar eso a una API de terceros para que lo limpien es el problema que querías resolver y por eso este caso suele ejecutarse on-premise.

02

El volumen es justo el punto

Nadie anonimiza diez documentos, se anonimiza un archivo entero. La tarifa plana hace que el tamaño del archivo deje de ser el motivo por el que el proyecto no arranca nunca.

03

Lo que no afirmamos

La redacción reduce el riesgo, no convierte automáticamente el dato en anónimo en sentido jurídico: eso es una valoración sobre el riesgo de reidentificación y le corresponde a tu delegado de protección de datos. Lo que da la infraestructura es un proceso que puedes documentar y auditar.

sectores

Dónde se usa.

Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.

todos_los_sectores →

En producción en

// faq

Anonimización, respondida.

Lo que preguntan los equipos de protección de datos y clínicos antes de que un modelo toque la versión en bruto.

¿Podemos mantener el dato útil después de redactarlo?

Para eso son los pseudónimos consistentes. Si cada mención de una persona apunta al mismo token, todavía puedes contar, agrupar y seguir un caso a lo largo de un expediente. El tachado indiscriminado destruye justo la estructura que necesitabas.

¿Y los documentos escaneados?

Un modelo multimodal lee la imagen de la página directamente, así que un escaneo no necesita una etapa de OCR aparte antes de procesarse. La escritura a mano es el caso difícil y conviene medirlo con tu propio material antes de comprometerse.

¿El modelo guarda copia de lo que vio?

No. Los prompts y las salidas no se almacenan ni se usan para entrenar. En el despliegue on-premise la pregunta no llega a plantearse, porque nada sale de tu red.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.