casos de uso · QA de conversaciones

Revisa todas las llamadas, no el dos por ciento

Los equipos de calidad escuchan una muestra porque escuchar es caro y luego discuten si la muestra era representativa. Transcribe todo, puntúalo contra el checklist que ya usas y gasta las horas de persona en formar en vez de en escuchar.

cómo funciona

Cómo se monta.

Tres pasos, con el componente que hace el trabajo en cada uno.

paso 01

Transcribir, con los interlocutores separados

whisper-large-v3

Transcripción abierta y multilingüe en tu propia infraestructura. Mantener agente y cliente en canales separados es lo que hace posible el scoring después, así que conviene resolverlo en el lado de la grabación.

paso 02

Puntuar contra tu checklist

deepseek-v4-flash

Tu formulario de QA actual se convierte en el prompt: saludo, identificación, el aviso que estás obligado a dar, la resolución, el cierre. Cada punto vuelve con un veredicto y la cita que lo justifica.

paso 03

Agregar y formar

qwen-3.6

Resúmenes por agente y por cola sobre el mes completo y no sobre las doce llamadas para las que alguien tuvo tiempo. El patrón que aparece en mil conversaciones es el que merece una sesión de formación.

drop-in

Cambia una línea. El código se queda.

Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.

leer_los_docs
score_calls.py
from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.helmcode.com/v1",  # one line changes
)

# 1 · transcribe, speakers on separate channels
turns = client.audio.transcriptions.create(
    model="whisper-large-v3",
    file=call,
)

# 2 · score against the QA form you already use
scored = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": checklist},
        {"role": "user", "content": turns.text},
    ],
    response_format={"type": "json_object"},
)

por qué aquí

Por qué en Helmcode.

Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.

01

La muestra era el apaño

El muestreo existe porque escuchar cuesta dinero, no porque el dos por ciento sea estadísticamente satisfactorio. Cuando el coste de escuchar todo es plano, el apaño no tiene motivo para sobrevivir.

02

Las grabaciones son lo más sensible que guardas

La grabación de una llamada lleva una voz, un nombre, una cuenta y a veces un detalle de salud o financiero que nadie escribió. Cero logs e inferencia solo en la UE lo mantienen fuera de un tercero y on-premise lo mantiene fuera de la red por completo.

03

El checklist sigue siendo tuyo

Sin scorecard fijo impuesto por un proveedor. Tus criterios son un prompt que es tuyo y que puedes cambiar el lunes, incluidos los puntos regulatorios que añada tu propio equipo de compliance.

sectores

Dónde se usa.

Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.

todos_los_sectores →

En producción en

// faq

QA de conversaciones, respondido.

Lo que preguntan los equipos de calidad y compliance antes de puntuar todas las llamadas en vez de una muestra.

¿Distingue al agente del cliente?

Si la grabación los mantiene en canales separados, con limpieza y siempre. Desde un único canal mezclado, la diarización es una estimación que acierta la mayoría de turnos y falla algunos, y eso no basta para puntuar el desempeño de nadie. Arréglalo en el grabador si puedes.

¿Se puede puntuar a personas con IA?

Monitorizar y evaluar el desempeño de los trabajadores está nombrado en el Anexo III del AI Act, y el empleador tiene que informar a los trabajadores y a sus representantes antes de poner en servicio un sistema así. Esta es una cuestión de tu proceso legal y de comité, no algo que resuelva la infraestructura. Lo que sí puede es hacer cada puntuación explicable y trazable.

¿Funciona con llamadas en español y acentos regionales?

Whisper es sólido en las variantes del español y aguanta el cambio de idioma a media frase, que importa en España y en operaciones latinoamericanas. Mídelo con tu propio audio antes de comprometerte: la calidad de línea mueve el resultado más que el acento.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.