casos de uso · Inspección visual

Pregúntale a un modelo qué ve

La foto de una soldadura, un parachoques abollado, una subestación, un estante. Describir qué hay en una imagen y juzgarla contra tus propios criterios exigía antes un modelo entrenado por defecto. Un modelo multimodal lo hace desde una instrucción escrita y eso cambia lo rápido que puedes empezar.

cómo funciona

Cómo se monta.

Tres pasos, con el componente que hace el trabajo en cada uno.

paso 01

Formula la pregunta con palabras

your criteria

Escribe los criterios de aceptación como se los explicarías a un inspector nuevo. Ese prompt es la especificación, se puede versionar y cambiarlo no implica reentrenar nada.

paso 02

Mirar y juzgar

gemma-4-26b

El modelo multimodal toma la imagen y devuelve un veredicto estructurado con la razón por la que lo dio. La razón importa más que el veredicto: un inspector que no ve el por qué no se fía de la herramienta una segunda vez.

paso 03

Escala la excepción

threshold + review queue

Lo que pasa claramente sigue, lo dudoso va a una persona con la imagen y el razonamiento adjuntos. La idea es gastar la atención humana en el 5% difícil y no en todo.

drop-in

Cambia una línea. El código se queda.

Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.

leer_los_docs
inspect.py
from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.helmcode.com/v1",  # one line changes
)

# the acceptance criteria are the prompt: no retraining
verdict = client.chat.completions.create(
    model="gemma-4-26b",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": criteria},
            {"type": "image_url",
             "image_url": {"url": frame}},
        ],
    }],
    response_format={"type": "json_object"},
)

por qué aquí

Por qué en Helmcode.

Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.

01

Las imágenes son el dato más revelador que tienes

Una foto de tu línea le muestra tu proceso, tu utillaje y tus defectos a quien la reciba. La foto de un siniestro muestra la casa de alguien. Este es el caso donde mandar el dato a una API externa es más difícil de justificar y por eso aquí lo normal es on-premise.

02

Los fotogramas suman rápido

Una cámara a un fotograma por segundo son 86.400 imágenes al día. Cualquier precio por imagen te obliga a muestrear; la tarifa plana te deja mirarlas todas y quedarte con las que importan.

03

Dónde se detiene

Un modelo multimodal general es excelente describiendo y comparando, y no es un instrumento de metrología. Para una tolerancia medida en micras quieres una cámara y un sistema de visión clásico, y lo diremos antes que venderte lo que no toca.

sectores

Dónde se usa.

Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.

todos_los_sectores →

En producción en

// faq

Inspección visual, respondida.

Lo que preguntan los equipos de planta y de siniestros antes de que un modelo juzgue una imagen.

¿Hace falta entrenar un modelo por defecto?

No para empezar. Una instrucción escrita te da un prototipo funcionando en una tarde, que es suficiente para saber si el caso merece el proyecto. Si después necesitas los últimos puntos de precisión en un defecto repetitivo, un modelo pequeño afinado en un plan dedicado u on-premise es el paso siguiente.

¿Puede correr en el borde, junto a la línea?

Sí y para redes OT eso suele ser el requisito antes que una preferencia. La misma API corre dentro de tu perímetro y los modelos abiertos más pequeños caben en una sola GPU junto al proceso en vez de necesitar un datacenter.

¿Y vídeo en vez de fotos?

El enfoque práctico es muestrear fotogramas ante un evento, no enviar todo en streaming: el disparo viene de tu sistema actual y el modelo mira los fotogramas de alrededor. Eso mantiene el volumen razonable y las respuestas concretas.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.