paso 01
Formula la pregunta con palabras
your criteria Escribe los criterios de aceptación como se los explicarías a un inspector nuevo. Ese prompt es la especificación, se puede versionar y cambiarlo no implica reentrenar nada.
casos de uso · Inspección visual
La foto de una soldadura, un parachoques abollado, una subestación, un estante. Describir qué hay en una imagen y juzgarla contra tus propios criterios exigía antes un modelo entrenado por defecto. Un modelo multimodal lo hace desde una instrucción escrita y eso cambia lo rápido que puedes empezar.
cómo funciona
Tres pasos, con el componente que hace el trabajo en cada uno.
paso 01
your criteria Escribe los criterios de aceptación como se los explicarías a un inspector nuevo. Ese prompt es la especificación, se puede versionar y cambiarlo no implica reentrenar nada.
paso 02
gemma-4-26b El modelo multimodal toma la imagen y devuelve un veredicto estructurado con la razón por la que lo dio. La razón importa más que el veredicto: un inspector que no ve el por qué no se fía de la herramienta una segunda vez.
paso 03
threshold + review queue Lo que pasa claramente sigue, lo dudoso va a una persona con la imagen y el razonamiento adjuntos. La idea es gastar la atención humana en el 5% difícil y no en todo.
drop-in
Apunta el SDK de OpenAI, o LangChain, LlamaIndex, el pipeline que ya tengas, a Helmcode. Mismas llamadas, mismas formas, modelos privados en infraestructura de la UE.
leer_los_docsfrom openai import OpenAI client = OpenAI( api_key="sk-...", base_url="https://api.helmcode.com/v1", # one line changes ) # the acceptance criteria are the prompt: no retraining verdict = client.chat.completions.create( model="gemma-4-26b", messages=[{ "role": "user", "content": [ {"type": "text", "text": criteria}, {"type": "image_url", "image_url": {"url": frame}}, ], }], response_format={"type": "json_object"}, )
por qué aquí
Lo que cambia al ejecutarlo sobre modelos abiertos en infraestructura que controlas.
Una foto de tu línea le muestra tu proceso, tu utillaje y tus defectos a quien la reciba. La foto de un siniestro muestra la casa de alguien. Este es el caso donde mandar el dato a una API externa es más difícil de justificar y por eso aquí lo normal es on-premise.
Una cámara a un fotograma por segundo son 86.400 imágenes al día. Cualquier precio por imagen te obliga a muestrear; la tarifa plana te deja mirarlas todas y quedarte con las que importan.
Un modelo multimodal general es excelente describiendo y comparando, y no es un instrumento de metrología. Para una tolerancia medida en micras quieres una cámara y un sistema de visión clásico, y lo diremos antes que venderte lo que no toca.
sectores
Los sectores donde este caso tiene tracción, cada uno con su página y su normativa.
// faq
Lo que preguntan los equipos de planta y de siniestros antes de que un modelo juzgue una imagen.
No para empezar. Una instrucción escrita te da un prototipo funcionando en una tarde, que es suficiente para saber si el caso merece el proyecto. Si después necesitas los últimos puntos de precisión en un defecto repetitivo, un modelo pequeño afinado en un plan dedicado u on-premise es el paso siguiente.
Sí y para redes OT eso suele ser el requisito antes que una preferencia. La misma API corre dentro de tu perímetro y los modelos abiertos más pequeños caben en una sola GPU junto al proceso en vez de necesitar un datacenter.
El enfoque práctico es muestrear fotogramas ante un evento, no enviar todo en streaming: el disparo viene de tu sistema actual y el modelo mira los fotogramas de alrededor. Eso mantiene el volumen razonable y las respuestas concretas.
// empezar
Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.
Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.
// cookies
Usamos cookies estrictamente necesarias para que el sitio funcione y, solo con consentimiento explícito, Google Analytics para entender el uso. Nada de publicidad, nunca — consulta la Política de cookies.
// preferencias