GLM 5.2 orquesta, DeepSeek V4 Flash ejecuta
Cómo diseñar sistemas multi-modelo donde un LLM abierto planifica, otro ejecuta y el contexto que se pasan entre ellos es eficiente.
3 entradas
Cómo diseñar sistemas multi-modelo donde un LLM abierto planifica, otro ejecuta y el contexto que se pasan entre ellos es eficiente.
FP8, NVFP4, H200, B200: qué acelera en hardware cada generación de NVIDIA, cuánta VRAM necesita tu modelo y qué GPU comprar. Con datos de producción reales.
Before we start, a bit of context. The infrastructure is hosted on AWS and the architecture was based on Serverless services:
// cookies
Solo usamos cookies estrictamente necesarias para que el sitio funcione. Nada de analítica ni publicidad, nunca — consulta la Política de cookies.
// preferencias