Elegir GPUs para inferencia de modelos no es cuestión de comprar la más cara. Es cuestión de comprar la que entiende el formato en el que tu modelo vive.
Cada generación de GPU añade soporte hardware para formatos de números más pequeños (FP8, NVFP4, FP6), y cada nuevo formato significa una de tres cosas: modelos más grandes en la misma VRAM, más throughput, o menos GPUs para servir la misma carga.
Pero no todas las GPUs soportan todos los formatos. Y si tu modelo usa un formato que la GPU no acelera en hardware, pagas la penalización de la ruta emulada en software, que suele ser entre 2x y 10x más lenta.
En este post recorremos las familias de GPU de NVIDIA que importan hoy (julio de 2026), los formatos de precisión que cada una acelera en silicio, y cómo traducir eso a decisiones de compra: qué GPU necesitas para servir desde un MoE compacto como Qwen3.6-35B-A3B hasta uno masivo como GLM-5.2.
1. El mapa de arquitecturas
NVIDIA: la línea sucesoria
NVIDIA ha lanzado seis arquitecturas de datacenter en seis años. Cada una introduce Tensor Cores de nueva generación que entienden formatos de precisión más pequeños.
Un detalle que la gente suele confundir mucho: la RTX PRO 6000 es Blackwell, no Ada. Comparte los Tensor Cores de 5ª generación de la B200 (NVFP4, FP6, FP8 en hardware), con 96 GB de GDDR7. No la confundas con la vieja "RTX 6000 Ada Generation" (48 GB, sin FP4). Esa diferencia es exactamente por lo que corremos NVFP4 en producción, como contamos en el post anterior .
2. Formatos de precisión: qué acelera cada GPU en hardware
No todos los formatos de números se ejecutan igual en todas las GPUs. Que un modelo esté cuantizado a NVFP4 no significa que corra a máxima velocidad en una H200, porque Hopper no tiene Tensor Cores de 4 bits: los emula sobre FP8/FP16 y pierdes toda la ventaja de throughput y memoria.
Una aclaración importante, porque es un error común: INT8 sí es nativo en los Tensor Cores desde Ampere (A100). No se emula. Lo que cambió con las últimas generaciones no es INT8, sino el 4 bits: INT4 tuvo su pico en Ampere, Hopper lo dejó de lado, y Blackwell lo sustituyó directamente por NVFP4 (que a igual tamaño conserva mucha más precisión numérica gracias al escalado por bloques).
La tabla que importa
Implicaciones prácticas
- Hopper (H100/H200) es la reina del FP8. Si tu modelo está en FP8, y hoy la mayoría de modelos open-source tienen checkpoints FP8 oficiales, Hopper lo sirve a máxima velocidad con su Transformer Engine. Lo que Hopper no entiende es el 4 bits en punto flotante.
- Blackwell desbloquea FP4 y FP6 en hardware. Ese NVFP4 que NVIDIA introdujo en Blackwell no es una cuantización más: son Tensor Cores de 5ª generación que operan nativamente en 4 bits. El checkpoint NVFP4 de Qwen3.6-35B-A3B que usamos en producción ocupa la mitad de VRAM que FP8 y, como contamos en el post anterior , rinde +11% de throughput y 12 puntos menos de ocupación de KV cache en la misma RTX PRO 6000.
- Hopper no entiende FP4 ni FP6. Si cargas un checkpoint NVFP4 en una H200, la GPU lo ejecuta con kernels de software sobre FP8 o FP16, perdiendo toda la ventaja de throughput. El modelo funciona, pero no ganas nada.
3. ¿Qué modelo cabe en cada GPU?
Este es el ejercicio que toda empresa debería hacer antes de comprar. Cojamos los tres modelos que servimos en producción y veamos qué GPU los sirve.
VRAM necesaria por modelo y precisión
| Modelo | Parámetros | FP16 | FP8 | NVFP4 |
|---|---|---|---|---|
| Qwen3.6-35B-A3B (MoE) | 35B total / 3B activos | 70 GB ✅ | 35 GB ✅ | 18 GB ✅ |
| DeepSeek-V4-flash (MoE) | 284B total / 13B activos | 568 GB | 284 GB | 142 GB |
| GLM-5.2 (MoE) | 753B total / 40B activos | 1,5 TB | 753 GB | 377 GB |
✅ = Cabe en una sola GPU actual (considerando overhead de KV cache y serving). La regla de bolsillo: FP16 ≈ 2 bytes/parámetro, FP8 ≈ 1 byte, NVFP4 ≈ 0,5 bytes. Después súmale el KV cache, que crece con el contexto y el batch.
Esto es lo que significa en decisiones de compra
- Qwen3.6-35B-A3B es diminuto en VRAM. En NVFP4 ocupa ~18 GB: cabe en cualquier GPU actual, incluso en una RTX PRO 6000 (96 GB) con muchísimo margen para KV cache y concurrencia. Es justo el modelo que servimos en esa tarjeta.
- DeepSeek-V4-flash (284B totales, 13B activos) cambia de categoría según el formato. En NVFP4 ~142 GB entra en una sola B200 (192 GB) o B300 (288 GB) con holgura; en FP8 ~284 GB necesitas una B300 o dos B200. Aunque solo 13B se activan por token, hay que cargar los 284B en memoria porque cualquier experto puede ser invocado.
- GLM-5.2 (753B totales, 40B activos) es el caso extremo. En FP8 ~753 GB necesitas 4 B200 o 3 B300. En NVFP4 ~377 GB bajas a 2 B200 o 2 B300. Por eso la eficiencia de formato es crítica en los MoE grandes: no reduce el cómputo por token, pero sí el número de GPUs que necesitas solo para tener el modelo cargado.
4. Throughput: tokens por segundo
Tener el modelo que cabe no es suficiente. Hay que servir peticiones a una velocidad útil. Aquí es donde el ancho de banda de memoria (HBM) y los Tensor Cores marcan la diferencia.
Throughput de inferencia (referencia ~70B, FP8, agregado con batching)
El caso real: Qwen3.6 NVFP4 en producción
Validamos estas cifras con datos de producción reales. Migrar nuestro checkpoint de Qwen3.6-35B-A3B de FP8 a NVFP4 en una RTX PRO 6000 (96 GB, Blackwell sm_120) nos dio:
| Métrica | FP8-Triton | NVFP4 (estable) | Delta |
|---|---|---|---|
| Throughput total | 12.820 tok/s | 14.273 tok/s | +11,3% |
| TPOT | 602 ms | 530 ms | -12% |
| E2EL | 202 s | 188 s | -7% |
| KV cache pico | 55% | 43% | 12 pts menos |
El detalle completo de la migración, incluido el bug de cuDNN que encontramos por el camino (un kernel que elegía tilings de datacenter sm_100 y escribía fuera de límites en la memoria compartida de 99 KB de sm_120), está en el post anterior . El resumen: el mismo hardware, más throughput, solo por cambiar el formato del checkpoint.
5. ¿Qué alquilar/comprar según tu caso de uso?
No existe la mejor GPU. Existe la GPU adecuada para tu carga de trabajo.
🧪 Investigación y experimentación
Si estás haciendo fine-tuning, R&D, o pruebas de concepto:
- H100. Suficiente para casi todo y la opción natural para uso intermitente.
- RTX PRO 6000 (Blackwell, estación de trabajo). Capacidad local sin depender del cloud, con NVFP4 nativo y 96 GB.
🚀 Producción a escala (modelos compactos)
Sirviendo un MoE compacto como Qwen3.6-35B-A3B:
- H200: 141 GB de VRAM te dan margen para KV cache larga (contextos de 256K) sin sudar. Sigue siendo el caballo de batalla del FP8.
- B200 en NVFP4: si tu modelo tiene checkpoint NVFP4, la B200 te da el máximo throughput por GPU.
- RTX PRO 6000: NVFP4 nativo con 96 GB; suficiente para servir modelos de este tamaño en local.
🐘 Modelos masivos (DeepSeek-V4-flash, GLM-5.2)
- Cluster de B200 (2-4 GPUs): con NVFP4, DeepSeek-V4-flash entra en 1-2 tarjetas y GLM-5.2 en 2. Sin NVFP4 necesitas el doble.
- B300 (Blackwell Ultra): 288 GB por GPU, así que necesitas menos GPUs para el mismo modelo gracias a su VRAM.
- Cluster de H200: alternativa sólida si el modelo está en FP8.
⚡ Latencia ultrabaja (agentes de código, chat en tiempo real)
Para coding agents que mandan muchas peticiones pequeñas y necesitan respuesta rápida:
- B200 / B300: el menor TPOT (tiempo por token de salida) gracias al ancho de banda de 8 TB/s hace que cada token llegue antes.
- H200: también excelente si el modelo es FP8.
- Evita A100 para baja latencia: su ancho de banda (~2 TB/s) es un cuello de botella evidente en la fase de decode.
🖥️ Carga de trabajo mixta (IA + gráficos + virtualización)
- L40S / RTX 6000 Ada: combinan Tensor Cores con RT Cores (ray tracing) y salida de vídeo. Para estaciones de trabajo de ingeniería, diseño, o virtualización (vGPU), siguen siendo la opción natural. Si además quieres FP4 nativo en el escritorio, la RTX PRO 6000 (Blackwell) es la evolución.
6. Lo que viene
Blackwell Ultra (B300 / GB300), ya disponible
- 288 GB HBM3e por GPU (8 TB/s), gracias a stacks de 12 alturas
- 15 PFLOPS FP4 densos por GPU
- GB300 NVL72: 1,1 ExaFLOPS FP4 por rack (1,5x GB200 NVL72)
- TDP de 1.400 W (refrigeración líquida obligatoria)
En la práctica: un modelo de ~200B parámetros en NVFP4 cabe en una sola GPU, y para uno masivo en FP8, con 2-3 B300 tienes espacio de sobra incluso para KV cache larga.
Vera Rubin (R100), producción en H2 2026
- TSMC 3 nm, 336B transistores (dos dies)
- HBM4: 288 GB por GPU, 22 TB/s de ancho de banda (2,8x sobre Blackwell)
- 50 PFLOPS FP4 de inferencia por chip
- Rubin NVL144: la nueva referencia de rack, ~3,3x el rendimiento de GB300 NVL72
NVIDIA entró en producción en junio de 2026, con disponibilidad en cloud (AWS, GCP, Azure, Oracle) a lo largo de la segunda mitad del año.
7. Conclusión: cómo tomar la decisión
Para cualquier empresa que esté evaluando GPUs hoy, este es el proceso recomendado:
- Elige tu modelo objetivo. No "una GPU", sino "voy a servir GLM-5.2 a 200 req/s".
- Elige la precisión de inferencia. FP8 es el estándar hoy; NVFP4 es la ventaja competitiva si tu hardware lo soporta.
- Calcula la VRAM necesaria. Peso del modelo + KV cache (contexto × batch) + overhead de serving.
- Elige la GPU que tenga Tensor Cores nativos para esa precisión. No es lo mismo NVFP4 en Blackwell que NVFP4 emulado en Hopper.
- Compara throughput real (tokens/s) y VRAM efectiva, no specs de catálogo.
- Añade un 20%-40% de margen para picos de tráfico y crecimiento.
La GPU correcta te permite servir más modelo con menos hardware. La incorrecta te ata a un formato, una plataforma, o una capacidad de VRAM que limita lo que puedes servir. La diferencia está en entender qué acelera cada generación en silicio y qué no.
En Helmcode hemos procesado más de 574.000 millones de tokens, con picos de ~14.000 millones de tokens al día. Los tres modelos de este post (Qwen3.6-35B-A3B, DeepSeek-V4-flash y GLM-5.2) son justo los que más servimos; los números en abierto están en nuestra página de datos públicos . Hemos pasado por A100, H100, Ada, y ahora Blackwell, y cada salto generacional nos ha dado más capacidad sin cambiar el número de servidores. Porque la optimización no es solo el software: es saber qué hardware entiende tu modelo.
¿Necesitas GPUs para tus cargas de trabajo? Háblanos y te indicamos nuestra disponibilidad de GPUs Blackwell dedicadas que te podemos alquilar y/o te servimos directamente desde nuestra API de inferencia.