20 · la idea central

Mismo modelo, distinto agente

Cambia el harness y cambia el agente, aunque el modelo sea exactamente el mismo.

Es la observación que sostiene toda esta web y se puede comprobar sin salir de casa. Coge un modelo, ponlo detrás de dos productos distintos y pídele lo mismo. Los resultados no se parecen.

No es que uno razone mejor. El razonamiento lo pone el modelo y es el mismo. Lo que cambia es todo lo demás: qué herramientas tiene delante, qué recuerda de lo que ya hizo, cuándo se le pregunta a un humano, qué pasa cuando un comando falla, cuánto contexto le cabe antes de que alguien decida qué se tira.

Esas decisiones no las toma el modelo. Las toma el harness y son decisiones de ingeniería que alguien escribió en algún sitio.

Modelo y harness

Modelo produce texto Decide qué hacer ahora Herramienta cuál puede usar Permiso si le dejan Efecto toca el mundo Resultado qué ha salido Contexto queda escrito y el modelo vuelve a decidir, ahora sabiendo lo que pasó modelo harness
El modelo solo hace la primera casilla. Las otras cinco, y el hecho de que la cadena vuelva a empezar, las pone el harness.

Las cuatro decisiones que más se notan

  • Uno Qué herramientas ve Un modelo con una herramienta de edición dedicada no trabaja igual que uno al que se le pide que edite con comandos de terminal. El segundo puede hacerlo, pero comete más errores y deja menos rastro de qué cambió.
  • Dos Qué recuerda Cuando la conversación se pasa de largo hay que tirar algo. Qué se tira, qué se resume y qué se conserva entero determina si el agente se acuerda de la instrucción que le diste al principio.
  • Tres Cuándo se detiene Preguntar antes de borrar un fichero o no preguntar. Ejecutar dentro de un espacio confinado o en tu máquina entera. Son políticas y cada producto elige las suyas.
  • Cuatro Qué hace cuando algo falla Reintentar, cambiar de estrategia, avisar. Un agente que insiste en el mismo comando roto diez veces y uno que prueba otra cosa a la segunda pueden llevar el mismo modelo dentro.

Por qué esto ha tardado en verse

Durante dos años la conversación pública ha ido casi entera sobre modelos. Qué puntúa más, qué cuesta menos, qué aguanta más contexto. Son cifras que se pueden comparar en una tabla y eso las hace cómodas.

La capa de encima no tenía nombre común, no tenía cifras y casi nunca era pública. Se notaba en el uso diario y no se podía señalar.

Que DeepSeek publique la suya con licencia MIT cambia esa parte de la conversación, porque por primera vez hay una pieza completa de esa capa que cualquiera puede leer entera.

Lo que esto no significa

El modelo sigue poniendo el techo. Un harness excelente sobre un modelo que no sabe programar no produce un agente que programe. La capacidad de razonar no se compensa con ingeniería.

Lo que sí hace un buen harness es acercar el resultado a ese techo en vez de dejarlo a medio camino. Y lo que hace uno malo es desperdiciar un modelo bueno.