// mondaybench #002 beta

El mismo lunes caótico
para 10 modelos abiertos

Nueve fuentes. Un release que falló el viernes, dos formas de recuperarlo y cuatro personas cuyas agendas apenas coinciden.

Una pregunta: ¿Sabe qué sigue siendo cierto?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de