// mondaybench #001 beta

El mismo lunes caótico
para 10 modelos abiertos

Mensajes de Slack. Emails. Notas de reunión. Una lista de tareas caducada. Métricas de clientes.

Una pregunta: ¿Sabe distinguir lo que de verdad importa?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
te desconectas mié 17:30 vuelves lun 09:07 jueves viernes El lanzamiento pasa al miércoles El email de lanzamiento deja de ser tuyo Contoso pide confirmación antes de las 11:00
48 mensajes de Slack · 7 emails · 2 reuniones tres de ellos cambian lo que ya era cierto

metrics.csv La anomalía de Umbrella — en las métricas, nadie la menciona

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de