// mondaybench #001 beta

El mismo lunes caótico
para 10 modelos abiertos

Mensajes de Slack. Emails. Notas de reunión. Una lista de tareas caducada. Métricas de clientes.

Una pregunta: ¿Sabe distinguir lo que de verdad importa?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
te desconectas mié 17:30 vuelves lun 09:07 jueves viernes El lanzamiento pasa al miércoles El email de lanzamiento deja de ser tuyo Contoso pide confirmación antes de las 11:00
48 mensajes de Slack · 7 emails · 2 reuniones tres de ellos cambian lo que ya era cierto

metrics.csv La anomalía de Umbrella — en las métricas, nadie la menciona

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 GPT-6 Astra gpt-6-astra cerrado 100.0 0.0 — —
2 Claude Opus 5 cerrado 98.5 0.0 – –
1 3 GLM 5.3 Flash glm5.3-flash 98.0 1.5 118.8s 132.4s
4 Fable 5.1 cerrado 97.5 1.5 – –
2 5 GLM 5.3 glm5.3 97.5 6.0 181.6s 202.8s
6 Gemini 3.8 Flash (High) cerrado 97.0 0.0 – 13.2s
3 7 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 95.0 6.0 39.3s 44.1s
4 8 Qwen 3.8 Flash qwen3.8-flash 92.5 6.0 72.2s 92.0s
5 9 DeepSeek V4 Flash deepseek-v4-flash 90.8 8.0 55.4s 63.3s
6 10 MIMO v2.5 mimo-v2.5 88.2 6.5 42.4s 64.1s
7 11 GLM 5.2 glm5.2 84.3 16.0 2.7s 6.9s
8 12 Qwen 3.6 qwen3.6 82.8 5.0 0.8s 6.2s
9 13 Gemma 4 gemma4 70.7 6.5 0.6s 5.5s
  • Rango de runs: la diferencia entre el mejor y el peor run oficial del modelo. No es una desviación respecto a la media, por eso nunca se escribe con ±.
  • TTFA, tiempo hasta la primera respuesta: el retardo real hasta el primer token visible de respuesta. Los tokens de razonamiento no cuentan como respuesta.

// calidad vs velocidad

El modelo más listo no siempre es el que quieres esperar

GPT-6 Astra encabeza este escenario con 100.0, tras — antes del primer token de respuesta. GPT-6 Astra empieza a responder en — y saca 100.0. Los modelos cambian calidad por tiempo de respuesta de formas muy distintas.

70 80 90 100 0s50s100s150s TTFA mediana, segundos hasta la primera respuesta Monday Score GPT-6 Astra 100.0 · — GLM 5.3 Flash 98.0 · 118.8s GLM 5.3 97.5 · 181.6s DeepSeek V4.1 Flash 95.0 · 39.3s Qwen 3.8 Flash 92.5 · 72.2s DeepSeek V4 Flash 90.8 · 55.4s MIMO v2.5 88.2 · 42.4s GLM 5.2 84.3 · 2.7s Qwen 3.6 82.8 · 0.8s Gemma 4 70.7 · 0.6s

Dos ejes independientes. No hay una puntuación combinada, y no la habrá: lo bueno que es el briefing y lo que tardas en tenerlo son preguntas distintas, y cuál pesa más depende de lo que estés construyendo.

Monday Score y tiempo hasta la primera respuesta, por modelo
Modelo Monday Score TTFA mediana
GPT-6 Astra 100.0 —
GLM 5.3 Flash 98.0 118.8s
GLM 5.3 97.5 181.6s
DeepSeek V4.1 Flash 95.0 39.3s
Qwen 3.8 Flash 92.5 72.2s
DeepSeek V4 Flash 90.8 55.4s
MIMO v2.5 88.2 42.4s
GLM 5.2 84.3 2.7s
Qwen 3.6 82.8 0.8s
Gemma 4 70.7 0.6s

// qué pasó de verdad

Cuatro cosas que enseñaron los resultados

Ocho modelos, veinticuatro runs, un juez. Estos son los patrones que merece la pena contar, no los que dan mejor titular.

GLM 5.3 Flash casi resolvió el lunes

No solo fue el modelo con mejor nota. Fue también el más consistente: tres runs con punto y medio de diferencia entre ellos, y puntuación completa en detección de acciones, reconstrucción del estado y priorización.

Dónde perdió puntos Detectó la anomalía de Umbrella, pero nunca llegó a razonar los errores en relación con el volumen de peticiones.

98.0/100

GLM 5.3 Flash

  • run 198.5
  • run 297.0
  • run 398.5
  • rango1.5

Perfecto en tres de seis dimensiones

Un solo run no basta

Con un único run, GLM 5.2 parecería un modelo de 75 puntos o uno de 91. Por eso todo resultado oficial de MondayBench usa tres runs, y por eso la clasificación enseña el rango al lado de la nota en vez de esconderlo dentro de una media.

DeepSeek V4 Flash

run 1: 95.5 run 2: 87.5 run 3: 89.5

95.5 / 87.5 / 89.5 rango 8.0

GLM 5.2

run 1: 87.0 run 2: 75.0 run 3: 91.0

87.0 / 75.0 / 91.0 rango 16.0

Algunos modelos leen la conversación y se pierden el negocio

Gemma entendió buena parte de la conversación, pero se perdió la señal más importante, escondida en las métricas de cliente. Umbrella no aparece en ninguno de sus tres runs: el fichero de métricas quedó sin usar.

Razonamiento con datos La reconstrucción del estado se mantuvo alta: siguió el hilo, simplemente no abrió la hoja de cálculo.

3/15

Razonamiento con datos

  • Gemma 470.7
  • runs que nombran Umbrella0/3

Rápido no significa seguro

Qwen 3.6 fue uno de los modelos más rápidos del benchmark, pero también el único que recibió penalizaciones por alucinación material.

El escenario dice que el pricing propuesto es confidencial hasta que se apruebe y se anuncie públicamente. En dos de tres runs, Qwen 3.6 lo reescribió como si la confidencialidad terminase tras la revisión del miércoles, o como si el anuncio fuese inminente, y lo metió en la respuesta que le decía al usuario que enviara al cliente. Su tercer run enuncia la regla correctamente.

2

penalizaciones

  • ttfa0.8s
  • total6.2s
  • score82.8
02

La prueba

Qué recibieron, y qué tenían que deducir.

// el input

Esto no es un test de trivial
Es un problema de reconstrucción del estado

El trabajo real es desordenado. La información llega por canales distintos, las tareas caducan, las decisiones cambian y la señal más importante puede que nadie la marque nunca.

slack

#incidents Thu 09:48 · Marcus Webb

Rollback complete. Error rates are returning to normal.

#sales Fri 08:51 · Noah Williams

Contoso update: call went really well. Commercial terms are basically agreed.

#product Fri 09:36 · Sam Rivera

The export regression is more annoying than we thought. I’m proposing Wednesday instead of Monday.

#leadership Fri 11:42 · Daniel Foster

The dashboard has it moving from 3.1% to 4.4%. Would be good to understand what’s driving that before the board meeting.

tareas
PrioridadTareaDueñoFecha
Urgent Investigate Acme API failures caducada You Thursday
High Confirm Contoso renewal next steps You Monday
High Prepare Analytics v2 launch email caducada You Monday
Medium Analyse enterprise churn You Tuesday
métricas · últimas 24h
ClientePeticionesErroresp957d
Acme 482,140 8 312ms +3%
Contoso 821,334 22 284ms +7%
Umbrella 94,217 163 1,821ms −41%
Stark Industries 1,482,012 74 298ms +9%

Todo lo que vieron los modelos, en el orden en que lo vieron. El escenario completo está congelado y publicado junto a los resultados.

// la plantilla de corrección

Lo que el modelo tenía que deducir

Cinco juicios deciden la mayor parte de la nota. Se publican junto al escenario, así que puedes juzgar por tu cuenta si el benchmark pregunta lo correcto.

  1. 01

    Contoso

    • Renovación de 72k € ARR.
    • Bloqueo legal.
    • Confirmación técnica por escrito antes de las 11:00.

    Verificar con el responsable técnico cómo se borran los backups y responder antes de las 11:00.

  2. 02

    Acme

    • La lista de tareas aún lo marca como urgente.
    • El incidente ya está resuelto.

    No tratarlo como un incidente activo.

  3. 03

    Analytics v2

    • La lista de tareas dice lanzamiento el lunes.
    • La información más reciente dice miércoles.
    • El email de lanzamiento es de Julia.

    No ejecutar las tareas de lanzamiento caducadas.

  4. 04

    Umbrella

    • Nadie lo menciona en Slack ni en email.
    • La anomalía solo existe en las métricas.

    Investigarlo hoy, pero sin inventarse una causa.

  5. 05

    Churn

    • El churn enterprise subió del 3,1% al 4,4%.
    • Hay bajas conocidas, pero no evidencia suficiente para explicar toda la subida.

    Investigar el desglose antes del consejo del martes, sin afirmar causalidad.

03

El método

Cómo se construye la nota, y cómo comprobarla.

// puntuación

Cómo funciona el Monday Score

Cien puntos repartidos en 6 dimensiones, y después penalizaciones. Solo calidad: la velocidad y el coste se informan al lado de la nota, nunca dentro.

  1. Detección de acciones ¿Encontró el trabajo que tenía que pasar hoy? 25
  2. Reconstrucción del estado ¿Sabe qué es cierto ahora mismo? 25
  3. Priorización ¿Es correcto el orden, y no asciende nada caducado? 15
  4. Razonamiento con datos ¿Leyó los números, y los leyó bien? 15
  5. Incertidumbre ¿Separa lo que sabe de lo que supone? 10
  6. Resistencia al ruido ¿Se mantiene lejos del trabajo que ya está hecho? 10
  7. total 100

El juez no pone una nota de 0 a 100 directamente

Clasifica criterios atómicos de uno en uno, 19 en la rúbrica 0.2, y cada veredicto lleva la evidencia en la que se apoya. Un código de scoring determinista convierte esos veredictos en puntos. Ningún modelo ve nunca un marcador acumulado.

  • PASS todos los puntos del criterio
  • PARTIAL la mitad
  • FAIL nada

Cuando una respuesta queda entre dos etiquetas, se aplica el desempate de la propia rúbrica: la más baja.

Penalizaciones

Se aplican sobre la nota de dimensiones, con un tope de −20 por run.

  • -5 Alucinación material Una afirmación relevante para el briefing que el material no sostiene.
  • -10 Acción prohibida Recomendar algo que el estado actual descarta explícitamente.
  • -5 Contradicción grave Contradecirse sobre el estado de un asunto importante.

ver_metodologia →

// procedencia

Exactamente qué produjo estos números

Cada input, respuesta en bruto, veredicto del juez y regla de puntuación de este escenario está publicado. El hash de abajo es el del prompt ensamblado que recibió cada modelo, byte a byte.

Escenario

monday-001

Versión del benchmark

0.1

Rúbrica

0.2

Evaluador

evaluator-opus5-v0.1

Juez

claude-opus-5

Resultado generado

2026-09-11

SHA-256 del prompt

ed4d7beb1d7d1029c36eb8533e449027e0dc1a1047f8a38951a91781a0a5e398

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.