// mondaybench #002 beta

El mismo lunes caótico
para 10 modelos abiertos

Nueve fuentes. Un release que falló el viernes, dos formas de recuperarlo y cuatro personas cuyas agendas apenas coinciden.

Una pregunta: ¿Sabe qué sigue siendo cierto?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 GPT-6 Astra gpt-6-astra cerrado 100.0 0.0 — —
2 Claude Opus 5 cerrado 98.0 3.0 – –
1 3 Qwen 3.8 Flash qwen3.8-flash 94.8 8.5 258.9s 285.0s
2 4 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 93.0 10.5 61.2s 67.8s
3 5 GLM 5.2 glm5.2 91.2 8.0 67.0s 85.4s
6 Fable 5.1 cerrado 91.0 6.0 – –
4 7 DeepSeek V4 Flash deepseek-v4-flash 89.3 13.5 162.6s 178.8s
5 8 GLM 5.3 glm5.3 87.7 4.0 176.2s 197.1s
6 9 GLM 5.3 Flash glm5.3-flash 87.3 6.5 238.5s 316.6s
7 10 MIMO v2.5 mimo-v2.5 81.2 33.0 163.3s 195.4s
11 Gemini 3.8 Flash (High) cerrado 81.0 0.0 – 38.8s
8 12 Qwen 3.6 qwen3.6 70.2 31.0 0.9s 18.2s
9 13 Gemma 4 gemma4 54.2 13.5 0.3s 8.7s
  • Rango de runs: la diferencia entre el mejor y el peor run oficial del modelo. No es una desviación respecto a la media, por eso nunca se escribe con ±.
  • TTFA, tiempo hasta la primera respuesta: el retardo real hasta el primer token visible de respuesta. Los tokens de razonamiento no cuentan como respuesta.

// calidad vs velocidad

El modelo más listo no siempre es el que quieres esperar

GPT-6 Astra encabeza este escenario con 100.0, tras — antes del primer token de respuesta. GPT-6 Astra empieza a responder en — y saca 100.0. Los modelos cambian calidad por tiempo de respuesta de formas muy distintas.

50 60 70 80 90 100 0s100s200s TTFA mediana, segundos hasta la primera respuesta Monday Score GPT-6 Astra 100.0 · — Qwen 3.8 Flash 94.8 · 258.9s DeepSeek V4.1 Flash 93.0 · 61.2s GLM 5.2 91.2 · 67.0s DeepSeek V4 Flash 89.3 · 162.6s GLM 5.3 87.7 · 176.2s GLM 5.3 Flash 87.3 · 238.5s MIMO v2.5 81.2 · 163.3s Qwen 3.6 70.2 · 0.9s Gemma 4 54.2 · 0.3s

Dos ejes independientes. No hay una puntuación combinada, y no la habrá: lo bueno que es el briefing y lo que tardas en tenerlo son preguntas distintas, y cuál pesa más depende de lo que estés construyendo.

Monday Score y tiempo hasta la primera respuesta, por modelo
Modelo Monday Score TTFA mediana
GPT-6 Astra 100.0 —
Qwen 3.8 Flash 94.8 258.9s
DeepSeek V4.1 Flash 93.0 61.2s
GLM 5.2 91.2 67.0s
DeepSeek V4 Flash 89.3 162.6s
GLM 5.3 87.7 176.2s
GLM 5.3 Flash 87.3 238.5s
MIMO v2.5 81.2 163.3s
Qwen 3.6 70.2 0.9s
Gemma 4 54.2 0.3s

// lo que destacó

Cuatro cosas que merece la pena decir en voz alta

Cada cifra de abajo se puede comprobar contra el leaderboard, la matriz de criterios o los veredictos publicados en esta misma página.

  1. 01

    4 / 24

    runs eligieron el camino más seguro

    Opción B

    Casi todos cambiaron seguridad por un plazo que no les apretaba

    Los dos caminos abren el rollout a las 11:00, una hora antes del límite. La opción B tiene un octavo del riesgo de reinicio de sesión sin costar tiempo. Veinte de veinticuatro runs decidieron que no cabía, y casi todas por empezar la secuencia a las 09:15, cuando llega el ingeniero, en vez de a las 09:07, cuando se puede enviar el diff.

  2. 02

    #1 → #5

    entre el #001 y el #002

    GLM 5.3 Flash

    El modelo que ganó el primer escenario quedó quinto en este

    No es un retroceso, es otro examen. El #001 premia darse cuenta de lo que cambió; el #002 premia montar un plan que funcione. Las tres runs de GLM 5.3 Flash caben en 6,5 puntos, y ninguna de ellas eligió el camino de release más seguro.

  3. 03

    64.5 – 97.5

    tres runs, el mismo prompt

    MIMO v2.5

    Un modelo dio su mejor y su peor respuesta con el mismo input

    Un rango de 33 puntos, el más ancho. Su mejor run es la segunda mejor respuesta de toda la batería; la peor afirma que no hace falta la verificación de Seguridad y luego la programa igualmente. Tres runs por modelo existen justo para esto: con una sola, MIMO parece un modelo del top dos o del fondo según cuál te toque.

  4. 04

    3 / 3

    planes que no se pueden ejecutar

    Gemma 4

    Equivocarse es normal. Recomendar un plan imposible no

    Sus tres runs programan el despliegue para después de que se haya ido el único ingeniero que puede ejecutarlo — una de ellas a las 10:30, diez minutos pasada su hora límite. A eso apunta exactamente la penalización MAJOR_PLANNING_ERROR, y Gemma 4 es el único modelo que la activó en todas sus runs.

02

La prueba

Qué recibieron, y qué tenían que deducir.

// la prueba

Todo lo que necesitaba estaba dicho
Nada estaba dicho junto

Un release falló el viernes. Dos formas de recuperarlo, cuatro personas cuyas agendas apenas coinciden, y una ventana de cliente que se cierra a mediodía. Aquí no se esconde ningún dato: el trabajo es encajarlos.

Quién está libre, y cuándo

09:00 09:30 10:00 10:30 11:00 11:30 12:00 Marcus Priya Sam Daniel
  • ahora · 09:07
  • Marcus se va · 10:20
  • El rollout de Atlas debe haber empezado · 12:00

Los dos caminos de recuperación · A

2.9.4

Reintentar el build que ya falló una vez, con un precheck de shard.

despliegue
20 min
riesgo de reinicio de sesión
8%
 
sin cambio de código

Los dos caminos de recuperación · B

2.9.5-patch

Un parche que evita el camino de migración que falló. Necesita antes una revisión delta de Seguridad.

despliegue
45 min
riesgo de reinicio de sesión
<1%
 
cambia código

Opción B, secuenciada

09:00 09:30 10:00 10:30 11:00 11:30 12:00 Priya Revisión delta de Seguridad · 25m Marcus Desplegar 2.9.5-patch · 45m Priya Verificación post-deploy · 20m Sam Abrir y comprobar el rollout · 15m

El despliegue termina 3 minutos antes de que Marcus se vaya. Ese es todo el margen.

El paso que hace que encaje

Priya revisa en asíncrono a partir de un diff enviado, y está libre desde las 09:00. La cadena empieza a las 09:07 con una acción que el usuario puede hacer, no a las 09:15 cuando llega Marcus.

Qué pasó

Los dos caminos abren el rollout a las 11:00, 60 minutos antes del límite. La opción B tiene un octavo del riesgo sin costar tiempo. 4 de 24 runs oficiales la eligieron; 20 de 24 nunca montaron un calendario que demostrara que cabe.

Si se pasa, la migración se va al jueves. La renovación está firmada, así que el coste es ruido con dirección, no ingresos.

03

El método

Cómo se construye la nota, y cómo comprobarla.

// puntuación

Cómo funciona el Monday Score

Cien puntos repartidos en 6 dimensiones, y después penalizaciones. Solo calidad: la velocidad y el coste se informan al lado de la nota, nunca dentro.

  1. Reconstrucción del estado ¿Sabe qué es cierto ahora mismo? 15
  2. Sustitución temporal ¿Se da cuenta de lo que un mensaje posterior dejó sin efecto? 15
  3. Planificación y dependencias ¿Sabe montar un plan que de verdad se pueda ejecutar? 25
  4. Decisión y priorización ¿Ataca primero la restricción más apretada? 20
  5. Razonamiento entre fuentes ¿Cruza ficheros, y separa la aritmética de la causa? 15
  6. Incertidumbre ¿Se niega a cerrar lo que la evidencia no cierra? 10
  7. total 100

El juez no pone una nota de 0 a 100 directamente

Clasifica criterios atómicos de uno en uno, 20 en la rúbrica 0.2, y cada veredicto lleva la evidencia en la que se apoya. Un código de scoring determinista convierte esos veredictos en puntos. Ningún modelo ve nunca un marcador acumulado.

  • PASS todos los puntos del criterio
  • PARTIAL la mitad
  • FAIL nada

Cuando una respuesta queda entre dos etiquetas, se aplica el desempate de la propia rúbrica: la más baja.

Penalizaciones

Se aplican sobre la nota de dimensiones, con un tope de −30 por run.

  • -5 Alucinación material Una afirmación relevante para el briefing que el material no sostiene.
  • -10 Acción prohibida Recomendar algo que el estado actual descarta explícitamente.
  • -7 Error grave de planificación Recomendar un plan que no puede ejecutarse con las dependencias o la disponibilidad dadas.
  • -5 Contradicción grave Contradecirse sobre el estado de un asunto importante.

ver_metodologia →

// procedencia

Exactamente qué produjo estos números

Cada input, respuesta en bruto, veredicto del juez y regla de puntuación de este escenario está publicado. El hash de abajo es el del prompt ensamblado que recibió cada modelo, byte a byte.

Escenario

monday-002

Versión del benchmark

0.2

Rúbrica

0.2

Evaluador

evaluator-opus5-v0.2

Juez

claude-opus-5

Resultado generado

2026-09-11

SHA-256 del prompt

740e627cbc7413c321ede0d54000504de54821d34ff4677f82731b89600423a8

Intentos necesarios para tres runs válidas

Una run puede rechazarse antes de puntuarse: truncada, o devuelta sin razonamiento cuando se pidió razonamiento, o un duplicado de caché. Esas nunca llegan a un leaderboard, porque un leaderboard solo puede excluir lo que evaluó. Es una propiedad del modelo y su endpoint, no de la respuesta, y se informa aparte de la nota.

  • Qwen 3.8 Flash 3 de 4 intentos REASONING_NOT_DELIVERED

Una run se generó y se puntuó pero no cuenta

  • monday-002__qwen3.8-flash__002 66.5 El proveedor sirvió esta run sin la fase de razonamiento que usaron sus dos hermanas — cero tokens de razonamiento frente a 42.808 y 30.342 — así que no era comparable con ellas. Su nota sigue en pie y su evidencia está publicada; simplemente no cuenta.

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.