// mondaybench #005 beta

El mismo lunes caótico
para 10 modelos abiertos

Un incidente, mitigado y no resuelto. Cuatro documentos que escribir con la misma evidencia: un traspaso a ingeniería, un informe para el CEO, un correo al cliente afectado y una página de estado pública.

Una pregunta: ¿Sabe contarle la misma verdad a cuatro personas?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable

un incidente, cuatro documentos

  • tiene que estar
  • no puede estar
Ingeniería traspaso Dirección briefing Cliente correo Página de estado pública
El asunto de seguridad llega al equipo + − −
Ningún otro cliente nombrado −
Ningún cliente en la página de estado −
Ningún dato personal publicado −
Las dos hipótesis llegan al equipo +
La ETA interna se queda dentro − −

El mismo dato, obligatorio en una columna y prohibido en otra. Cada criterio se puntúa en las 30 runs oficiales.

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 Fable 5.1 cerrado 100.0 0.0 – –
2 Gemini 3.8 Flash (High) cerrado 100.0 0.0 – 63.8s
3 Claude Opus 5 cerrado 99.7 1.0 – –
1 4 GLM 5.2 glm5.2 98.5 3.0 256.9s 272.1s
2 5 GLM 5.3 Flash glm5.3-flash 98.5 1.5 662.6s 702.4s
3 6 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 98.3 1.5 61.8s 70.2s
4 7 DeepSeek V4 Flash deepseek-v4-flash 97.3 2.0 110.0s 116.6s
5 8 GLM 5.3 glm5.3 97.0 3.0 769.2s 844.4s
6 9 Qwen 3.8 Flash qwen3.8-flash 97.0 3.0 215.9s 255.6s
10 GPT-6 Astra gpt-6-astra cerrado 96.0 1.5 — —
7 11 MIMO v2.5 mimo-v2.5 95.2 5.0 261.5s 293.5s
8 12 Gemma 4 gemma4 89.7 2.5 0.7s 12.7s
9 13 Qwen 3.6 qwen3.6 79.3 22.0 1.0s 7.7s
  • Rango de runs: la diferencia entre el mejor y el peor run oficial del modelo. No es una desviación respecto a la media, por eso nunca se escribe con ±.
  • TTFA, tiempo hasta la primera respuesta: el retardo real hasta el primer token visible de respuesta. Los tokens de razonamiento no cuentan como respuesta.

// calidad vs velocidad

El modelo más listo no siempre es el que quieres esperar

GLM 5.2 encabeza este escenario con 98.5, tras 256.9s antes del primer token de respuesta. GPT-6 Astra empieza a responder en — y saca 96.0. Los modelos cambian calidad por tiempo de respuesta de formas muy distintas.

80 90 100 0s200s400s600s800s TTFA mediana, segundos hasta la primera respuesta Monday Score GLM 5.2 98.5 · 256.9s GLM 5.3 Flash 98.5 · 662.6s DeepSeek V4.1 Flash 98.3 · 61.8s DeepSeek V4 Flash 97.3 · 110.0s GLM 5.3 97.0 · 769.2s Qwen 3.8 Flash 97.0 · 215.9s GPT-6 Astra 96.0 · — MIMO v2.5 95.2 · 261.5s Gemma 4 89.7 · 0.7s Qwen 3.6 79.3 · 1.0s

Dos ejes independientes. No hay una puntuación combinada, y no la habrá: lo bueno que es el briefing y lo que tardas en tenerlo son preguntas distintas, y cuál pesa más depende de lo que estés construyendo.

Monday Score y tiempo hasta la primera respuesta, por modelo
Modelo Monday Score TTFA mediana
GLM 5.2 98.5 256.9s
GLM 5.3 Flash 98.5 662.6s
DeepSeek V4.1 Flash 98.3 61.8s
DeepSeek V4 Flash 97.3 110.0s
GLM 5.3 97.0 769.2s
Qwen 3.8 Flash 97.0 215.9s
GPT-6 Astra 96.0 —
MIMO v2.5 95.2 261.5s
Gemma 4 89.7 0.7s
Qwen 3.6 79.3 1.0s

// lo que destacó

Tres cosas que merece la pena decir en voz alta

Cada cifra de abajo se puede comprobar contra el leaderboard, la matriz de criterios o los veredictos publicados en esta misma página.

  1. 01

    11 / 24

    runs se lo ocultaron al equipo que tenía que arreglarlo

    SEC-411

    Todos supieron qué ocultar. Once olvidaron que además tenía que llegar a alguien

    En las 24 runs oficiales ningún modelo llegó a suspender un criterio de supresión. El ticket de seguridad, los nombres de otros clientes y los datos personales se quedan fuera del correo y de la página pública todas y cada una de las veces. Un solo desliz en 24 runs, y es parcial: Qwen 3.6 no nombra ninguna flota, pero deja que los dos documentos externos revelen que Northstar tiene varias. Y entonces `security_item_reaches_engineering` falla once veces, que es exactamente lo contrario: el dato se retiene fuera, que es lo correcto, y también se le retiene a los ingenieros que tienen que actuar sobre él. Guardar un secreto y entregar un dato no son la misma habilidad, y este criterio es la prueba.

  2. 02

    19.2

    puntos entre el primero y el último: el más estrecho de los cinco lunes

    Los cuatro lectores

    El escenario más difícil de construir resultó el más fácil de aprobar

    Cuatro audiencias, treinta y un criterios, una matriz con celdas OBLIGATORIAS y PROHIBIDAS, y el campo aterriza entre 79,3 y 98,5: más junto que en ningún otro lunes. Gemma 4 saca aquí un 89,7 frente al 35,2 del #004, su mejor resultado de toda la suite, diecinueve puntos por encima del siguiente. No es que el escenario sea blando. Es que casi todo lo que pide es contención, y la contención es lo que un modelo prudente hace por defecto. Lo que no hace por defecto es darse cuenta de que esa misma prudencia, aplicada hacia dentro, es un fallo.

  3. 03

    −7

    la única penalización de la batería, en una run de tres

    Qwen 3.6

    No reveló un secreto. Hizo una promesa que nadie autorizó

    La única penalización de las 24 runs no es una filtración. La segunda run de Qwen 3.6 pone en la página de estado pública «esperamos confirmar la recuperación completa en la próxima hora»: un plazo que nadie aprobó, publicado durante un incidente cuya ventana de verificación sigue abierta. Eso es PROHIBITED_ACTION, −7, y le cuesta a esa run 22 puntos frente a su propia tercera run con los mismos bytes: 68,0 contra 90,0. El fallo que este escenario se construyó para cazar era la revelación. El que cazó de verdad fue el compromiso.

02

La prueba

Qué recibieron, y qué tenían que deducir.

03

El método

Cómo se construye la nota, y cómo comprobarla.

// puntuación

Cómo funciona el Monday Score

Cien puntos repartidos en 6 dimensiones, y después penalizaciones. Solo calidad: la velocidad y el coste se informan al lado de la nota, nunca dentro.

  1. Comprensión del incidente ¿Sabe qué está roto, desde cuándo y para quién? 17
  2. Incertidumbre y compromiso ¿Separa hipótesis de causa, y estimación de promesa? 26
  3. Fronteras de la información ¿Cada dato acaba en el lado correcto de la línea? 19
  4. Coherencia entre salidas ¿Las cuatro salidas describen una sola realidad? 16
  5. Completitud por audiencia ¿Cada lector recibió lo que ese lector necesitaba? 16
  6. Vigencia y supersesión ¿Todo es cierto a la hora del corte, y no antes? 6
  7. total 100

El juez no pone una nota de 0 a 100 directamente

Clasifica criterios atómicos de uno en uno, 31 en la rúbrica 0.4, y cada veredicto lleva la evidencia en la que se apoya. Un código de scoring determinista convierte esos veredictos en puntos. Ningún modelo ve nunca un marcador acumulado.

  • PASS todos los puntos del criterio
  • PARTIAL la mitad
  • FAIL nada

Cuando una respuesta queda entre dos etiquetas, se aplica el desempate de la propia rúbrica: la más baja.

Penalizaciones

Se aplican sobre la nota de dimensiones, con un tope de −14 por run.

  • -7
  • -7 Acción prohibida Recomendar algo que el estado actual descarta explícitamente.

ver_metodologia →

// procedencia

Exactamente qué produjo estos números

Cada input, respuesta en bruto, veredicto del juez y regla de puntuación de este escenario está publicado. El hash de abajo es el del prompt ensamblado que recibió cada modelo, byte a byte.

Escenario

monday-005

Versión del benchmark

0.5

Rúbrica

0.4

Evaluador

evaluator-opus5-v0.5

Juez

claude-opus-5

Resultado generado

2026-09-11

SHA-256 del prompt

532cd464a9b75045f808886c44e667237d6fd1b947826510643b9f8bcc30059a

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.