// mondaybench #003 beta

El mismo lunes caótico
para 10 modelos abiertos

Seis fuentes. Seis compromisos con fecha en una semana, tres de ellos esperando a la misma migración de tres horas, y un ingeniero reclamado por dos a la vez.

Una pregunta: ¿Sabe planificar con dependencias?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable

// seis compromisos con fecha · una semana · 3 espera a la migración de billing

Lun Mar Mié Jue Vie Export compliance Q3 Contoso Julia Mar 16:00 SSO enterprise para Atlas Marcus Mié 17:00 Hito Q3 de billing Elena Jue 15:00 Página pública de precios Sarah Jue 17:00 Informe al consejo, ingresos Sarah Vie 10:00 Lanzamiento de onboarding Julia Vie 12:00
  • ahora · lunes 09:10
  • espera a la migración de billing
  • no le debe nada
01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 GPT-6 Astra gpt-6-astra cerrado 100.0 0.0 — —
2 Claude Opus 5 cerrado 98.3 5.0 – –
3 Fable 5.1 cerrado 96.7 5.0 – –
1 4 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 96.3 2.5 81.4s 89.2s
2 5 DeepSeek V4 Flash deepseek-v4-flash 95.0 0.0 136.0s 143.0s
3 6 GLM 5.3 glm5.3 94.8 5.0 253.3s 286.6s
4 7 Qwen 3.8 Flash qwen3.8-flash 94.5 11.5 309.3s 327.2s
5 8 GLM 5.3 Flash glm5.3-flash 92.8 19.0 120.8s 145.9s
6 9 MIMO v2.5 mimo-v2.5 90.3 11.5 139.1s 167.8s
7 10 GLM 5.2 glm5.2 87.3 14.0 40.5s 64.3s
11 Gemini 3.8 Flash (High) cerrado 85.3 23.5 – 30.0s
8 12 Qwen 3.6 qwen3.6 65.5 13.0 0.9s 14.8s
9 13 Gemma 4 gemma4 65.3 8.0 0.6s 7.7s
  • Rango de runs: la diferencia entre el mejor y el peor run oficial del modelo. No es una desviación respecto a la media, por eso nunca se escribe con ±.
  • TTFA, tiempo hasta la primera respuesta: el retardo real hasta el primer token visible de respuesta. Los tokens de razonamiento no cuentan como respuesta.

// calidad vs velocidad

El modelo más listo no siempre es el que quieres esperar

GPT-6 Astra encabeza este escenario con 100.0, tras — antes del primer token de respuesta. GPT-6 Astra empieza a responder en — y saca 100.0. Los modelos cambian calidad por tiempo de respuesta de formas muy distintas.

60 70 80 90 100 0s100s200s300s TTFA mediana, segundos hasta la primera respuesta Monday Score GPT-6 Astra 100.0 · — DeepSeek V4.1 Flash 96.3 · 81.4s DeepSeek V4 Flash 95.0 · 136.0s GLM 5.3 94.8 · 253.3s Qwen 3.8 Flash 94.5 · 309.3s GLM 5.3 Flash 92.8 · 120.8s MIMO v2.5 90.3 · 139.1s GLM 5.2 87.3 · 40.5s Qwen 3.6 65.5 · 0.9s Gemma 4 65.3 · 0.6s

Dos ejes independientes. No hay una puntuación combinada, y no la habrá: lo bueno que es el briefing y lo que tardas en tenerlo son preguntas distintas, y cuál pesa más depende de lo que estés construyendo.

Monday Score y tiempo hasta la primera respuesta, por modelo
Modelo Monday Score TTFA mediana
GPT-6 Astra 100.0 —
DeepSeek V4.1 Flash 96.3 81.4s
DeepSeek V4 Flash 95.0 136.0s
GLM 5.3 94.8 253.3s
Qwen 3.8 Flash 94.5 309.3s
GLM 5.3 Flash 92.8 120.8s
MIMO v2.5 90.3 139.1s
GLM 5.2 87.3 40.5s
Qwen 3.6 65.5 0.9s
Gemma 4 65.3 0.6s

// lo que destacó

Tres cosas que merece la pena decir en voz alta

Cada cifra de abajo se puede comprobar contra el leaderboard, la matriz de criterios o los veredictos publicados en esta misma página.

  1. 01

    9 / 24

    runs no llegaron a mover las dos cadenas a la vez

    Marcus

    Un ingeniero reclamado por dos plazos. Nueve planes los pusieron en cola detrás de él

    Marcus es el dueño por defecto de tres tareas y el único posible de dos. La tercera —el parche de permisos de Contoso— tiene sustituto con nombre: Daniel, que estuvo en el modelo de permisos hace dos semanas, a cambio de hora y media de su tiempo y media hora de Marcus para el traspaso. Nueve runs pasaron las dos cadenas por Marcus una detrás de otra mientras Daniel tenía la semana vacía. Las fuentes dicen qué sabe hacer cada uno; ninguna dice quién debe hacer qué.

  2. 02

    10 / 24

    runs vieron las dos mitades del bloqueo

    Precios

    Un plan que se bloquea a sí mismo, dicho en dos frases seguidas

    Sarah quiere montar el pack de aprobación de packaging con capturas de la página de precios acabada, y la página no puede publicarse hasta que esa aprobación pase. Nadie en el escenario se da cuenta, y la salida es una línea del checklist de Priya: se aceptan mockups de diseño. Diez runs de veinticuatro enunciaron el bloqueo y usaron la vía del mockup; tres no hicieron ni lo uno ni lo otro, y con ellas se va la fecha del jueves.

  3. 03

    81.0 – 100.0

    tres runs, el mismo prompt

    GLM 5.3 Flash

    Lo que se mueve un solo modelo es más ancho que la distancia entre los cinco primeros

    Menos de cinco puntos separan al primero del quinto. Las tres runs de GLM 5.3 Flash están a diecinueve de distancia entre sí, con los mismos bytes: un 100,0 perfecto, un 97,5 y un 81,0 que adelanta el lanzamiento de onboarding del viernes al jueves y luego encola las dos cadenas en un solo ingeniero. Qwen 3.8 Flash perdió el primer puesto igual: 100,0 y 95,0, y luego un 88,5. DeepSeek V4 Flash lo ganó sacando 95,0 tres veces sin moverse. Lee la columna de rango al lado de la nota, o no leas la nota.

02

La prueba

Qué recibieron, y qué tenían que deducir.

// la prueba

Todos los hechos están escritos
Ninguna conclusión lo está

Seis ficheros corrientes: Slack, email, notas de reunión, una lista de tareas del viernes y dos CSV. Duraciones, responsables, plazos y quién sabe hacer qué están dichos con todas las letras. Lo único que nadie le da al modelo es este dibujo.

Qué tiene que pasar antes que qué

Migración del esquema Elena · 3h Parche de compatibilidad Marcus · 4h Regresión de SSO QA · 2h Despliegue a producción Marcus · 1h Mié 17:00 Atlas, comprometido por escrito Permisos de Contoso Marcus · 2h Export de compliance Julia · 1h Mar 16:00 MSA 8.3 de Contoso, contractual Backfill de reconciliación Elena · 1.5h Consejo: ingresos Sarah · 2h Vie 10:00 Reunión del consejo Pack de aprobación Sarah · 1.5h Aprobación del comité Página pública de precios Sarah · 3h Jue 17:00 Página de precios publicada
  • solo esa persona puede hacerlo
  • tiene sustituto con nombre

9 dependencias. Cada una aparece una sola vez, en un hilo de Slack, en un email o en una línea de las notas, y ninguna fuente enuncia dos juntas.

La frase que ninguna fuente escribe

Marcus

  • Parche de compatibilidad 4h · solo esa persona puede hacerlo
  • Despliegue a producción 1h · solo esa persona puede hacerlo
  • Permisos de Contoso 2h · Daniel 3.5h + 30min

Marcus es el dueño por defecto de tres tareas y el único posible de dos. La tercera tiene sustituto, y moverla cuesta hora y media del tiempo de Daniel más media hora de Marcus para el traspaso. Con eso se cumplen los dos compromisos con fecha. En el material no lo dice nadie.

Además tiene 3 horas reservadas para la instrumentación de onboarding, que la lista del viernes sigue llamando bloqueante y que Julia liberó esa misma tarde.

Un plan que se cierra sobre sí mismo

  1. Sarah planea montar el pack de aprobación con capturas de la página de precios acabada.
  2. La página no puede publicarse hasta que el comité de packaging la apruebe.
  3. El checklist de Priya acepta mockups de diseño. Nunca hicieron falta capturas de una página en vivo.

Qué pasó

  • 15 de 24 runs oficiales movieron las dos cadenas a la vez
  • 17 de 24 runs oficiales resolvieron del todo al ingeniero disputado
  • 10 de 24 runs oficiales vieron las dos mitades del bloqueo de precios
03

El método

Cómo se construye la nota, y cómo comprobarla.

// puntuación

Cómo funciona el Monday Score

Cien puntos repartidos en 6 dimensiones, y después penalizaciones. Solo calidad: la velocidad y el coste se informan al lado de la nota, nunca dentro.

  1. Ruta crítica y dependencias ¿Deduce qué tiene que pasar antes que qué? 21
  2. Asignación de recursos ¿Deja a la persona insustituible en el trabajo insustituible? 25
  3. Planificación y paralelismo ¿El plan aprovecha el día o lo encola? 18
  4. Calidad de la decisión ¿Actúa sobre el bloqueo real y no sobre el más ruidoso? 14
  5. Reconstrucción del estado ¿Sabe qué es cierto ahora mismo? 10
  6. Exactitud e incertidumbre ¿Arrastra bien los datos que le dan, y para donde para la evidencia? 12
  7. total 100

El juez no pone una nota de 0 a 100 directamente

Clasifica criterios atómicos de uno en uno, 21 en la rúbrica 0.3, y cada veredicto lleva la evidencia en la que se apoya. Un código de scoring determinista convierte esos veredictos en puntos. Ningún modelo ve nunca un marcador acumulado.

  • PASS todos los puntos del criterio
  • PARTIAL la mitad
  • FAIL nada

Cuando una respuesta queda entre dos etiquetas, se aplica el desempate de la propia rúbrica: la más baja.

Penalizaciones

Se aplican sobre la nota de dimensiones, con un tope de −25 por run.

  • -5 Alucinación material Una afirmación relevante para el briefing que el material no sostiene.
  • -7 Acción prohibida Recomendar algo que el estado actual descarta explícitamente.
  • -7 Error grave de planificación Recomendar un plan que no puede ejecutarse con las dependencias o la disponibilidad dadas.
  • -5 Contradicción grave Contradecirse sobre el estado de un asunto importante.

ver_metodologia →

// procedencia

Exactamente qué produjo estos números

Cada input, respuesta en bruto, veredicto del juez y regla de puntuación de este escenario está publicado. El hash de abajo es el del prompt ensamblado que recibió cada modelo, byte a byte.

Escenario

monday-003

Versión del benchmark

0.3

Rúbrica

0.3

Evaluador

evaluator-opus5-v0.3

Juez

claude-opus-5

Resultado generado

2026-09-11

SHA-256 del prompt

aaf788f309d955d2b427c86fe7d95d2bbf88575fde7306adcfd74b0ec4a4103f

Intentos necesarios para tres runs válidas

Una run puede rechazarse antes de puntuarse: truncada, o devuelta sin razonamiento cuando se pidió razonamiento, o un duplicado de caché. Esas nunca llegan a un leaderboard, porque un leaderboard solo puede excluir lo que evaluó. Es una propiedad del modelo y su endpoint, no de la respuesta, y se informa aparte de la nota.

  • Qwen 3.8 Flash 3 de 7 intentos REASONING_NOT_DELIVERED

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.