// mondaybench · v1.7

¿Sabría un modelo
manejar tu lunes?

Cinco escenarios reconstruyen una mañana de trabajo real. Cada modelo recibe la misma bandeja de entrada, las mismas contradicciones y las mismas decisiones a medias, responde 3 veces y se puntúa con una rúbrica congelada.

// general

Clasificación general

El Monday Score es la media, a igual peso, de los cinco escenarios de trabajo real.

Solo modelos abiertos Todos los modelos

Clasificación

9 modelos de pesos abiertos, ordenados por Monday Score. 13 modelos ordenados por Monday Score, incluidos los 4 de pesos cerrados.

Banda de calidad baja alta

Los modelos de una misma banda comparten tono. La suite no ordena una banda por dentro — los cuatro de arriba están a 0,54 puntos entre sí frente a una sigma de run mínima de 1,53 — así que la longitud de la barra sigue siendo una lectura real de 0 a 100 y lo único que cambia de color es la banda.

# Modelo Monday Score Δ líder Peor lunes Dispersión entre escenarios
01 cerrado
98.80
+3.73 96.0
4.0
02 cerrado
97.07
+2.00 −1.73 90.8
8.8
01 03
95.07
−3.73 92.5
4.5
02 04
94.93
−0.14 −3.87 87.3
11.2
05 cerrado
94.90
−0.17 −3.90 89.3
10.7
03 06
94.53
−0.54 −4.27 90.0
8.3
04 07
93.73
−1.34 −5.07 87.7
9.8
05 08
91.70
−3.37 −7.10 86.0
11.3
09 cerrado
88.37
−6.70 −10.43 78.5
21.5
06 10
86.67
−8.40 −12.13 78.5
16.7
07 11
86.50
−8.57 −12.30 71.2
27.3
08 12
68.77
−26.30 −30.03 46.0
36.8
09 13
63.00
−32.07 −35.80 35.2
54.5
Ver las notas por escenario Los cinco lunes detrás de cada media, con la celda sombreada según la nota.

Tono de celda 35.2 100.0

Modelo #001 #002 #003 #004 #005 Dispersión entre escenarios
cerrado 100.0 100.0 100.0 98.0 96.0 4.0
cerrado 98.5 98.0 98.3 90.8 99.7 8.8
92.5 94.8 94.5 96.5 97.0 4.5
98.0 87.3 92.8 98.0 98.5 11.2
cerrado 97.5 91.0 96.7 89.3 100.0 10.7
95.0 93.0 96.3 90.0 98.3 8.3
97.5 87.7 94.8 91.7 97.0 9.8
90.8 89.3 95.0 86.0 97.3 11.3
cerrado 97.0 81.0 85.3 78.5 100.0 21.5
88.2 81.2 90.3 78.5 95.2 16.7
84.3 91.2 87.3 71.2 98.5 27.3
82.8 70.2 65.5 46.0 79.3 36.8
70.7 54.2 65.3 35.2 89.7 54.5
Detalle técnico Estabilidad entre runs, modelos sin clasificar y qué produjo cada número.

Estabilidad entre runs

Cuánto se separan los tres runs oficiales de un mismo escenario, promediado entre los cinco. Un modelo del que no obtienes dos veces la misma respuesta es otro producto, así que se informa aquí y nunca cuenta en el Monday Score.

Modelo Rango medio Peor rango
cerrado 0.3 1.5
cerrado 2.5 8.5
cerrado 3.5 9.5
4.3 10.5
cerrado 5.4 23.5
6.0 19.0
6.4 11.5
6.8 13.5
7.0 17.0
9.1 16.0
9.9 19.0
14.7 31.0
16.3 33.0

// coste y eficiencia

Tres modelos que el benchmark no puede separar

Las tres primeras notas caen dentro del ruido de medición, así que la clasificación deja de ser la pregunta interesante. Lo que las separa es lo que cuestan, lo que tardan y lo que escriben.

Vistas de resultados

Calidad frente a coste

Opus registra la calidad medida más alta, pero en un punto de precio muy distinto al de los modelos abiertos que lideran. 97,07 a 246,91 $ por 1.000 tareas frente a 94,93 a 10,71 $.

La vista de proveedor mezcla precios de tarifa first-party con precios públicos de terceros.

60 70 80 90 100 $0.10 $1 $10 $100 $1000 Coste por 1.000 tareas equivalentes de MondayBench · Escala logarítmica Claude Opus 5 — 97.07 · $246.91/1k · First-party · HIGH Claude Opus 5 Qwen 3.8 Flash — 95.07 · $12.61–$15.56/1k · First-party · MEDIUM Qwen 3.8 Flash GLM 5.3 Flash — 94.93 · $10.71/1k · First-party · HIGH GLM 5.3 Flash Claude Fable 5.1 — 94.90 · $456.27/1k · First-party · HIGH Claude Fable 5.1 DeepSeek V4.1 Flash — 94.53 · $10.72–$22.47/1k · First-party · MEDIUM DeepSeek V4.1 Flash GLM 5.3 — 93.73 · $99.20/1k · First-party · HIGH GLM 5.3 DeepSeek V4 Flash — 91.70 · $12.94–$25.88/1k · First-party · HIGH DeepSeek V4 Flash MIMO v2.5 — 86.67 · $3.33/1k · OpenRouter · HIGH MIMO v2.5 GLM 5.2 — 86.50 · $39.50/1k · First-party · HIGH GLM 5.2 Qwen 3.6 — 68.77 · $7.70/1k · OpenRouter · MEDIUM Qwen 3.6 Gemma 4 — 63.00 · $0.44/1k · OpenRouter · MEDIUM Gemma 4
Solo first-party OpenRouter Ruta de Helmcode Mejor calidad por su precio · tarifa del vendor Mejor calidad por su precio · ruta

De $0.44 a $456 por 1.000 tareas. Más de 1037× de diferencia de precio en el conjunto. Solo un rango de precios, no una comparación de calidad.

Los modelos sin precio publicado quedan al final.

Calidad frente a coste
Modelo Base del precio Confianza
Claude Opus 5 97.07 $246.91 First-party HIGH
Qwen 3.8 Flash En frontera 95.07 $12.61–$15.56 First-party MEDIUM
GLM 5.3 Flash En frontera 94.93 $10.71 · promo $5 First-party HIGH
Claude Fable 5.1 94.90 $456.27 First-party HIGH
DeepSeek V4.1 Flash 94.53 $10.72–$22.47 First-party MEDIUM
GLM 5.3 93.73 $99.20 First-party identidad en disputa HIGH
DeepSeek V4 Flash 91.70 $12.94–$25.88 First-party HIGH
Gemini 3.8 Flash (High) 88.37 Unknown — —
MIMO v2.5 86.67 $3.33 OpenRouter HIGH
GLM 5.2 86.50 $39.50 First-party HIGH
Qwen 3.6 68.77 $7.70 OpenRouter ref MEDIUM
Gemma 4 63.00 $0.44 OpenRouter ref MEDIUM
Coste a escala
Modelo 1k 100k 1M
Qwen 3.8 Flash $13–$16$1.3k–$1.6k$12.6k–$15.6k
GLM 5.3 Flash $11$1.1k$10.7k
Claude Fable 5.1 $456$45.6k$456k
Claude Opus 5 $247$24.7k$247k
Claude Fable 5.1 frente a Qwen 3.8 Flash · 29.3×–36.2× +$444+$44.4k+$444k
Claude Fable 5.1 frente a GLM 5.3 Flash · 42.6× +$446+$44.6k+$446k

Tareas equivalentes de MondayBench. Una extrapolación lineal de la carga observada, no un coste universal por petición.

Cómo llega cada modelo a su resultado

Opus junta la nota medida más alta con la primera respuesta más rápida, pero a un coste mucho mayor que los modelos abiertos que lideran.

Dos dimensiones observables. Ninguna entra en el Monday Score, y no existe una puntuación de eficiencia.

Velocidad

60 70 80 90 100 0s60s120s180s240s300s Tiempo mediano hasta la primera respuesta Qwen 3.8 Flash — 95.07 · 258.9s · ~31.7k de salida Qwen 3.8 Flash GLM 5.3 Flash — 94.93 · 278.2s · ~20.1k de salida GLM 5.3 Flash Claude Fable 5.1 — 94.90 · 50.9s · ~8.2k de salida Claude Fable 5.1 DeepSeek V4.1 Flash — 94.53 · 69.2s · ~17.5k de salida DeepSeek V4.1 Flash GLM 5.3 — 93.73 · 253.3s · ~21.3k de salida GLM 5.3 DeepSeek V4 Flash — 91.70 · 121.4s · ~18.2k de salida DeepSeek V4 Flash MIMO v2.5 — 86.67 · 170.4s · ~13.1k de salida MIMO v2.5 GLM 5.2 — 86.50 · 44.1s · ~8.1k de salida GLM 5.2 Qwen 3.6 — 68.77 · 1.0s · ~3.3k de salida Qwen 3.6 Gemma 4 — 63.00 · 0.6s · ~0.9k de salida Gemma 4 más rápido medido Claude Opus 5 — 97.07 · 41.3s · ~9.2k de salida Claude Opus 5

Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido.

Concisión

  • Gemma 4 ~0.9k Tokens de razonamiento reportados por el proveedor: ~0.0k
  • Qwen 3.6 ~3.3k Tokens de razonamiento reportados por el proveedor: ~1.2k
  • GLM 5.2 ~8.1k Tokens de razonamiento reportados por el proveedor: ~5.9k
  • Claude Fable 5.1 ~8.2k Tokens de razonamiento reportados por el proveedor: ~4.4k
  • Claude Opus 5 ~9.2k Tokens de razonamiento reportados por el proveedor: ~4.8k
  • MIMO v2.5 ~13.1k Tokens de razonamiento reportados por el proveedor: ~0.0k
  • DeepSeek V4.1 Flash ~17.5k Tokens de razonamiento reportados por el proveedor: ~15.6k
  • DeepSeek V4 Flash ~18.2k Tokens de razonamiento reportados por el proveedor: ~16.5k
  • GLM 5.3 Flash ~20.1k Tokens de razonamiento reportados por el proveedor: ~18.0k
  • GLM 5.3 ~21.3k Tokens de razonamiento reportados por el proveedor: ~19.3k
  • Qwen 3.8 Flash ~31.7k Tokens de razonamiento reportados por el proveedor: ~27.4k

Tokens de salida medios

Fable produce salidas notablemente más cortas en esta carga de trabajo.

2.45× menos tokens de salida que GLM 5.3 Flash y 3.87× menos que Qwen 3.8 Flash.

Solo salida generada observable. La observabilidad del proveedor no es homogénea entre modelos: solo detalle, no una comparación.

Fuera del gráfico: Gemini 3.8 Flash (High). La ruta no informa del tiempo hasta la primera respuesta ni del recuento de tokens, y ninguno se estima. La latencia total de generación de esos runs está en las tablas por escenario.

// método

Cómo funciona MondayBench

Cada input, respuesta, veredicto y regla de puntuación es público.

Cómo está construida la suite

Una mañana, desmontada

No son cinco exámenes. Son cinco situaciones del mismo lunes — una bandeja de entrada, una agenda que se ha movido, trabajo bloqueado por otro trabajo, un paquete de números y algo que hay que decir con cuidado. Cada una trae sus propias fuentes, sus contradicciones y sus decisiones a medias.

118 criterios, con precio antes del primer run

Cada escenario fija sus criterios y cuánto vale cada uno antes de generar nada, y los cinco suman exactamente 100. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota publicada; los borradores descartados se quedan en disco como registro de calibración.

Congelada y versionada

Cada prompt está fijado por sha256, así que un escenario modificado dejaría de coincidir con su propio hash. Runs, veredictos y clasificaciones solo pueden crecer, nunca editarse, y cada release lleva un digest sobre todos sus artefactos: clona el tag, recalcula, y o sale el mismo o has encontrado algo.

  1. Mismo input

    Idéntico escenario, orden de fuentes y prompt para todos.

  2. 3 runs

    Todo modelo oficial responde tres veces.

  3. Rúbrica atómica

    Criterios congelados, cada uno con sus puntos declarados.

  4. Juez registrado

    Claude Opus 5 etiqueta cada criterio, con su evidencia.

  5. Nota determinista

    Los puntos se suman. Nada se vuelve a ponderar después.

Ver GitHub Leer la taxonomía de capacidades

El juez es un registro, no una llamada Las cinco reglas completas, qué se garantiza y qué no.
  1. Todos los modelos reciben el mismo escenario, el mismo orden de fuentes y el mismo prompt.
  2. Todo modelo oficial se ejecuta tres veces.
  3. El Monday Score es la media de esos tres runs oficiales.
  4. La velocidad y el coste se informan aparte y nunca afectan a la nota de calidad.
  5. Cada input, respuesta en bruto, veredicto y regla de puntuación es público.

Sobre el juez

El juez es Claude Opus 5 leyendo cada respuesta contra la rúbrica en una sesión registrada, no una llamada a la API. Eso significa que un resultado publicado es reproducible como registro, porque cada etiqueta viaja con su evidencia y se puede revisar línea a línea, pero un tercero no puede regenerar las etiquetas desde cero ejecutando un comando. El mismo trabajo que construyó el harness produjo también las etiquetas, y eso es un riesgo de sesgo real, no hipotético. El rastro de auditoría es la mitigación, no la afirmación de que no hiciera falta.

// huellas de modelo

Dos modelos, dónde se diferencian

Los mismos criterios de la clasificación, reagrupados por lo que miden. Se muestran las 6 capacidades con mayor diferencia en el campo, de entre las que miden al menos 3 criterios: 174 de 500 puntos de rúbrica.

vs

Qwen 3.8 Flash

95.1 Monday Score

GLM 5.3 Flash

94.9 Monday Score

  1. razonamiento temporal 3 crit · 14 pts diferencia 14
    79%
    64%
  2. sustitución de fuentes 6 crit · 27 pts diferencia 7
    93%
    100%
  3. disciplina causal 8 crit · 23 pts diferencia 6
    100%
    94%
  4. calibración de incertidumbre 7 crit · 23 pts diferencia 5
    89%
    94%
  5. razonamiento cuantitativo 16 crit · 66 pts diferencia 5
    93%
    98%
  6. criterio de negocio 6 crit · 21 pts diferencia 0
    98%
    98%

Lee una fila, no una columna: dos modelos son comparables en una capacidad, dos capacidades no son comparables en un modelo. El peso en puntos es el que las rúbricas les dieron, no una afirmación sobre su importancia.

Ver las 22 capacidades

// fíate del resultado

Hecho para ser auditado

Auditable no es una afirmación sobre cómo salieron los números. Es un conjunto de cosas hechas antes de que existieran, y cada una se puede comprobar desde fuera.

  1. Nada se descarta por puntuar mal

    Todo run oficial se puntúa y se publica, también los malos. No hay best-of-N ni reintento tras un resultado flojo, así que los 3 runs detrás de una nota son los 3 runs que ocurrieron.

  2. La rúbrica se congela antes de ejecutar nada

    Los criterios y sus puntos se fijan y se versionan antes del primer run. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota ya publicada.

  3. Cada veredicto viaja con su evidencia

    El juez etiqueta un criterio atómico a la vez, y cada etiqueta lleva el fragmento de la respuesta del propio modelo en el que se apoya. Un desacuerdo se puede llevar hasta la frase concreta de la que depende.

  4. Todos los modelos reciben el mismo input

    Mismo escenario, mismo orden de fuentes, mismo prompt. Nada se ajusta por modelo, y ningún modelo ve un marcador acumulado mientras responde.

  5. La release va hasheada y se comprueba desde un clon limpio

    Cada artefacto lleva su hash y la versión lleva un digest sobre todos ellos. Clona el tag, recalcula, y o sale el mismo digest o has encontrado algo.

  • Verificado desde clon limpio
  • Release byte a byte

Inspeccionar v1.7 en GitHub

Detalle técnico del release El digest de la suite, y qué cubre y qué no.

Verificado desde un clon del tag, no desde una copia de trabajo: los cinco manifiestos de congelación limpios y todos los digests de grupo coincidiendo. El digest de abajo es la versión entera en sesenta y cuatro caracteres.

Digest de la suite

060a2cdd79fcf6096039af5af4b11f4e96fabc683476c63579f01043d398ee45

Es una afirmación sobre el rastro de evidencia, no sobre el juicio. El rastro se reproduce exacto; el etiquetado generativo no, y la metodología lo dice.

MondayBench v1.1 introduce huellas de contrato de evaluador específicas por escenario. Las generaciones de los candidatos y la semántica de puntuación no cambian respecto a v1.0; los juicios grabados se conservaron, y cada nota publicada en v1.0 es idéntica aquí. GLM 5.3 es el primer modelo nuevo publicado bajo el contrato de evaluador v1.1. v1.0 queda archivada y reproducible byte a byte.

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.