// mondaybench · v1.5

¿Sabría un modelo
manejar tu lunes?

Cinco escenarios reconstruyen una mañana de trabajo real. Cada modelo recibe la misma bandeja de entrada, las mismas contradicciones y las mismas decisiones a medias, responde 3 veces y se puntúa con una rúbrica congelada.

// general

Clasificación general

El Monday Score es la media, a igual peso, de los cinco escenarios de trabajo real.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

Clasificación

9 modelos de pesos abiertos, ordenados por Monday Score. 13 modelos ordenados por Monday Score, incluidos los 4 de pesos cerrados.

# Modelo Monday Score Δ líder Peor lunes Dispersión entre escenarios
01 cerrado
98.80
+3.73 96.0
4.0
02 cerrado
97.07
+2.00 −1.73 90.8
8.8
01 03
95.07
−3.73 92.5
4.5
02 04
94.93
−0.14 −3.87 87.3
11.2
05 cerrado
94.90
−0.17 −3.90 89.3
10.7
03 06
94.53
−0.54 −4.27 90.0
8.3
04 07
93.73
−1.34 −5.07 87.7
9.8
05 08
91.70
−3.37 −7.10 86.0
11.3
09 cerrado
88.37
−6.70 −10.43 78.5
21.5
06 10
86.67
−8.40 −12.13 78.5
16.7
07 11
86.50
−8.57 −12.30 71.2
27.3
08 12
68.77
−26.30 −30.03 46.0
36.8
09 13
63.00
−32.07 −35.80 35.2
54.5
Ver las notas por escenario Los cinco lunes detrás de cada media, con la celda sombreada según la nota.

Tono de celda 35.2 100.0

Modelo #001 #002 #003 #004 #005 Dispersión entre escenarios
cerrado 100.0 100.0 100.0 98.0 96.0 4.0
cerrado 98.5 98.0 98.3 90.8 99.7 8.8
92.5 94.8 94.5 96.5 97.0 4.5
98.0 87.3 92.8 98.0 98.5 11.2
cerrado 97.5 91.0 96.7 89.3 100.0 10.7
95.0 93.0 96.3 90.0 98.3 8.3
97.5 87.7 94.8 91.7 97.0 9.8
90.8 89.3 95.0 86.0 97.3 11.3
cerrado 97.0 81.0 85.3 78.5 100.0 21.5
88.2 81.2 90.3 78.5 95.2 16.7
84.3 91.2 87.3 71.2 98.5 27.3
82.8 70.2 65.5 46.0 79.3 36.8
70.7 54.2 65.3 35.2 89.7 54.5
Detalle técnico Estabilidad entre runs, modelos sin clasificar y qué produjo cada número.

Estabilidad entre runs

Cuánto se separan los tres runs oficiales de un mismo escenario, promediado entre los cinco. Un modelo del que no obtienes dos veces la misma respuesta es otro producto, así que se informa aquí y nunca cuenta en el Monday Score.

Modelo Rango medio Peor rango
cerrado 0.3 1.5
cerrado 2.5 8.5
cerrado 3.5 9.5
4.3 10.5
cerrado 5.4 23.5
6.0 19.0
6.4 11.5
6.8 13.5
7.0 17.0
9.1 16.0
9.9 19.0
14.7 31.0
16.3 33.0

// lo que cuesta

Tres modelos que el benchmark no puede separar

Las tres primeras notas caen dentro del ruido de medición, así que la clasificación deja de ser la pregunta interesante. Lo que las separa es lo que cuestan, lo que tardan y lo que escriben.

Banda de máximo rendimiento

  • La más alta de la banda

    Qwen 3.8 Flash

    95.07 / 100

    $12.61–$15.56 / 1k · 258.9s

  • El más barato de la banda

    GLM 5.3 Flash

    94.93 / 100

    $10.71 / 1k

  • El más conciso del top

    Claude Fable 5.1

    94.90 / 100

    50.9s · ~8.2k de salida

Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido y generando 2.45×–3.87× menos tokens de salida.

El compromiso: 29.3×–42.6× el coste.

Vistas de resultados

Calidad frente a coste

Opus registra la calidad medida más alta, pero en un punto de precio muy distinto al de los modelos abiertos que lideran. 97,07 a 246,91 $ por 1.000 tareas frente a 94,93 a 10,71 $.

GLM 5.3 aparece dos veces: $99.20 por 1.000 tareas a la tarifa pública del vendor y $5.67 en la ruta medida por la que se ejecutó el benchmark. Mismo modelo, misma nota, 17.5× de diferencia: el precio del modelo y el precio de la ruta pueden contar historias muy distintas.

La vista de proveedor mezcla precios de tarifa first-party con precios públicos de terceros.

60 70 80 90 100 $0.10 $1 $10 $100 $1000 Coste por 1.000 tareas equivalentes de MondayBench · Escala logarítmica Claude Opus 5 — 97.07 · $246.91/1k · First-party · HIGH Claude Opus 5 Qwen 3.8 Flash — 95.07 · $12.61–$15.56/1k · First-party · MEDIUM Qwen 3.8 Flash GLM 5.3 Flash — 94.93 · $10.71/1k · First-party · HIGH GLM 5.3 Flash Claude Fable 5.1 — 94.90 · $456.27/1k · First-party · HIGH Claude Fable 5.1 DeepSeek V4.1 Flash — 94.53 · $10.72–$22.47/1k · First-party · MEDIUM DeepSeek V4.1 Flash GLM 5.3 — 93.73 · $99.20/1k · First-party · HIGH GLM 5.3 DeepSeek V4 Flash — 91.70 · $12.94–$25.88/1k · First-party · HIGH DeepSeek V4 Flash MIMO v2.5 — 86.67 · $3.33/1k · OpenRouter · HIGH MIMO v2.5 GLM 5.2 — 86.50 · $39.50/1k · First-party · HIGH GLM 5.2 Qwen 3.6 — 68.77 · $7.70/1k · OpenRouter · MEDIUM Qwen 3.6 Gemma 4 — 63.00 · $0.44/1k · OpenRouter · MEDIUM Gemma 4 GLM 5.3 — 93.73 · $5.67/1k · Helmcode route GLM 5.3 · ruta
Solo first-party OpenRouter Ruta de Helmcode Mejor calidad por su precio · tarifa del vendor Mejor calidad por su precio · ruta

De $0.44 a $456 por 1.000 tareas. Más de 1037× de diferencia de precio en el conjunto. Solo un rango de precios, no una comparación de calidad.

Calidad frente a coste
Modelo Monday Score Coste / 1k Base del precio Confianza
Claude Opus 5 97.07 $246.91 First-party HIGH
Qwen 3.8 Flash En frontera 95.07 $12.61–$15.56 First-party MEDIUM
GLM 5.3 Flash En frontera 94.93 $10.71 · promo $5 First-party HIGH
Claude Fable 5.1 94.90 $456.27 First-party HIGH
DeepSeek V4.1 Flash 94.53 $10.72–$22.47 First-party MEDIUM
GLM 5.3 93.73 $99.20 $5.67 · ruta First-party identidad en disputa Helmcode route HIGH
DeepSeek V4 Flash 91.70 $12.94–$25.88 First-party HIGH
Gemini 3.8 Flash (High) 88.37 Unknown
MIMO v2.5 86.67 $3.33 OpenRouter HIGH
GLM 5.2 86.50 $39.50 First-party HIGH
Qwen 3.6 68.77 $7.70 OpenRouter ref MEDIUM
Gemma 4 63.00 $0.44 OpenRouter ref MEDIUM
Coste a escala
Modelo 1k 100k 1M
Qwen 3.8 Flash $13–$16$1.3k–$1.6k$12.6k–$15.6k
GLM 5.3 Flash $11$1.1k$10.7k
Claude Fable 5.1 $456$45.6k$456k
Claude Opus 5 $247$24.7k$247k
Claude Fable 5.1 frente a Qwen 3.8 Flash · 29.3×–36.2× +$444+$44.4k+$444k
Claude Fable 5.1 frente a GLM 5.3 Flash · 42.6× +$446+$44.6k+$446k

Tareas equivalentes de MondayBench. Una extrapolación lineal de la carga observada, no un coste universal por petición.

Cómo llega cada modelo a su resultado

Opus junta la nota medida más alta con la primera respuesta más rápida, pero a un coste mucho mayor que los modelos abiertos que lideran.

Dos dimensiones observables. Ninguna entra en el Monday Score, y no existe una puntuación de eficiencia.

Velocidad

60 70 80 90 100 0s60s120s180s240s300s Tiempo mediano hasta la primera respuesta Qwen 3.8 Flash — 95.07 · 258.9s · ~31.7k de salida Qwen 3.8 Flash GLM 5.3 Flash — 94.93 · 278.2s · ~20.1k de salida GLM 5.3 Flash Claude Fable 5.1 — 94.90 · 50.9s · ~8.2k de salida Claude Fable 5.1 DeepSeek V4.1 Flash — 94.53 · 69.2s · ~17.5k de salida DeepSeek V4.1 Flash GLM 5.3 — 93.73 · 253.3s · ~21.3k de salida GLM 5.3 DeepSeek V4 Flash — 91.70 · 121.4s · ~18.2k de salida DeepSeek V4 Flash MIMO v2.5 — 86.67 · 170.4s · ~13.1k de salida MIMO v2.5 GLM 5.2 — 86.50 · 44.1s · ~8.1k de salida GLM 5.2 Qwen 3.6 — 68.77 · 1.0s · ~3.3k de salida Qwen 3.6 Gemma 4 — 63.00 · 0.6s · ~0.9k de salida Gemma 4 más rápido medido Claude Opus 5 — 97.07 · 41.3s · ~9.2k de salida Claude Opus 5

Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido.

Concisión

  • Gemma 4 ~0.9k Tokens de razonamiento reportados por el proveedor: ~0.0k
  • Qwen 3.6 ~3.3k Tokens de razonamiento reportados por el proveedor: ~1.2k
  • GLM 5.2 ~8.1k Tokens de razonamiento reportados por el proveedor: ~5.9k
  • Claude Fable 5.1 ~8.2k Tokens de razonamiento reportados por el proveedor: ~4.4k
  • Claude Opus 5 ~9.2k Tokens de razonamiento reportados por el proveedor: ~4.8k
  • MIMO v2.5 ~13.1k Tokens de razonamiento reportados por el proveedor: ~0.0k
  • DeepSeek V4.1 Flash ~17.5k Tokens de razonamiento reportados por el proveedor: ~15.6k
  • DeepSeek V4 Flash ~18.2k Tokens de razonamiento reportados por el proveedor: ~16.5k
  • GLM 5.3 Flash ~20.1k Tokens de razonamiento reportados por el proveedor: ~18.0k
  • GLM 5.3 ~21.3k Tokens de razonamiento reportados por el proveedor: ~19.3k
  • Qwen 3.8 Flash ~31.7k Tokens de razonamiento reportados por el proveedor: ~27.4k

Tokens de salida medios

Fable produce salidas notablemente más cortas en esta carga de trabajo.

2.45× menos tokens de salida que GLM 5.3 Flash y 3.87× menos que Qwen 3.8 Flash.

Solo salida generada observable. La observabilidad del proveedor no es homogénea entre modelos: solo detalle, no una comparación.

Fuera del gráfico: Gemini 3.8 Flash (High). La ruta no informa del tiempo hasta la primera respuesta ni del recuento de tokens, y ninguno se estima. La latencia total de generación de esos runs está en las tablas por escenario.

// lo que la tabla esconde

Tres cosas que la clasificación no dice

  1. 4 / 5

    escenarios ganados en solitario por el primero de la tabla

    El ganador solo gana un escenario

    GPT-6 Astra es #1 porque nunca tiene un mal lunes.

    Su peor escenario: 96.0

  2. 98.8 ≠ 95.1

    dos notas, dos máquinas distintas

    Casi la misma nota. Modelos muy distintos

    GPT-6 tiene el suelo más alto. Qwen llega más arriba.

    Rango entre escenarios: 4.0 frente a 4.5

  3. 6 / 10

    modelos firman su peor nota en #004

    Los datos de negocio son donde se rompen

    Los números no mienten es el escenario con la peor nota para 6 de 10 modelos.

    El campo más abierto de la tabla

// el hallazgo

Los modelos saben callar
No siempre saben quién necesita saberlo

0 / 30

filtraciones externas explícitas

11 / 30

no hicieron llegar el asunto de seguridad a ingeniería

El mismo dato sensible tenía que quedar fuera del cliente y de la página de estado pública, y a la vez llegar a Ingeniería.

Ver Leer la sala

// huellas de modelo

Dos modelos, dónde se diferencian

Los mismos criterios de la clasificación, reagrupados por lo que miden. Se muestran las 6 capacidades con mayor diferencia en el campo, de entre las que miden al menos 3 criterios: 174 de 500 puntos de rúbrica.

vs

Qwen 3.8 Flash

95.1 Monday Score

GLM 5.3 Flash

94.9 Monday Score

  1. razonamiento temporal 3 crit · 14 pts diferencia 14
    79%
    64%
  2. sustitución de fuentes 6 crit · 27 pts diferencia 7
    93%
    100%
  3. disciplina causal 8 crit · 23 pts diferencia 6
    100%
    94%
  4. calibración de incertidumbre 7 crit · 23 pts diferencia 5
    89%
    94%
  5. razonamiento cuantitativo 16 crit · 66 pts diferencia 5
    93%
    98%
  6. criterio de negocio 6 crit · 21 pts diferencia 0
    98%
    98%

Lee una fila, no una columna: dos modelos son comparables en una capacidad, dos capacidades no son comparables en un modelo. El peso en puntos es el que las rúbricas les dieron, no una afirmación sobre su importancia.

Ver las 22 capacidades

// método

Cómo funciona MondayBench

Cada input, respuesta, veredicto y regla de puntuación es público.

  1. Mismo input

    Idéntico escenario, orden de fuentes y prompt para todos.

  2. 3 runs

    Todo modelo oficial responde tres veces.

  3. Rúbrica atómica

    Criterios congelados, cada uno con sus puntos declarados.

  4. Juez registrado

    Claude Opus 5 etiqueta cada criterio, con su evidencia.

  5. Nota determinista

    Los puntos se suman. Nada se vuelve a ponderar después.

Ver GitHub Leer la taxonomía de capacidades

El juez es un registro, no una llamada Las cinco reglas completas, qué se garantiza y qué no.
  1. Todos los modelos reciben el mismo escenario, el mismo orden de fuentes y el mismo prompt.
  2. Todo modelo oficial se ejecuta tres veces.
  3. El Monday Score es la media de esos tres runs oficiales.
  4. La velocidad y el coste se informan aparte y nunca afectan a la nota de calidad.
  5. Cada input, respuesta en bruto, veredicto y regla de puntuación es público.

Sobre el juez

El juez es Claude Opus 5 leyendo cada respuesta contra la rúbrica en una sesión registrada, no una llamada a la API. Eso significa que un resultado publicado es reproducible como registro, porque cada etiqueta viaja con su evidencia y se puede revisar línea a línea, pero un tercero no puede regenerar las etiquetas desde cero ejecutando un comando. El mismo trabajo que construyó el harness produjo también las etiquetas, y eso es un riesgo de sesgo real, no hipotético. El rastro de auditoría es la mitigación, no la afirmación de que no hiciera falta.

// fíate del resultado

Hecho para ser auditado

Auditable no es una afirmación sobre cómo salieron los números. Es un conjunto de cosas hechas antes de que existieran, y cada una se puede comprobar desde fuera.

  1. Nada se descarta por puntuar mal

    Todo run oficial se puntúa y se publica, también los malos. No hay best-of-N ni reintento tras un resultado flojo, así que los 3 runs detrás de una nota son los 3 runs que ocurrieron.

  2. La rúbrica se congela antes de ejecutar nada

    Los criterios y sus puntos se fijan y se versionan antes del primer run. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota ya publicada.

  3. Cada veredicto viaja con su evidencia

    El juez etiqueta un criterio atómico a la vez, y cada etiqueta lleva el fragmento de la respuesta del propio modelo en el que se apoya. Un desacuerdo se puede llevar hasta la frase concreta de la que depende.

  4. Todos los modelos reciben el mismo input

    Mismo escenario, mismo orden de fuentes, mismo prompt. Nada se ajusta por modelo, y ningún modelo ve un marcador acumulado mientras responde.

  5. La release va hasheada y se comprueba desde un clon limpio

    Cada artefacto lleva su hash y la versión lleva un digest sobre todos ellos. Clona el tag, recalcula, y o sale el mismo digest o has encontrado algo.

  • Verificado desde clon limpio
  • Release byte a byte

Inspeccionar v1.5 en GitHub

Detalle técnico del release El digest de la suite, y qué cubre y qué no.

Verificado desde un clon del tag, no desde una copia de trabajo: los cinco manifiestos de congelación limpios y todos los digests de grupo coincidiendo. El digest de abajo es la versión entera en sesenta y cuatro caracteres.

Digest de la suite

40c55b6c4b7cf5c597ee81edc5b26d416c1db92e949bb817766a2aeb5c9e3ba3

Es una afirmación sobre el rastro de evidencia, no sobre el juicio. El rastro se reproduce exacto; el etiquetado generativo no, y la metodología lo dice.

MondayBench v1.1 introduce huellas de contrato de evaluador específicas por escenario. Las generaciones de los candidatos y la semántica de puntuación no cambian respecto a v1.0; los juicios grabados se conservaron, y cada nota publicada en v1.0 es idéntica aquí. GLM 5.3 es el primer modelo nuevo publicado bajo el contrato de evaluador v1.1. v1.0 queda archivada y reproducible byte a byte.

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.