// mondaybench · v1.5
¿Sabría un modelo
manejar tu lunes?
Cinco escenarios reconstruyen una mañana de trabajo real. Cada modelo recibe la misma bandeja de entrada, las mismas contradicciones y las mismas decisiones a medias, responde 3 veces y se puntúa con una rúbrica congelada.
// general
Clasificación general
El Monday Score es la media, a igual peso, de los cinco escenarios de trabajo real.
Solo modelos abiertos Todos los modelos
Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.
Clasificación
9 modelos de pesos abiertos, ordenados por Monday Score. 13 modelos ordenados por Monday Score, incluidos los 4 de pesos cerrados.
| # | Modelo | Monday Score | Δ líder | Peor lunes | Dispersión entre escenarios |
|---|---|---|---|---|---|
| 01 | cerrado | 98.80 | +3.73 | 96.0 | 4.0 |
| 02 | cerrado | 97.07 | +2.00 −1.73 | 90.8 | 8.8 |
| 01 03 | 95.07 | −3.73 | 92.5 | 4.5 | |
| 02 04 | 94.93 | −0.14 −3.87 | 87.3 | 11.2 | |
| 05 | cerrado | 94.90 | −0.17 −3.90 | 89.3 | 10.7 |
| 03 06 | 94.53 | −0.54 −4.27 | 90.0 | 8.3 | |
| 04 07 | 93.73 | −1.34 −5.07 | 87.7 | 9.8 | |
| 05 08 | 91.70 | −3.37 −7.10 | 86.0 | 11.3 | |
| 09 | cerrado | 88.37 | −6.70 −10.43 | 78.5 | 21.5 |
| 06 10 | 86.67 | −8.40 −12.13 | 78.5 | 16.7 | |
| 07 11 | 86.50 | −8.57 −12.30 | 71.2 | 27.3 | |
| 08 12 | 68.77 | −26.30 −30.03 | 46.0 | 36.8 | |
| 09 13 | 63.00 | −32.07 −35.80 | 35.2 | 54.5 |
Ver las notas por escenario Los cinco lunes detrás de cada media, con la celda sombreada según la nota.
Tono de celda 35.2 100.0
| Modelo | #001 | #002 | #003 | #004 | #005 | Dispersión entre escenarios |
|---|---|---|---|---|---|---|
| cerrado | 100.0 | 100.0 | 100.0 | 98.0 | 96.0 | 4.0 |
| cerrado | 98.5 | 98.0 | 98.3 | 90.8 | 99.7 | 8.8 |
| 92.5 | 94.8 | 94.5 | 96.5 | 97.0 | 4.5 | |
| 98.0 | 87.3 | 92.8 | 98.0 | 98.5 | 11.2 | |
| cerrado | 97.5 | 91.0 | 96.7 | 89.3 | 100.0 | 10.7 |
| 95.0 | 93.0 | 96.3 | 90.0 | 98.3 | 8.3 | |
| 97.5 | 87.7 | 94.8 | 91.7 | 97.0 | 9.8 | |
| 90.8 | 89.3 | 95.0 | 86.0 | 97.3 | 11.3 | |
| cerrado | 97.0 | 81.0 | 85.3 | 78.5 | 100.0 | 21.5 |
| 88.2 | 81.2 | 90.3 | 78.5 | 95.2 | 16.7 | |
| 84.3 | 91.2 | 87.3 | 71.2 | 98.5 | 27.3 | |
| 82.8 | 70.2 | 65.5 | 46.0 | 79.3 | 36.8 | |
| 70.7 | 54.2 | 65.3 | 35.2 | 89.7 | 54.5 |
Detalle técnico Estabilidad entre runs, modelos sin clasificar y qué produjo cada número.
Estabilidad entre runs
Cuánto se separan los tres runs oficiales de un mismo escenario, promediado entre los cinco. Un modelo del que no obtienes dos veces la misma respuesta es otro producto, así que se informa aquí y nunca cuenta en el Monday Score.
| Modelo | Rango medio | Peor rango |
|---|---|---|
| cerrado | 0.3 | 1.5 |
| cerrado | 2.5 | 8.5 |
| cerrado | 3.5 | 9.5 |
| 4.3 | 10.5 | |
| cerrado | 5.4 | 23.5 |
| 6.0 | 19.0 | |
| 6.4 | 11.5 | |
| 6.8 | 13.5 | |
| 7.0 | 17.0 | |
| 9.1 | 16.0 | |
| 9.9 | 19.0 | |
| 14.7 | 31.0 | |
| 16.3 | 33.0 |
// lo que cuesta
Tres modelos que el benchmark no puede separar
Las tres primeras notas caen dentro del ruido de medición, así que la clasificación deja de ser la pregunta interesante. Lo que las separa es lo que cuestan, lo que tardan y lo que escriben.
Banda de máximo rendimiento
-
La más alta de la banda
Qwen 3.8 Flash
95.07 / 100
$12.61–$15.56 / 1k · 258.9s
-
El más barato de la banda
GLM 5.3 Flash
94.93 / 100
$10.71 / 1k
-
El más conciso del top
Claude Fable 5.1
94.90 / 100
50.9s · ~8.2k de salida
Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido y generando 2.45×–3.87× menos tokens de salida.
El compromiso: 29.3×–42.6× el coste.
Calidad frente a coste
Opus registra la calidad medida más alta, pero en un punto de precio muy distinto al de los modelos abiertos que lideran. 97,07 a 246,91 $ por 1.000 tareas frente a 94,93 a 10,71 $.
GLM 5.3 aparece dos veces: $99.20 por 1.000 tareas a la tarifa pública del vendor y $5.67 en la ruta medida por la que se ejecutó el benchmark. Mismo modelo, misma nota, 17.5× de diferencia: el precio del modelo y el precio de la ruta pueden contar historias muy distintas.
La vista de proveedor mezcla precios de tarifa first-party con precios públicos de terceros.
De $0.44 a $456 por 1.000 tareas. Más de 1037× de diferencia de precio en el conjunto. Solo un rango de precios, no una comparación de calidad.
| Modelo | Monday Score | Coste / 1k | Base del precio | Confianza |
|---|---|---|---|---|
| Claude Opus 5 | 97.07 | $246.91 | First-party | HIGH |
| Qwen 3.8 Flash En frontera | 95.07 | $12.61–$15.56 | First-party | MEDIUM |
| GLM 5.3 Flash En frontera | 94.93 | $10.71 · promo $5 | First-party | HIGH |
| Claude Fable 5.1 | 94.90 | $456.27 | First-party | HIGH |
| DeepSeek V4.1 Flash | 94.53 | $10.72–$22.47 | First-party | MEDIUM |
| GLM 5.3 | 93.73 | $99.20 $5.67 · ruta | First-party identidad en disputa Helmcode route | HIGH |
| DeepSeek V4 Flash | 91.70 | $12.94–$25.88 | First-party | HIGH |
| Gemini 3.8 Flash (High) | 88.37 | Unknown | — | — |
| MIMO v2.5 | 86.67 | $3.33 | OpenRouter | HIGH |
| GLM 5.2 | 86.50 | $39.50 | First-party | HIGH |
| Qwen 3.6 | 68.77 | $7.70 | OpenRouter ref | MEDIUM |
| Gemma 4 | 63.00 | $0.44 | OpenRouter ref | MEDIUM |
Coste a escala
| Modelo | 1k | 100k | 1M |
|---|---|---|---|
| Qwen 3.8 Flash | $13–$16 | $1.3k–$1.6k | $12.6k–$15.6k |
| GLM 5.3 Flash | $11 | $1.1k | $10.7k |
| Claude Fable 5.1 | $456 | $45.6k | $456k |
| Claude Opus 5 | $247 | $24.7k | $247k |
| Claude Fable 5.1 frente a Qwen 3.8 Flash · 29.3×–36.2× | +$444 | +$44.4k | +$444k |
| Claude Fable 5.1 frente a GLM 5.3 Flash · 42.6× | +$446 | +$44.6k | +$446k |
Tareas equivalentes de MondayBench. Una extrapolación lineal de la carga observada, no un coste universal por petición.
Cómo llega cada modelo a su resultado
Opus junta la nota medida más alta con la primera respuesta más rápida, pero a un coste mucho mayor que los modelos abiertos que lideran.
Dos dimensiones observables. Ninguna entra en el Monday Score, y no existe una puntuación de eficiencia.
Velocidad
Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido.
Concisión
Tokens de salida medios
Fable produce salidas notablemente más cortas en esta carga de trabajo.
2.45× menos tokens de salida que GLM 5.3 Flash y 3.87× menos que Qwen 3.8 Flash.
Solo salida generada observable. La observabilidad del proveedor no es homogénea entre modelos: solo detalle, no una comparación.
Fuera del gráfico: Gemini 3.8 Flash (High). La ruta no informa del tiempo hasta la primera respuesta ni del recuento de tokens, y ninguno se estima. La latencia total de generación de esos runs está en las tablas por escenario.
// lo que la tabla esconde
Tres cosas que la clasificación no dice
-
4 / 5
escenarios ganados en solitario por el primero de la tabla
El ganador solo gana un escenario
GPT-6 Astra es #1 porque nunca tiene un mal lunes.
Su peor escenario: 96.0
-
98.8 ≠ 95.1
dos notas, dos máquinas distintas
Casi la misma nota. Modelos muy distintos
GPT-6 tiene el suelo más alto. Qwen llega más arriba.
Rango entre escenarios: 4.0 frente a 4.5
-
6 / 10
modelos firman su peor nota en #004
Los datos de negocio son donde se rompen
Los números no mienten es el escenario con la peor nota para 6 de 10 modelos.
El campo más abierto de la tabla
// la suite
Tu lunes, en cinco pruebas
No son cinco exámenes sueltos. Es una mañana desmontada.
- #001 Entender Vuelta al trabajo ¿Sabe distinguir lo que de verdad importa?
- #002 Reconciliar Objetivos móviles ¿Sabe qué ha cambiado por debajo?
- #003 Planificar Bloqueos ¿Encuentra el camino entre las dependencias?
- #004 Analizar Los números no mienten ¿Razona sobre datos de negocio sucios?
- #005 Comunicar Leer la sala ¿Le cuenta lo mismo a cuatro personas distintas?
// el hallazgo
Los modelos saben callar
No siempre saben quién necesita saberlo
0 / 30
filtraciones externas explícitas
11 / 30
no hicieron llegar el asunto de seguridad a ingeniería
El mismo dato sensible tenía que quedar fuera del cliente y de la página de estado pública, y a la vez llegar a Ingeniería.
// huellas de modelo
Dos modelos, dónde se diferencian
Los mismos criterios de la clasificación, reagrupados por lo que miden. Se muestran las 6 capacidades con mayor diferencia en el campo, de entre las que miden al menos 3 criterios: 174 de 500 puntos de rúbrica.
Qwen 3.8 Flash
GLM 5.3 Flash
- razonamiento temporal 3 crit · 14 pts diferencia 14
- sustitución de fuentes 6 crit · 27 pts diferencia 7
- disciplina causal 8 crit · 23 pts diferencia 6
- calibración de incertidumbre 7 crit · 23 pts diferencia 5
- razonamiento cuantitativo 16 crit · 66 pts diferencia 5
- criterio de negocio 6 crit · 21 pts diferencia 0
Lee una fila, no una columna: dos modelos son comparables en una capacidad, dos capacidades no son comparables en un modelo. El peso en puntos es el que las rúbricas les dieron, no una afirmación sobre su importancia.
// método
Cómo funciona MondayBench
Cada input, respuesta, veredicto y regla de puntuación es público.
-
Mismo input
Idéntico escenario, orden de fuentes y prompt para todos.
-
3 runs
Todo modelo oficial responde tres veces.
-
Rúbrica atómica
Criterios congelados, cada uno con sus puntos declarados.
-
Juez registrado
Claude Opus 5 etiqueta cada criterio, con su evidencia.
-
Nota determinista
Los puntos se suman. Nada se vuelve a ponderar después.
Ver GitHub Leer la taxonomía de capacidades
El juez es un registro, no una llamada Las cinco reglas completas, qué se garantiza y qué no.
- Todos los modelos reciben el mismo escenario, el mismo orden de fuentes y el mismo prompt.
- Todo modelo oficial se ejecuta tres veces.
- El Monday Score es la media de esos tres runs oficiales.
- La velocidad y el coste se informan aparte y nunca afectan a la nota de calidad.
- Cada input, respuesta en bruto, veredicto y regla de puntuación es público.
Sobre el juez
El juez es Claude Opus 5 leyendo cada respuesta contra la rúbrica en una sesión registrada, no una llamada a la API. Eso significa que un resultado publicado es reproducible como registro, porque cada etiqueta viaja con su evidencia y se puede revisar línea a línea, pero un tercero no puede regenerar las etiquetas desde cero ejecutando un comando. El mismo trabajo que construyó el harness produjo también las etiquetas, y eso es un riesgo de sesgo real, no hipotético. El rastro de auditoría es la mitigación, no la afirmación de que no hiciera falta.
// fíate del resultado
Hecho para ser auditado
Auditable no es una afirmación sobre cómo salieron los números. Es un conjunto de cosas hechas antes de que existieran, y cada una se puede comprobar desde fuera.
-
Nada se descarta por puntuar mal
Todo run oficial se puntúa y se publica, también los malos. No hay best-of-N ni reintento tras un resultado flojo, así que los 3 runs detrás de una nota son los 3 runs que ocurrieron.
-
La rúbrica se congela antes de ejecutar nada
Los criterios y sus puntos se fijan y se versionan antes del primer run. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota ya publicada.
-
Cada veredicto viaja con su evidencia
El juez etiqueta un criterio atómico a la vez, y cada etiqueta lleva el fragmento de la respuesta del propio modelo en el que se apoya. Un desacuerdo se puede llevar hasta la frase concreta de la que depende.
-
Todos los modelos reciben el mismo input
Mismo escenario, mismo orden de fuentes, mismo prompt. Nada se ajusta por modelo, y ningún modelo ve un marcador acumulado mientras responde.
-
La release va hasheada y se comprueba desde un clon limpio
Cada artefacto lleva su hash y la versión lleva un digest sobre todos ellos. Clona el tag, recalcula, y o sale el mismo digest o has encontrado algo.
- Verificado desde clon limpio
- Release byte a byte
Detalle técnico del release El digest de la suite, y qué cubre y qué no.
Verificado desde un clon del tag, no desde una copia de trabajo: los cinco manifiestos de congelación limpios y todos los digests de grupo coincidiendo. El digest de abajo es la versión entera en sesenta y cuatro caracteres.
Digest de la suite
40c55b6c4b7cf5c597ee81edc5b26d416c1db92e949bb817766a2aeb5c9e3ba3 Es una afirmación sobre el rastro de evidencia, no sobre el juicio. El rastro se reproduce exacto; el etiquetado generativo no, y la metodología lo dice.
MondayBench v1.1 introduce huellas de contrato de evaluador específicas por escenario. Las generaciones de los candidatos y la semántica de puntuación no cambian respecto a v1.0; los juicios grabados se conservaron, y cada nota publicada en v1.0 es idéntica aquí. GLM 5.3 es el primer modelo nuevo publicado bajo el contrato de evaluador v1.1. v1.0 queda archivada y reproducible byte a byte.
// por qué lo hemos hecho
Los benchmarks sirven
Lo que importa es producción
Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.