// mondaybench · v1.7
¿Sabría un modelo
manejar tu lunes?
Cinco escenarios reconstruyen una mañana de trabajo real. Cada modelo recibe la misma bandeja de entrada, las mismas contradicciones y las mismas decisiones a medias, responde 3 veces y se puntúa con una rúbrica congelada.
// general
Clasificación general
El Monday Score es la media, a igual peso, de los cinco escenarios de trabajo real.
Solo modelos abiertos Todos los modelos
Clasificación
9 modelos de pesos abiertos, ordenados por Monday Score. 13 modelos ordenados por Monday Score, incluidos los 4 de pesos cerrados.
Banda de calidad baja alta
Los modelos de una misma banda comparten tono. La suite no ordena una banda por dentro — los cuatro de arriba están a 0,54 puntos entre sí frente a una sigma de run mínima de 1,53 — así que la longitud de la barra sigue siendo una lectura real de 0 a 100 y lo único que cambia de color es la banda.
| # | Modelo | Monday Score | Δ líder | Peor lunes | Dispersión entre escenarios |
|---|---|---|---|---|---|
| 01 | cerrado | 98.80 | +3.73 | 96.0 | 4.0 |
| 02 | cerrado | 97.07 | +2.00 −1.73 | 90.8 | 8.8 |
| 01 03 | 95.07 | −3.73 | 92.5 | 4.5 | |
| 02 04 | 94.93 | −0.14 −3.87 | 87.3 | 11.2 | |
| 05 | cerrado | 94.90 | −0.17 −3.90 | 89.3 | 10.7 |
| 03 06 | 94.53 | −0.54 −4.27 | 90.0 | 8.3 | |
| 04 07 | 93.73 | −1.34 −5.07 | 87.7 | 9.8 | |
| 05 08 | 91.70 | −3.37 −7.10 | 86.0 | 11.3 | |
| 09 | cerrado | 88.37 | −6.70 −10.43 | 78.5 | 21.5 |
| 06 10 | 86.67 | −8.40 −12.13 | 78.5 | 16.7 | |
| 07 11 | 86.50 | −8.57 −12.30 | 71.2 | 27.3 | |
| 08 12 | 68.77 | −26.30 −30.03 | 46.0 | 36.8 | |
| 09 13 | 63.00 | −32.07 −35.80 | 35.2 | 54.5 |
Ver las notas por escenario Los cinco lunes detrás de cada media, con la celda sombreada según la nota.
Tono de celda 35.2 100.0
| Modelo | #001 | #002 | #003 | #004 | #005 | Dispersión entre escenarios |
|---|---|---|---|---|---|---|
| cerrado | 100.0 | 100.0 | 100.0 | 98.0 | 96.0 | 4.0 |
| cerrado | 98.5 | 98.0 | 98.3 | 90.8 | 99.7 | 8.8 |
| 92.5 | 94.8 | 94.5 | 96.5 | 97.0 | 4.5 | |
| 98.0 | 87.3 | 92.8 | 98.0 | 98.5 | 11.2 | |
| cerrado | 97.5 | 91.0 | 96.7 | 89.3 | 100.0 | 10.7 |
| 95.0 | 93.0 | 96.3 | 90.0 | 98.3 | 8.3 | |
| 97.5 | 87.7 | 94.8 | 91.7 | 97.0 | 9.8 | |
| 90.8 | 89.3 | 95.0 | 86.0 | 97.3 | 11.3 | |
| cerrado | 97.0 | 81.0 | 85.3 | 78.5 | 100.0 | 21.5 |
| 88.2 | 81.2 | 90.3 | 78.5 | 95.2 | 16.7 | |
| 84.3 | 91.2 | 87.3 | 71.2 | 98.5 | 27.3 | |
| 82.8 | 70.2 | 65.5 | 46.0 | 79.3 | 36.8 | |
| 70.7 | 54.2 | 65.3 | 35.2 | 89.7 | 54.5 |
Detalle técnico Estabilidad entre runs, modelos sin clasificar y qué produjo cada número.
Estabilidad entre runs
Cuánto se separan los tres runs oficiales de un mismo escenario, promediado entre los cinco. Un modelo del que no obtienes dos veces la misma respuesta es otro producto, así que se informa aquí y nunca cuenta en el Monday Score.
| Modelo | Rango medio | Peor rango |
|---|---|---|
| cerrado | 0.3 | 1.5 |
| cerrado | 2.5 | 8.5 |
| cerrado | 3.5 | 9.5 |
| 4.3 | 10.5 | |
| cerrado | 5.4 | 23.5 |
| 6.0 | 19.0 | |
| 6.4 | 11.5 | |
| 6.8 | 13.5 | |
| 7.0 | 17.0 | |
| 9.1 | 16.0 | |
| 9.9 | 19.0 | |
| 14.7 | 31.0 | |
| 16.3 | 33.0 |
// coste y eficiencia
Tres modelos que el benchmark no puede separar
Las tres primeras notas caen dentro del ruido de medición, así que la clasificación deja de ser la pregunta interesante. Lo que las separa es lo que cuestan, lo que tardan y lo que escriben.
Calidad frente a coste
Opus registra la calidad medida más alta, pero en un punto de precio muy distinto al de los modelos abiertos que lideran. 97,07 a 246,91 $ por 1.000 tareas frente a 94,93 a 10,71 $.
La vista de proveedor mezcla precios de tarifa first-party con precios públicos de terceros.
De $0.44 a $456 por 1.000 tareas. Más de 1037× de diferencia de precio en el conjunto. Solo un rango de precios, no una comparación de calidad.
Los modelos sin precio publicado quedan al final.
| Modelo | Base del precio | Confianza | ||
|---|---|---|---|---|
| Claude Opus 5 | 97.07 | $246.91 | First-party | HIGH |
| Qwen 3.8 Flash En frontera | 95.07 | $12.61–$15.56 | First-party | MEDIUM |
| GLM 5.3 Flash En frontera | 94.93 | $10.71 · promo $5 | First-party | HIGH |
| Claude Fable 5.1 | 94.90 | $456.27 | First-party | HIGH |
| DeepSeek V4.1 Flash | 94.53 | $10.72–$22.47 | First-party | MEDIUM |
| GLM 5.3 | 93.73 | $99.20 | First-party identidad en disputa | HIGH |
| DeepSeek V4 Flash | 91.70 | $12.94–$25.88 | First-party | HIGH |
| Gemini 3.8 Flash (High) | 88.37 | Unknown | — | — |
| MIMO v2.5 | 86.67 | $3.33 | OpenRouter | HIGH |
| GLM 5.2 | 86.50 | $39.50 | First-party | HIGH |
| Qwen 3.6 | 68.77 | $7.70 | OpenRouter ref | MEDIUM |
| Gemma 4 | 63.00 | $0.44 | OpenRouter ref | MEDIUM |
Coste a escala
| Modelo | 1k | 100k | 1M |
|---|---|---|---|
| Qwen 3.8 Flash | $13–$16 | $1.3k–$1.6k | $12.6k–$15.6k |
| GLM 5.3 Flash | $11 | $1.1k | $10.7k |
| Claude Fable 5.1 | $456 | $45.6k | $456k |
| Claude Opus 5 | $247 | $24.7k | $247k |
| Claude Fable 5.1 frente a Qwen 3.8 Flash · 29.3×–36.2× | +$444 | +$44.4k | +$444k |
| Claude Fable 5.1 frente a GLM 5.3 Flash · 42.6× | +$446 | +$44.6k | +$446k |
Tareas equivalentes de MondayBench. Una extrapolación lineal de la carga observada, no un coste universal por petición.
Cómo llega cada modelo a su resultado
Opus junta la nota medida más alta con la primera respuesta más rápida, pero a un coste mucho mayor que los modelos abiertos que lideran.
Dos dimensiones observables. Ninguna entra en el Monday Score, y no existe una puntuación de eficiencia.
Velocidad
Fable alcanza la misma banda de calidad medida unas 5.08×–5.46× más rápido.
Concisión
Tokens de salida medios
Fable produce salidas notablemente más cortas en esta carga de trabajo.
2.45× menos tokens de salida que GLM 5.3 Flash y 3.87× menos que Qwen 3.8 Flash.
Solo salida generada observable. La observabilidad del proveedor no es homogénea entre modelos: solo detalle, no una comparación.
Fuera del gráfico: Gemini 3.8 Flash (High). La ruta no informa del tiempo hasta la primera respuesta ni del recuento de tokens, y ninguno se estima. La latencia total de generación de esos runs está en las tablas por escenario.
// la suite
Tu lunes, en cinco pruebas
No son cinco exámenes sueltos. Es una mañana desmontada.
- #001 Entender Vuelta al trabajo ¿Sabe distinguir lo que de verdad importa?
- #002 Reconciliar Objetivos móviles ¿Sabe qué ha cambiado por debajo?
- #003 Planificar Bloqueos ¿Encuentra el camino entre las dependencias?
- #004 Analizar Los números no mienten ¿Razona sobre datos de negocio sucios?
- #005 Comunicar Leer la sala ¿Le cuenta lo mismo a cuatro personas distintas?
// método
Cómo funciona MondayBench
Cada input, respuesta, veredicto y regla de puntuación es público.
Cómo está construida la suite
Una mañana, desmontada
No son cinco exámenes. Son cinco situaciones del mismo lunes — una bandeja de entrada, una agenda que se ha movido, trabajo bloqueado por otro trabajo, un paquete de números y algo que hay que decir con cuidado. Cada una trae sus propias fuentes, sus contradicciones y sus decisiones a medias.
118 criterios, con precio antes del primer run
Cada escenario fija sus criterios y cuánto vale cada uno antes de generar nada, y los cinco suman exactamente 100. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota publicada; los borradores descartados se quedan en disco como registro de calibración.
Congelada y versionada
Cada prompt está fijado por sha256, así que un escenario modificado dejaría de coincidir con su propio hash. Runs, veredictos y clasificaciones solo pueden crecer, nunca editarse, y cada release lleva un digest sobre todos sus artefactos: clona el tag, recalcula, y o sale el mismo o has encontrado algo.
-
Mismo input
Idéntico escenario, orden de fuentes y prompt para todos.
-
3 runs
Todo modelo oficial responde tres veces.
-
Rúbrica atómica
Criterios congelados, cada uno con sus puntos declarados.
-
Juez registrado
Claude Opus 5 etiqueta cada criterio, con su evidencia.
-
Nota determinista
Los puntos se suman. Nada se vuelve a ponderar después.
Ver GitHub Leer la taxonomía de capacidades
El juez es un registro, no una llamada Las cinco reglas completas, qué se garantiza y qué no.
- Todos los modelos reciben el mismo escenario, el mismo orden de fuentes y el mismo prompt.
- Todo modelo oficial se ejecuta tres veces.
- El Monday Score es la media de esos tres runs oficiales.
- La velocidad y el coste se informan aparte y nunca afectan a la nota de calidad.
- Cada input, respuesta en bruto, veredicto y regla de puntuación es público.
Sobre el juez
El juez es Claude Opus 5 leyendo cada respuesta contra la rúbrica en una sesión registrada, no una llamada a la API. Eso significa que un resultado publicado es reproducible como registro, porque cada etiqueta viaja con su evidencia y se puede revisar línea a línea, pero un tercero no puede regenerar las etiquetas desde cero ejecutando un comando. El mismo trabajo que construyó el harness produjo también las etiquetas, y eso es un riesgo de sesgo real, no hipotético. El rastro de auditoría es la mitigación, no la afirmación de que no hiciera falta.
// huellas de modelo
Dos modelos, dónde se diferencian
Los mismos criterios de la clasificación, reagrupados por lo que miden. Se muestran las 6 capacidades con mayor diferencia en el campo, de entre las que miden al menos 3 criterios: 174 de 500 puntos de rúbrica.
Qwen 3.8 Flash
GLM 5.3 Flash
- razonamiento temporal 3 crit · 14 pts diferencia 14
- sustitución de fuentes 6 crit · 27 pts diferencia 7
- disciplina causal 8 crit · 23 pts diferencia 6
- calibración de incertidumbre 7 crit · 23 pts diferencia 5
- razonamiento cuantitativo 16 crit · 66 pts diferencia 5
- criterio de negocio 6 crit · 21 pts diferencia 0
Lee una fila, no una columna: dos modelos son comparables en una capacidad, dos capacidades no son comparables en un modelo. El peso en puntos es el que las rúbricas les dieron, no una afirmación sobre su importancia.
// fíate del resultado
Hecho para ser auditado
Auditable no es una afirmación sobre cómo salieron los números. Es un conjunto de cosas hechas antes de que existieran, y cada una se puede comprobar desde fuera.
-
Nada se descarta por puntuar mal
Todo run oficial se puntúa y se publica, también los malos. No hay best-of-N ni reintento tras un resultado flojo, así que los 3 runs detrás de una nota son los 3 runs que ocurrieron.
-
La rúbrica se congela antes de ejecutar nada
Los criterios y sus puntos se fijan y se versionan antes del primer run. Un cambio posterior abre una versión nueva de la rúbrica en vez de reescribir aquella con la que se midió una nota ya publicada.
-
Cada veredicto viaja con su evidencia
El juez etiqueta un criterio atómico a la vez, y cada etiqueta lleva el fragmento de la respuesta del propio modelo en el que se apoya. Un desacuerdo se puede llevar hasta la frase concreta de la que depende.
-
Todos los modelos reciben el mismo input
Mismo escenario, mismo orden de fuentes, mismo prompt. Nada se ajusta por modelo, y ningún modelo ve un marcador acumulado mientras responde.
-
La release va hasheada y se comprueba desde un clon limpio
Cada artefacto lleva su hash y la versión lleva un digest sobre todos ellos. Clona el tag, recalcula, y o sale el mismo digest o has encontrado algo.
- Verificado desde clon limpio
- Release byte a byte
Detalle técnico del release El digest de la suite, y qué cubre y qué no.
Verificado desde un clon del tag, no desde una copia de trabajo: los cinco manifiestos de congelación limpios y todos los digests de grupo coincidiendo. El digest de abajo es la versión entera en sesenta y cuatro caracteres.
Digest de la suite
060a2cdd79fcf6096039af5af4b11f4e96fabc683476c63579f01043d398ee45 Es una afirmación sobre el rastro de evidencia, no sobre el juicio. El rastro se reproduce exacto; el etiquetado generativo no, y la metodología lo dice.
MondayBench v1.1 introduce huellas de contrato de evaluador específicas por escenario. Las generaciones de los candidatos y la semántica de puntuación no cambian respecto a v1.0; los juicios grabados se conservaron, y cada nota publicada en v1.0 es idéntica aquí. GLM 5.3 es el primer modelo nuevo publicado bajo el contrato de evaluador v1.1. v1.0 queda archivada y reproducible byte a byte.
// por qué lo hemos hecho
Los benchmarks sirven
Lo que importa es producción
Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.