// mondaybench #004 beta

El mismo lunes caótico
para 10 modelos abiertos

Ocho ficheros, siete de ellos tablas. Dos meses de ingresos, uso, fugas, captación y soporte de una empresa SaaS, y tres decisiones que esperan a números que no están en ninguna tabla.

Una pregunta: ¿Sabe razonar sobre datos de negocio?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
siete tablas
  • customers.csv 36 filas customer_id segmento, plan, ARR, renovación, estado
  • revenue.csv 71 filas customer_id facturas, dos meses, dos fuentes
  • usage.csv 67 filas usage_account_id peticiones, tokens, usuarios activos
  • plans.csv 6 filas plan ingresos, coste de infra y soporte, cuota incluida
  • acquisition.csv 15 filas customer_id canal, logo nuevo o expansión, ARR atribuido
  • funnel.csv 8 filas channel leads y pruebas de pago, por canal y mes
  • support.csv 133 filas customer_id tickets, severidad, estado

usage_account_id cruza por otra clave: dos cuentas la escriben de otra forma

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 1 GLM 5.3 Flash glm5.3-flash 98.0 1.5 766.2s 827.8s
2 GPT-6 Astra gpt-6-astra cerrado 98.0 0.0 — —
2 3 Qwen 3.8 Flash qwen3.8-flash 96.5 3.0 394.1s 468.0s
3 4 GLM 5.3 glm5.3 91.7 17.0 634.2s 673.2s
5 Claude Opus 5 cerrado 90.8 9.5 – –
4 6 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 90.0 1.0 108.3s 128.6s
7 Fable 5.1 cerrado 89.3 8.5 – –
5 8 DeepSeek V4 Flash deepseek-v4-flash 86.0 10.5 164.6s 174.4s
9 Gemini 3.8 Flash (High) cerrado 78.5 3.5 – 61.9s
6 10 MIMO v2.5 mimo-v2.5 78.5 25.5 368.6s 483.6s
7 11 GLM 5.2 glm5.2 71.2 4.5 57.1s 103.1s
8 12 Qwen 3.6 qwen3.6 46.0 2.5 72.6s 102.4s
9 13 Gemma 4 gemma4 35.2 19.0 0.8s 15.3s
  • Rango de runs: la diferencia entre el mejor y el peor run oficial del modelo. No es una desviación respecto a la media, por eso nunca se escribe con ±.
  • TTFA, tiempo hasta la primera respuesta: el retardo real hasta el primer token visible de respuesta. Los tokens de razonamiento no cuentan como respuesta.

// calidad vs velocidad

El modelo más listo no siempre es el que quieres esperar

GLM 5.3 Flash encabeza este escenario con 98.0, tras 766.2s antes del primer token de respuesta. GPT-6 Astra empieza a responder en — y saca 98.0. Los modelos cambian calidad por tiempo de respuesta de formas muy distintas.

30 40 50 60 70 80 90 100 0s200s400s600s800s TTFA mediana, segundos hasta la primera respuesta Monday Score GLM 5.3 Flash 98.0 · 766.2s GPT-6 Astra 98.0 · — Qwen 3.8 Flash 96.5 · 394.1s GLM 5.3 91.7 · 634.2s DeepSeek V4.1 Flash 90.0 · 108.3s DeepSeek V4 Flash 86.0 · 164.6s MIMO v2.5 78.5 · 368.6s GLM 5.2 71.2 · 57.1s Qwen 3.6 46.0 · 72.6s Gemma 4 35.2 · 0.8s

Dos ejes independientes. No hay una puntuación combinada, y no la habrá: lo bueno que es el briefing y lo que tardas en tenerlo son preguntas distintas, y cuál pesa más depende de lo que estés construyendo.

Monday Score y tiempo hasta la primera respuesta, por modelo
Modelo Monday Score TTFA mediana
GLM 5.3 Flash 98.0 766.2s
GPT-6 Astra 98.0 —
Qwen 3.8 Flash 96.5 394.1s
GLM 5.3 91.7 634.2s
DeepSeek V4.1 Flash 90.0 108.3s
DeepSeek V4 Flash 86.0 164.6s
MIMO v2.5 78.5 368.6s
GLM 5.2 71.2 57.1s
Qwen 3.6 46.0 72.6s
Gemma 4 35.2 0.8s

// lo que destacó

Tres cosas que merece la pena decir en voz alta

Cada cifra de abajo se puede comprobar contra el leaderboard, la matriz de criterios o los veredictos publicados en esta misma página.

  1. 01

    9 / 24

    runs recomendaron el recorte que el material descarta

    El segmento SMB

    Hicieron el análisis bien y luego argumentaron en su contra

    Nueve de veinticuatro runs recomiendan recortar la inversión en SMB. Varias calculan, en la misma respuesta, que el MRR neto de SMB es positivo y que el segmento produjo los cinco clientes nuevos de octubre, y aun así recomiendan el recorte, sobre una tasa de fuga cuyo denominador cuenta a quien no debe. El fallo no es aritmético. Todas estas runs saben leer una tabla; lo que ninguna hace es darse cuenta de que sus propios números acaban de contradecir su recomendación.

  2. 02

    7 / 24

    runs vieron la contaminación y la dejaron dentro

    Búsqueda de pago

    Ver el problema y arreglarlo se puntúan aparte, y se separaron

    La tabla de captación mezcla ingresos de clientes nuevos con expansión de clientes que el canal ya tenía. La búsqueda de pago lidera, y deja de liderar en cuanto se quita la expansión. Siete runs identifican la contaminación con palabras —«el número de búsqueda de pago es sobre todo expansión»— y después no rehacen el ranking, así que la inversión nunca aparece y la recomendación sigue nombrando a la búsqueda de pago. Un banco que solo preguntara si el modelo se ha dado cuenta habría dado esto por bueno.

  3. 03

    62.8

    puntos entre el primero y el último: el más ancho de los cinco lunes

    El campo

    El lunes que decide la clasificación

    GLM 5.3 Flash saca aquí un 98,0 y Gemma 4 un 35,2: una amplitud más de tres veces la del #005, y el peor resultado de la suite para cinco de los ocho modelos. Es además donde se decide la clasificación: cinco de los seis modelos por debajo de los dos primeros firman aquí su peor lunes. Dale tablas a un modelo en vez de prosa y el campo deja de parecer un campo.

02

La prueba

Qué recibieron, y qué tenían que deducir.

// la prueba

Cuatro bases. Ninguna falsa

Las facturas de octubre suman de verdad 892.900 €, y eso son de verdad un 12% más que septiembre. El duplicado está de verdad en el fichero. Gringotts pagó de verdad 120.000 €. Nada en este escenario es mentira: lo es el crecimiento.

  1. Facturado, tal cual se carga lo que muestra un cuadro de mando
    Septiembre 797.100 €
    Octubre 892.900 €

    +12,0%

  2. -19.500 € INV-2026-10-0209 — Soylent, cargada desde stripe y desde billing_sync

    Tras quitar la factura duplicada
    Septiembre 797.100 €
    Octubre 873.400 €

    +9,6%

  3. -110.000 € Gringotts prepagó 120.000 € por doce meses; 10.000 € son de octubre

    Normalizado: la factura anual a su valor mensual aceptada
    Septiembre 797.100 €
    Octubre 763.400 €

    −4,2% aquí cambia el signo

  4. Solo suscripciones recurrentes aceptada
    Septiembre 746.100 €
    Octubre 757.700 €

    +1,6%

  5. -25.300 € Cinco clientes se facturaron el 1 de octubre y se dieron de baja ese mes

    Run-rate activo, cuando cae el churn de octubre run-rate
    Septiembre 746.100 €
    Octubre 732.400 €

    −1,8%

Dos de estas son respuestas aceptadas, no una. Normalizar la factura anual manteniendo los servicios puntuales da −4,2%; la línea recurrente sola da +1,6%. Septiembre llevaba 51.000 € de servicios profesionales frente a los 5.700 € de octubre, y por eso no coinciden. Las dos refutan el titular, así que la rúbrica acepta cualquiera de ellas, siempre que la respuesta diga cuál ha calculado.

Tres más de la misma forma

Ocho ficheros: una nota de contexto y siete CSV. Todos son coherentes por dentro, y ninguno contiene una decisión.

La media que es cierta e inútil

Todos los planes están por debajo de su cuota de peticiones incluidas de media: 63%, 74%, 42%. Cinco clientes la superan: Stark al 143% de una cuota de 3M, Wonka al 170% de 600k. «Ningún plan supera su cuota» es cierto de las medias y falso de los clientes, y quien argumenta desde ahí ha leído la columna correcta de la tabla equivocada.

El canal que lidera en la métrica equivocada

Paid search encabeza la tabla de ingresos atribuidos con 274.800 €. De ellos, 210.000 € son expansión de Stark, Umbrella, Globex y Hooli, clientes desde 2023 y 2024, atribuidos a una campaña que arrancó el 28 de septiembre. Contando solo logos nuevos, paid search es tercero y partner es primero.

El cruce que se deja un millón por el camino

Dos cuentas usan en el fichero de uso un identificador distinto al de facturación: wayne_ent y prestige_ww. Cruzar solo por customer_id pierde a Wayne Enterprises, un contrato de 1.008.000 € que renueva en cuatro semanas, y no salta ningún error. Los totales simplemente salen más pequeños.

La caída del 45% que no es un problema

Las peticiones de Acme caen un 45%. Una nota operativa dice que movió los informes a ejecuciones por lotes, con una reducción prevista del 40–50%. Los tokens caen solo un 12% y los ingresos no se mueven. El trabajo no se fue: cambió de forma. Reportar a Acme como riesgo de fuga es el falso positivo que este escenario existe para cazar.

03

El método

Cómo se construye la nota, y cómo comprobarla.

// puntuación

Cómo funciona el Monday Score

Cien puntos repartidos en 6 dimensiones, y después penalizaciones. Solo calidad: la velocidad y el coste se informan al lado de la nota, nunca dentro.

  1. Razonamiento de ingresos ¿Encuentra el crecimiento que no existe? 20
  2. Salud de clientes ¿Dimensiona la fuga antes de reaccionar? 15
  3. Razonamiento de captación ¿Distingue atribución de captación? 19
  4. Economía de los planes ¿Sabe de qué número depende la decisión? 19
  5. Calidad del dato entre tablas ¿Aguantan los cruces y sobreviven las cifras? 18
  6. Calidad de la decisión ¿Responde a las tres preguntas que le hacen? 9
  7. total 100

El juez no pone una nota de 0 a 100 directamente

Clasifica criterios atómicos de uno en uno, 27 en la rúbrica 0.3, y cada veredicto lleva la evidencia en la que se apoya. Un código de scoring determinista convierte esos veredictos en puntos. Ningún modelo ve nunca un marcador acumulado.

  • PASS todos los puntos del criterio
  • PARTIAL la mitad
  • FAIL nada

Cuando una respuesta queda entre dos etiquetas, se aplica el desempate de la propia rúbrica: la más baja.

Penalizaciones

Se aplican sobre la nota de dimensiones, con un tope de −25 por run.

  • -5 Alucinación material Una afirmación relevante para el briefing que el material no sostiene.
  • -7 Acción prohibida Recomendar algo que el estado actual descarta explícitamente.
  • -7 Error grave de datos Un error numérico o de datos sobre el que se apoya después una recomendación o una conclusión de titular.
  • -5 Causalidad no sostenida Afirmar que una cosa causó otra cuando los datos solo muestran que se movieron a la vez.

ver_metodologia →

// procedencia

Exactamente qué produjo estos números

Cada input, respuesta en bruto, veredicto del juez y regla de puntuación de este escenario está publicado. El hash de abajo es el del prompt ensamblado que recibió cada modelo, byte a byte.

Escenario

monday-004

Versión del benchmark

0.4

Rúbrica

0.3

Evaluador

evaluator-opus5-v0.4

Juez

claude-opus-5

Resultado generado

2026-09-11

SHA-256 del prompt

3a0cbb569ca4f711b8907177af9204cec267d26f35f732829df56b03ed23ef99

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.