// mondaybench #004 beta

El mismo lunes caótico
para 10 modelos abiertos

Ocho ficheros, siete de ellos tablas. Dos meses de ingresos, uso, fugas, captación y soporte de una empresa SaaS, y tres decisiones que esperan a números que no están en ninguna tabla.

Una pregunta: ¿Sabe razonar sobre datos de negocio?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable
siete tablas
  • customers.csv 36 filas customer_id segmento, plan, ARR, renovación, estado
  • revenue.csv 71 filas customer_id facturas, dos meses, dos fuentes
  • usage.csv 67 filas usage_account_id peticiones, tokens, usuarios activos
  • plans.csv 6 filas plan ingresos, coste de infra y soporte, cuota incluida
  • acquisition.csv 15 filas customer_id canal, logo nuevo o expansión, ARR atribuido
  • funnel.csv 8 filas channel leads y pruebas de pago, por canal y mes
  • support.csv 133 filas customer_id tickets, severidad, estado

usage_account_id cruza por otra clave: dos cuentas la escriben de otra forma

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 1 GLM 5.3 Flash glm5.3-flash 98.0 1.5 766.2s 827.8s