El mismo lunes caótico
para 10 modelos abiertos
Ocho ficheros, siete de ellos tablas. Dos meses de ingresos, uso, fugas, captación y soporte de una empresa SaaS, y tres decisiones que esperan a números que no están en ninguna tabla.
Una pregunta: ¿Sabe razonar sobre datos de negocio?
- customers.csv 36 filas customer_id segmento, plan, ARR, renovación, estado
- revenue.csv 71 filas customer_id facturas, dos meses, dos fuentes
- usage.csv 67 filas usage_account_id peticiones, tokens, usuarios activos
- plans.csv 6 filas plan ingresos, coste de infra y soporte, cuota incluida
- acquisition.csv 15 filas customer_id canal, logo nuevo o expansión, ARR atribuido
- funnel.csv 8 filas channel leads y pruebas de pago, por canal y mes
- support.csv 133 filas customer_id tickets, severidad, estado
usage_account_id cruza por otra clave: dos cuentas la escriben de otra forma
El resultado
Diez modelos, 30 runs, un juez.
// resultados
La clasificación
El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.
Solo modelos abiertos Todos los modelos
Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.
| # | Modelo | Monday Score | TTFA mediana | Ver detalle de | ||
|---|---|---|---|---|---|---|
| 1 1 | GLM 5.3 Flash glm5.3-flash | 98.0 | 766.2s | |||
Runs individuales
Velocidad
Desglose por dimensión
Qué se dejó
En qué se equivocóSin penalizaciones ni falsas acciones en ningún run. | ||||||