// mondaybench #005 beta

El mismo lunes caótico
para 10 modelos abiertos

Un incidente, mitigado y no resuelto. Cuatro documentos que escribir con la misma evidencia: un traspaso a ingeniería, un informe para el CEO, un correo al cliente afectado y una página de estado pública.

Una pregunta: ¿Sabe contarle la misma verdad a cuatro personas?

  • 10 modelos
  • 3 runs cada uno
  • juez Opus 5
  • congelado y auditable

un incidente, cuatro documentos

  • tiene que estar
  • no puede estar
Ingeniería traspaso Dirección briefing Cliente correo Página de estado pública
El asunto de seguridad llega al equipo +
Ningún otro cliente nombrado
Ningún cliente en la página de estado
Ningún dato personal publicado
Las dos hipótesis llegan al equipo +
La ETA interna se queda dentro

El mismo dato, obligatorio en una columna y prohibido en otra. Cada criterio se puntúa en las 30 runs oficiales.

01

El resultado

Diez modelos, 30 runs, un juez.

// resultados

La clasificación

El Monday Score mide solo calidad: si el briefing reconstruyó bien la situación y eligió el trabajo que importaba. La velocidad va al lado y nunca se mezcla dentro.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

monday-001 · 13 models, 3 runs each
# Modelo Monday Score Rango de runs TTFA mediana Latencia total Ver detalle de
1 Fable 5.1 cerrado 100.0 0.0
2 Gemini 3.8 Flash (High) cerrado 100.0 0.0 63.8s
3 Claude Opus 5 cerrado 99.7 1.0
1 4 GLM 5.2 glm5.2 98.5 3.0 256.9s 272.1s
2 5 GLM 5.3 Flash glm5.3-flash 98.5 1.5 662.6s 702.4s
3 6 DeepSeek V4.1 Flash deepseek-v4.1-flash-rerun-v1 98.3 1.5 61.8s 70.2s
4 7 DeepSeek V4 Flash deepseek-v4-flash 97.3 2.0 110.0s 116.6s
5 8 GLM 5.3 glm5.3 97.0 3.0 769.2s 844.4s
6 9 Qwen 3.8 Flash qwen3.8-flash 97.0 3.0 215.9s 255.6s