// capacidades · taxonomía v0.2

No quién gana
En qué es bueno cada uno

El Monday Score dice hasta dónde llegó un modelo. Esto dice dónde perdió los puntos: los mismos criterios atómicos de las clasificaciones por escenario, reagrupados por lo que miden en vez de por el lunes en el que les tocó vivir.

Cada criterio del benchmark pertenece a exactamente una capacidad, así que nada se cuenta dos veces y nada se queda fuera.

  • 22capacidades
  • 119criterios mapeados
  • 500puntos de rúbrica
  • 10modelos

Lo que esto no es

  1. No es una segunda nota. Nada de aquí cambia el resultado de un escenario: estos porcentajes son una descomposición de resultados que ya existen.
  2. No es una clasificación. No hay total por capacidades ni ganador por capacidades, porque sumarlas las ponderaría con el peso que las rúbricas les dieron por casualidad.
  3. Las penalizaciones quedan fuera. Una penalización de escenario es una deducción global, y atribuirla a una capacidad sería inventarse la atribución.

Léelo por filas, no por columnas. Dos modelos son comparables en una capacidad; dos capacidades no son comparables en un modelo, porque el peso es el que las rúbricas les dieron y no una afirmación sobre su importancia.

Solo modelos abiertos Todos los modelos

Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.

Escenarios incluidos #001 · #002 · #003 · #004 · #005

Ejecución y criterio 6 capacidades · 32 criterios · 169 pts

criterio de negocio

dispersión 48 · 6 criterios · 21 pts · #004

Convertir un análisis en una decisión sobre la que un comité puede actuar: elegir la métrica de la que de verdad depende la decisión, y enunciar la conclusión en vez de dejarla dentro de los cálculos.

  • GPT-6 Astra ° 100%
  • GLM 5.3 Flash 98%
  • Qwen 3.8 Flash 98%
  • Claude Opus 5 ° 92%
  • GLM 5.3 90%
  • DeepSeek V4 Flash 86%
  • MIMO v2.5 86%
  • Claude Fable 5.1 ° 79%
  • DeepSeek V4.1 Flash 64%
  • GLM 5.2 62%
  • Gemma 4 60%
  • Qwen 3.6 52%

planificación

dispersión 35 · 5 criterios · 30 pts · #002 #003

Producir una secuencia que de verdad se puede ejecutar: la opción correcta elegida, el trabajo paralelizado donde se puede, y el calendario coherente con sus propias dependencias.

  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • DeepSeek V4 Flash 91%
  • DeepSeek V4.1 Flash 91%
  • MIMO v2.5 87%
  • Claude Fable 5.1 ° 87%
  • Qwen 3.8 Flash 86%
  • GLM 5.3 Flash 83%
  • GLM 5.2 81%
  • GLM 5.3 80%
  • Qwen 3.6 69%
  • Gemma 4 65%

asignación de recursos

dispersión 29 · 3 criterios · 21 pts · #003

Resolver la disputa por una persona o una ventana de tiempo escasas, lo que incluye decidir qué es lo que esa persona no debe hacer.

  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • GLM 5.3 96%
  • DeepSeek V4.1 Flash 92%
  • GLM 5.3 Flash 87%
  • MIMO v2.5 87%
  • DeepSeek V4 Flash 80%
  • Qwen 3.8 Flash 79%
  • Qwen 3.6 79%
  • GLM 5.2 75%
  • Gemma 4 71%

priorización

dispersión 28 · 11 criterios · 60 pts · #001 #002 #003

Identificar qué asuntos hay que atender ahora, ordenarlos entre sí, y evitar que lo ya resuelto, lo delegado o lo cosmético desplace al trabajo de verdad.

  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • GLM 5.3 Flash 99%
  • DeepSeek V4.1 Flash 97%
  • GLM 5.3 97%
  • Qwen 3.8 Flash 93%
  • DeepSeek V4 Flash 92%
  • GLM 5.2 86%
  • MIMO v2.5 81%
  • Qwen 3.6 79%
  • Gemma 4 72%

seguridad al actuar

dispersión 7 · 4 criterios · 23 pts · #001 #002 #004

Rechazar acciones que la evidencia descarta: mandar material confidencial fuera, ejecutar una instrucción ya sustituida, escalar gasto sobre una cifra engañosa, o perseguir un asunto que ya está cerrado.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • MIMO v2.5 100%
  • Qwen 3.6 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • Gemma 4 94%

propiedad y delegación

no separa a nadie · 3 criterios · 14 pts · #001 #002 #003

Establecer quién es hoy el responsable de una tarea, y dirigir el trabajo a la persona que debería tenerlo.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • Gemma 4 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • MIMO v2.5 100%
  • Qwen 3.6 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%

Razonamiento 5 capacidades · 39 criterios · 151 pts

razonamiento temporal

dispersión 76 · 3 criterios · 14 pts · #002 #003

Razonar sobre fechas, duraciones, plazos y ventanas de disponibilidad, y decidir qué es alcanzable dentro de ellas.

  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 93%
  • DeepSeek V4.1 Flash 86%
  • GLM 5.3 79%
  • Qwen 3.8 Flash 79%
  • DeepSeek V4 Flash 71%
  • GLM 5.2 71%
  • MIMO v2.5 71%
  • Claude Fable 5.1 ° 71%
  • GLM 5.3 Flash 64%
  • Qwen 3.6 46%
  • Gemma 4 24%

razonamiento cuantitativo

dispersión 70 · 16 criterios · 66 pts · #001 #002 #004 #005

Calcular bien una cifra de negocio y elegir la base correcta para ella: tasas contra el denominador que toca, distribuciones en vez de medias, comparaciones entre iguales y normalizar antes de comparar.

  • GLM 5.3 Flash 98%
  • GPT-6 Astra ° 97%
  • GLM 5.3 94%
  • DeepSeek V4.1 Flash 93%
  • Qwen 3.8 Flash 93%
  • Claude Fable 5.1 ° 93%
  • Claude Opus 5 ° 89%
  • DeepSeek V4 Flash 84%
  • MIMO v2.5 81%
  • GLM 5.2 79%
  • Qwen 3.6 57%
  • Gemma 4 28%

calibración de incertidumbre

dispersión 39 · 7 criterios · 23 pts · #001 #002 #003 #004 #005

Detectar lo que no se puede determinar con las fuentes, decirlo, y nombrar la evidencia que lo resolvería, en vez de dar igualmente una cifra o un veredicto.

  • Claude Opus 5 ° 99%
  • DeepSeek V4 Flash 94%
  • GLM 5.2 94%
  • GLM 5.3 Flash 94%
  • GPT-6 Astra ° 91%
  • Claude Fable 5.1 ° 91%
  • GLM 5.3 91%
  • MIMO v2.5 89%
  • Qwen 3.8 Flash 89%
  • DeepSeek V4.1 Flash 87%
  • Qwen 3.6 78%
  • Gemma 4 59%

razonamiento de dependencias

dispersión 27 · 5 criterios · 25 pts · #002 #003

Reconstruir qué tiene que pasar antes que qué, identificar la cadena que fija la fecha de entrega, y mantener fuera de ella el trabajo que no está en esa cadena.

  • GPT-6 Astra ° 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • DeepSeek V4.1 Flash 91%
  • GLM 5.3 Flash 91%
  • DeepSeek V4 Flash 87%
  • GLM 5.2 87%
  • GLM 5.3 83%
  • MIMO v2.5 76%
  • Gemma 4 75%
  • Qwen 3.6 73%

disciplina causal

dispersión 42 · 8 criterios · 23 pts · #001 #002 #004 #005

Negarse a afirmar una causa que la evidencia no sostiene, sin dejar por ello de reportar el patrón. El fallo típico es dar por hallazgo un mecanismo que solo es plausible.

  • DeepSeek V4 Flash 100%
  • GPT-6 Astra ° 100%
  • Qwen 3.8 Flash 100%
  • DeepSeek V4.1 Flash 97%
  • MIMO v2.5 97%
  • Claude Opus 5 ° 96%
  • GLM 5.3 Flash 94%
  • Claude Fable 5.1 ° 93%
  • GLM 5.2 90%
  • GLM 5.3 90%
  • Gemma 4 73%
  • Qwen 3.6 58%

Manejo de información 6 capacidades · 28 criterios · 117 pts

fidelidad al dato

dispersión 67 · 2 criterios · 8 pts · #003 #004

Arrastrar los valores dados —plazos, duraciones, responsables, recuentos, totales— por toda la respuesta sin sustituirlos por otros. No va de deducir la cifra correcta, sino de no corromper una cifra que ya te han dado.

  • DeepSeek V4.1 Flash 100%
  • GPT-6 Astra ° 100%
  • DeepSeek V4 Flash 88%
  • Qwen 3.8 Flash 88%
  • Gemma 4 69%
  • GLM 5.2 65%
  • GLM 5.3 65%
  • Claude Opus 5 ° 60%
  • GLM 5.3 Flash 50%
  • MIMO v2.5 48%
  • Claude Fable 5.1 ° 40%
  • Qwen 3.6 33%

resolución de entidades

dispersión 100 · 1 criterios · 4 pts · #004

Cruzar registros de una misma entidad cuyos identificadores no coinciden entre ficheros, y darse cuenta cuando un cruce ingenuo ha descartado uno en silencio.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • GLM 5.2 67%
  • MIMO v2.5 67%
  • Gemma 4 0%
  • Qwen 3.6 0%

limpieza de datos

dispersión 70 · 2 criterios · 10 pts · #004

Detectar y corregir defectos en los propios datos —registros duplicados, valores medidos sobre una base que no es comparable— antes de calcular nada con ellos.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • MIMO v2.5 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • Qwen 3.6 67%
  • Gemma 4 30%

sustitución de fuentes

dispersión 40 · 6 criterios · 27 pts · #002 #003 #005

Reconocer que una fuente posterior anula a otra anterior, y actuar sobre la posterior. Distinto de la reconstrucción de estado: aquí los dos hechos están presentes y explícitos, y la pregunta es cuál de ellos sigue en pie.

  • DeepSeek V4.1 Flash 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • DeepSeek V4 Flash 94%
  • Qwen 3.8 Flash 93%
  • GLM 5.2 91%
  • MIMO v2.5 91%
  • Qwen 3.6 75%
  • Gemma 4 60%

reconciliación entre fuentes

dispersión 39 · 4 criterios · 18 pts · #002 #004

Construir con varias fuentes un hallazgo que ninguna sostiene por sí sola, y descartar el hallazgo que una fuente parece sostener pero otra desmonta.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • MIMO v2.5 96%
  • Qwen 3.8 Flash 96%
  • Qwen 3.6 82%
  • Gemma 4 61%

reconstrucción de estado

dispersión 17 · 13 criterios · 50 pts · #001 #002 #003 #005

Averiguar en qué estado está algo —una incidencia, una release, un contrato, una tarea— a partir de evidencia repartida entre fuentes y en parte caducada. El fallo típico es dar por actual un estado que lo fue antes.

  • DeepSeek V4.1 Flash 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Claude Fable 5.1 ° 100%
  • Claude Opus 5 ° 99%
  • DeepSeek V4 Flash 99%
  • Qwen 3.8 Flash 99%
  • MIMO v2.5 98%
  • Qwen 3.6 91%
  • Gemma 4 83%

Comunicación 5 capacidades · 20 criterios · 63 pts

enrutado de información

dispersión 43 · 2 criterios · 7 pts · #005

Hacer llegar un dato a la audiencia interna que lo necesita para actuar. La imagen especular de los límites de la información: aquella va de lo que no debe salir, esta de lo que sí debe llegar. Están separadas porque monday-005 las midió por separado y se separaron: en las 21 runs oficiales ningún modelo divulgó fuera ninguna de las cuatro clases confidenciales explícitas, mientras que el criterio que preguntaba si ese mismo asunto de seguridad llegaba al traspaso con ingeniería fue el más fallado del escenario. Callar y entregar no son la misma habilidad.

  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • DeepSeek V4.1 Flash 93%
  • DeepSeek V4 Flash 86%
  • GLM 5.2 86%
  • MIMO v2.5 86%
  • GLM 5.3 71%
  • Qwen 3.6 71%
  • Qwen 3.8 Flash 71%
  • Gemma 4 57%

adaptación al interlocutor

dispersión 22 · 5 criterios · 17 pts · #005

Decidir qué necesita un lector concreto de un conjunto de hechos, y darle eso en vez de todo o de un resumen de todo. El fallo típico es un mismo documento escrito cuatro veces: correcto en el fondo, equivocado para tres de sus lectores. No es calidad de escritura, que MondayBench no mide: se juzga la selección y el nivel, no la redacción.

  • GLM 5.3 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • DeepSeek V4 Flash 97%
  • DeepSeek V4.1 Flash 97%
  • GLM 5.2 97%
  • GLM 5.3 Flash 97%
  • MIMO v2.5 97%
  • Qwen 3.8 Flash 94%
  • GPT-6 Astra ° 88%
  • Gemma 4 85%
  • Qwen 3.6 78%

disciplina de compromisos

dispersión 30 · 3 criterios · 10 pts · #005

Distinguir una estimación interna de una promesa externa autorizada, y comprometer a la organización solo con lo que alguien ha aprobado de verdad. Vecina de la calibración de incertidumbre, que pregunta si el modelo sabe lo que no sabe; esta pregunta si sabe lo que tiene permitido decir.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • Gemma 4 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • MIMO v2.5 77%
  • Qwen 3.6 70%

coherencia entre entregables

dispersión 17 · 4 criterios · 16 pts · #005

Representar una misma realidad en varios entregables dirigidos a destinatarios distintos, sin que dos de ellos afirmen estados incompatibles. Explícitamente NO es uniformidad: distinto nivel de detalle, distinto enfoque, o un hecho presente en uno y ausente en otro son todos coherentes. Solo cuenta la contradicción sobre un hecho o sobre un compromiso adquirido. No la puede medir un escenario que produce una sola salida, y por eso nada anterior a monday-005 la cubre.

  • DeepSeek V4.1 Flash 100%
  • Gemma 4 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • MIMO v2.5 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • DeepSeek V4 Flash 96%
  • Qwen 3.6 83%

límites de la información

dispersión 8 · 6 criterios · 13 pts · #005

Mantener del lado correcto la información que no puede cruzar una línea de confidencialidad. Solo SUPRESIÓN: detalle técnico y de seguridad interno, la identidad de un cliente delante de otro, datos personales en un documento público, y la arquitectura interna. Distinto de la seguridad al actuar, que es rechazar una ACCIÓN que la evidencia descarta; aquí no se recomienda nada y el daño es la divulgación en sí. Deliberadamente NO cubre que un dato LLEGUE: eso es enrutado de información.

  • DeepSeek V4 Flash 100%
  • DeepSeek V4.1 Flash 100%
  • Gemma 4 100%
  • GLM 5.2 100%
  • GLM 5.3 100%
  • GLM 5.3 Flash 100%
  • GPT-6 Astra ° 100%
  • MIMO v2.5 100%
  • Qwen 3.8 Flash 100%
  • Claude Opus 5 ° 100%
  • Claude Fable 5.1 ° 100%
  • Qwen 3.6 92%

← Volver a la clasificación

// por qué lo hemos hecho

Los benchmarks sirven
Lo que importa es producción

Ponemos modelos abiertos en producción para equipos europeos. MondayBench es cómo comprobamos si de verdad sirven antes de que lleguen ahí.