Nuevo: DeepSeek V4.1 Flash.La arquitectura construida para agentes, y los 890 bytes que cambian la factura.Explorar la pieza →
// capacidades · taxonomía v0.2
No quién gana En qué es bueno cada uno
El Monday Score dice hasta dónde llegó un modelo. Esto dice dónde perdió los puntos: los mismos criterios atómicos de las clasificaciones por escenario, reagrupados por lo que miden en vez de por el lunes en el que les tocó vivir.
Cada criterio del benchmark pertenece a exactamente una capacidad, así que nada se cuenta dos veces y nada se queda fuera.
22capacidades
119criterios mapeados
500puntos de rúbrica
10modelos
Lo que esto no es
No es una segunda nota. Nada de aquí cambia el resultado de un escenario: estos porcentajes son una descomposición de resultados que ya existen.
No es una clasificación. No hay total por capacidades ni ganador por capacidades, porque sumarlas las ponderaría con el peso que las rúbricas les dieron por casualidad.
Las penalizaciones quedan fuera. Una penalización de escenario es una deducción global, y atribuirla a una capacidad sería inventarse la atribución.
Léelo por filas, no por columnas. Dos modelos son comparables en una capacidad; dos capacidades no son comparables en un modelo, porque el peso es el que las rúbricas les dieron y no una afirmación sobre su importancia.
Solo modelos abiertosTodos los modelos
Claude, Gemini y GPT solo existen tras su API. Desactivado, la tabla ordena solo los modelos abiertos; activado, ordena todo el campo junto.
Convertir un análisis en una decisión sobre la que un comité puede actuar: elegir la métrica de la que de verdad depende la decisión, y enunciar la conclusión en vez de dejarla dentro de los cálculos.
GPT-6 Astra
°
100%
GLM 5.3 Flash 98%
Qwen 3.8 Flash 98%
Claude Opus 5
°
92%
GLM 5.3 90%
DeepSeek V4 Flash 86%
MIMO v2.5 86%
Claude Fable 5.1
°
79%
DeepSeek V4.1 Flash 64%
GLM 5.2 62%
Gemma 4 60%
Qwen 3.6 52%
planificación
dispersión 35 · 5 criterios · 30 pts · #002 #003
Producir una secuencia que de verdad se puede ejecutar: la opción correcta elegida, el trabajo paralelizado donde se puede, y el calendario coherente con sus propias dependencias.
GPT-6 Astra
°
100%
Claude Opus 5
°
100%
DeepSeek V4 Flash 91%
DeepSeek V4.1 Flash 91%
MIMO v2.5 87%
Claude Fable 5.1
°
87%
Qwen 3.8 Flash 86%
GLM 5.3 Flash 83%
GLM 5.2 81%
GLM 5.3 80%
Qwen 3.6 69%
Gemma 4 65%
asignación de recursos
dispersión 29 · 3 criterios · 21 pts · #003
Resolver la disputa por una persona o una ventana de tiempo escasas, lo que incluye decidir qué es lo que esa persona no debe hacer.
Identificar qué asuntos hay que atender ahora, ordenarlos entre sí, y evitar que lo ya resuelto, lo delegado o lo cosmético desplace al trabajo de verdad.
Rechazar acciones que la evidencia descarta: mandar material confidencial fuera, ejecutar una instrucción ya sustituida, escalar gasto sobre una cifra engañosa, o perseguir un asunto que ya está cerrado.
DeepSeek V4 Flash 100%
DeepSeek V4.1 Flash 100%
GLM 5.2 100%
GLM 5.3 100%
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
MIMO v2.5 100%
Qwen 3.6 100%
Qwen 3.8 Flash 100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
Gemma 4 94%
propiedad y delegación
no separa a nadie · 3 criterios · 14 pts · #001 #002 #003
Establecer quién es hoy el responsable de una tarea, y dirigir el trabajo a la persona que debería tenerlo.
Calcular bien una cifra de negocio y elegir la base correcta para ella: tasas contra el denominador que toca, distribuciones en vez de medias, comparaciones entre iguales y normalizar antes de comparar.
Detectar lo que no se puede determinar con las fuentes, decirlo, y nombrar la evidencia que lo resolvería, en vez de dar igualmente una cifra o un veredicto.
Claude Opus 5
°
99%
DeepSeek V4 Flash 94%
GLM 5.2 94%
GLM 5.3 Flash 94%
GPT-6 Astra
°
91%
Claude Fable 5.1
°
91%
GLM 5.3 91%
MIMO v2.5 89%
Qwen 3.8 Flash 89%
DeepSeek V4.1 Flash 87%
Qwen 3.6 78%
Gemma 4 59%
razonamiento de dependencias
dispersión 27 · 5 criterios · 25 pts · #002 #003
Reconstruir qué tiene que pasar antes que qué, identificar la cadena que fija la fecha de entrega, y mantener fuera de ella el trabajo que no está en esa cadena.
Negarse a afirmar una causa que la evidencia no sostiene, sin dejar por ello de reportar el patrón. El fallo típico es dar por hallazgo un mecanismo que solo es plausible.
Arrastrar los valores dados —plazos, duraciones, responsables, recuentos, totales— por toda la respuesta sin sustituirlos por otros. No va de deducir la cifra correcta, sino de no corromper una cifra que ya te han dado.
DeepSeek V4.1 Flash 100%
GPT-6 Astra
°
100%
DeepSeek V4 Flash 88%
Qwen 3.8 Flash 88%
Gemma 4 69%
GLM 5.2 65%
GLM 5.3 65%
Claude Opus 5
°
60%
GLM 5.3 Flash 50%
MIMO v2.5 48%
Claude Fable 5.1
°
40%
Qwen 3.6 33%
resolución de entidades
dispersión 100 · 1 criterios · 4 pts · #004
Cruzar registros de una misma entidad cuyos identificadores no coinciden entre ficheros, y darse cuenta cuando un cruce ingenuo ha descartado uno en silencio.
DeepSeek V4 Flash 100%
DeepSeek V4.1 Flash 100%
GLM 5.3 100%
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
Qwen 3.8 Flash 100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
GLM 5.2 67%
MIMO v2.5 67%
Gemma 4 0%
Qwen 3.6 0%
limpieza de datos
dispersión 70 · 2 criterios · 10 pts · #004
Detectar y corregir defectos en los propios datos —registros duplicados, valores medidos sobre una base que no es comparable— antes de calcular nada con ellos.
Reconocer que una fuente posterior anula a otra anterior, y actuar sobre la posterior. Distinto de la reconstrucción de estado: aquí los dos hechos están presentes y explícitos, y la pregunta es cuál de ellos sigue en pie.
DeepSeek V4.1 Flash 100%
GLM 5.3 100%
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
DeepSeek V4 Flash 94%
Qwen 3.8 Flash 93%
GLM 5.2 91%
MIMO v2.5 91%
Qwen 3.6 75%
Gemma 4 60%
reconciliación entre fuentes
dispersión 39 · 4 criterios · 18 pts · #002 #004
Construir con varias fuentes un hallazgo que ninguna sostiene por sí sola, y descartar el hallazgo que una fuente parece sostener pero otra desmonta.
Averiguar en qué estado está algo —una incidencia, una release, un contrato, una tarea— a partir de evidencia repartida entre fuentes y en parte caducada. El fallo típico es dar por actual un estado que lo fue antes.
Hacer llegar un dato a la audiencia interna que lo necesita para actuar. La imagen especular de los límites de la información: aquella va de lo que no debe salir, esta de lo que sí debe llegar. Están separadas porque monday-005 las midió por separado y se separaron: en las 21 runs oficiales ningún modelo divulgó fuera ninguna de las cuatro clases confidenciales explícitas, mientras que el criterio que preguntaba si ese mismo asunto de seguridad llegaba al traspaso con ingeniería fue el más fallado del escenario. Callar y entregar no son la misma habilidad.
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
DeepSeek V4.1 Flash 93%
DeepSeek V4 Flash 86%
GLM 5.2 86%
MIMO v2.5 86%
GLM 5.3 71%
Qwen 3.6 71%
Qwen 3.8 Flash 71%
Gemma 4 57%
adaptación al interlocutor
dispersión 22 · 5 criterios · 17 pts · #005
Decidir qué necesita un lector concreto de un conjunto de hechos, y darle eso en vez de todo o de un resumen de todo. El fallo típico es un mismo documento escrito cuatro veces: correcto en el fondo, equivocado para tres de sus lectores. No es calidad de escritura, que MondayBench no mide: se juzga la selección y el nivel, no la redacción.
GLM 5.3 100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
DeepSeek V4 Flash 97%
DeepSeek V4.1 Flash 97%
GLM 5.2 97%
GLM 5.3 Flash 97%
MIMO v2.5 97%
Qwen 3.8 Flash 94%
GPT-6 Astra
°
88%
Gemma 4 85%
Qwen 3.6 78%
disciplina de compromisos
dispersión 30 · 3 criterios · 10 pts · #005
Distinguir una estimación interna de una promesa externa autorizada, y comprometer a la organización solo con lo que alguien ha aprobado de verdad. Vecina de la calibración de incertidumbre, que pregunta si el modelo sabe lo que no sabe; esta pregunta si sabe lo que tiene permitido decir.
DeepSeek V4 Flash 100%
DeepSeek V4.1 Flash 100%
Gemma 4 100%
GLM 5.2 100%
GLM 5.3 100%
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
Qwen 3.8 Flash 100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
MIMO v2.5 77%
Qwen 3.6 70%
coherencia entre entregables
dispersión 17 · 4 criterios · 16 pts · #005
Representar una misma realidad en varios entregables dirigidos a destinatarios distintos, sin que dos de ellos afirmen estados incompatibles. Explícitamente NO es uniformidad: distinto nivel de detalle, distinto enfoque, o un hecho presente en uno y ausente en otro son todos coherentes. Solo cuenta la contradicción sobre un hecho o sobre un compromiso adquirido. No la puede medir un escenario que produce una sola salida, y por eso nada anterior a monday-005 la cubre.
DeepSeek V4.1 Flash 100%
Gemma 4 100%
GLM 5.2 100%
GLM 5.3 100%
GLM 5.3 Flash 100%
GPT-6 Astra
°
100%
MIMO v2.5 100%
Qwen 3.8 Flash 100%
Claude Opus 5
°
100%
Claude Fable 5.1
°
100%
DeepSeek V4 Flash 96%
Qwen 3.6 83%
límites de la información
dispersión 8 · 6 criterios · 13 pts · #005
Mantener del lado correcto la información que no puede cruzar una línea de confidencialidad. Solo SUPRESIÓN: detalle técnico y de seguridad interno, la identidad de un cliente delante de otro, datos personales en un documento público, y la arquitectura interna. Distinto de la seguridad al actuar, que es rechazar una ACCIÓN que la evidencia descarta; aquí no se recomienda nada y el daño es la divulgación en sí. Deliberadamente NO cubre que un dato LLEGUE: eso es enrutado de información.