En pocas palabras: En DeepSWE, GLM-5.3 y Claude Fable 5 empatan en código: 69,0% contra 69,7% de pass@1, dentro del margen de error. Pero GLM-5.3 cuesta USD 3,99 por tarea frente a los USD 21,63 de Fable 5 y gana con reintentos (81,1%). El ganador en costo es GLM-5.3.
El duelo GLM-5.3 vs Claude Fable 5 en DeepSWE terminó en empate técnico: 69,0% contra 69,7% de acierto en el primer intento, una brecha que queda adentro del margen de error. El dato que decide todo es otro: GLM-5.3 cuesta USD 3,99 por tarea y Claude Fable 5, USD 21,63, o sea, 5,4 veces más por el mismo resultado.
Together AI publicó la comparativa completa entre GLM-5.3, el modelo abierto de Z.ai, y Claude Fable 5, el modelo cerrado de Anthropic, con 904 rollouts y cuatro intentos por tarea para medir precisión, costo y comportamiento bajo reintentos.
Si dos modelos empatan en calidad, el precio pasa a ser toda la decisión. Y acá el precio no empata ni de casualidad.
En 30 segundos
- Empate en el primer intento: Fable 5 logra 69,7% de pass@1 y GLM-5.3 69,0%, dentro del margen de error, según la comparativa de Together AI.
- GLM-5.3 cuesta 5,4 veces menos: USD 3,99 por rollout contra USD 21,63 de Fable 5, la configuración más cara de todo el tablero.
- Con reintentos gana GLM: 81,1% en pass@2 y 87,6% en pass@4, contra 77,1% y 84,1% de Fable.
- Por cada USD 100 gastados: GLM-5.3 resuelve 17 tareas y Fable 5 solo 3.
- Son casi sustitutos: correlación de 0,65 por tarea, así que conviene GLM-5.3 como default y Fable solo para Rust y serialización.
Claude es un modelo de lenguaje grande y asistente de inteligencia artificial desarrollado por Anthropic, diseñado para generar texto, responder preguntas, analizar documentos y asistir en tareas de programación. Fue lanzado en marzo de 2023.
¿Cuál es el desempeño de cada modelo en el benchmark DeepSWE?
En el primer intento, tablas. Fable 5 resuelve 69,7% de las tareas con el scoring oficial de DeepSWE y GLM-5.3 69,0%, una diferencia de 0,7 puntos que no alcanza para coronar a nadie. La historia cambia cuando se permiten reintentos: ahí GLM-5.3 se escapa con 81,1% en pass@2 (contra 77,1%) y 87,6% en pass@4 (contra 84,1%).
El detalle del experimento importa. Together AI corrió ambos modelos en configuración máxima sobre las 113 tareas de DeepSWE, con cuatro intentos por tarea: 904 rollouts en total, 452 por bando. Si alguna vez usaste un agente de código, conocés el ritual: le tirás un issue, el modelo navega el repositorio, edita archivos, corre los tests, lee el error, vuelve a editar, y media hora después te devuelve un parche que o pasa la suite completa o no sirve para nada. Eso es un rollout, y DeepSWE mide cuántas veces ese ritual termina bien.
Hay letra chica en el scoring. El puntaje oficial excluye errores de infraestructura, y Fable 5 acumuló 16 errores de ruteo contra 1 de GLM-5.3. Contándolos como fallos, el pass@1 de Fable baja a 67,3%. No cambia el veredicto, pero ojo cuando compares con otras planillas. Más contexto en nuestra guía completa sobre Claude.
¿Cuál es la diferencia de costo real por tarea?
Ponele que tenés un pipeline que resuelve 1.000 tareas de código por mes. Con los precios por rollout que publicó Together AI, eso son unos USD 3.990 con GLM-5.3 y unos USD 21.630 con Fable 5. Mismo nivel de acierto, cinco veces la factura (cálculo propio sobre los costos publicados).
El perfil de tokens explica por qué. GLM-5.3 escribe menos: unos 80 mil tokens de salida por rollout contra 114 mil de Fable, aunque da más pasos (124 contra 85). Fable redacta más por paso; GLM da pasos más baratos. En velocidad están empatados: 35 minutos promedio por rollout el primero, 34 el segundo. No estás pagando menos por algo lento.
| Métrica | GLM-5.3 | Claude Fable 5 |
|---|---|---|
| Costo por rollout | USD 3,99 | USD 21,63 |
| Tareas resueltas por cada USD 100 | 17 | 3 |
| Tokens de salida promedio | ~80 mil | ~114 mil |
| Pasos promedio por rollout | 124 | 85 |
| Tiempo promedio por rollout | 35 minutos | 34 minutos |

Ese “17 contra 3” merece una pausa. Por cada 100 dólares, el modelo abierto te devuelve diecisiete tareas resueltas y el cerrado tres. (Sí, en serio.)
¿En qué lenguajes y tipos de tarea gana cada modelo?
Fable 5 apoya casi toda su defensa en un lenguaje: Rust, donde gana 85% contra 70% de GLM-5.3, la brecha más amplia de todo el duelo. Le suma Python (70 contra 66) y los dominios de contrato exacto, encabezados por modelado de datos y serialización (88 contra 79).
GLM-5.3 responde con el mejor JavaScript del tablero (90 contra 75), Go (76 contra 71) y TypeScript (61 contra 57). En dominios se lleva el trabajo estructurado estilo intérprete: consultas y configuración (88 contra 72), internals de lenguaje y runtime (83 contra 78), reactividad con estado (73 contra 64), concurrencia y durabilidad (62 contra 45) y análisis de programas (64 contra 56). Ese 45% de Fable en concurrencia es su punto más flojo, con 17 puntos de distancia. Sobre eso hablamos en cómo elegir entre Sonnet y Opus.
| Lenguaje o dominio | GLM-5.3 | Claude Fable 5 | Ventaja |
|---|---|---|---|
| JavaScript | 90% | 75% | GLM-5.3 |
| TypeScript | 61% | 57% | GLM-5.3 |
| Go | 76% | 71% | GLM-5.3 |
| Python | 66% | 70% | Fable 5 |
| Rust | 70% | 85% | Fable 5 |
| Concurrencia y durabilidad | 62% | 45% | GLM-5.3 |
| Modelado y serialización | 79% | 88% | Fable 5 |
| Conformidad de protocolos | 44% | 55% | Fable 5 |
Traducido a decisiones: si tu stack es web o tus agentes tocan concurrencia, GLM-5.3 sobra. Si compilás Rust o manejás serialización crítica, ahí sí Fable justifica una mirada.
¿Qué tan parecidos son GLM-5.3 y Claude Fable 5?
Tanto que correr los dos suma poco. La correlación por tarea entre ambos es 0,65, la más alta de cualquier par medido en este conjunto: resuelven y fallan, en gran parte, las mismas tareas. Ambos resuelven 88 tareas; GLM-5.3 resuelve 11 que Fable no, Fable resuelve 7 que GLM no, y 7 les ganan a los dos. La unión cubre 106 de 113 tareas (93,8%), según el run propio de Together AI.
Para los que sueñan con un portafolio de modelos: emparejarlos aporta menos diversidad que combinar cualquiera de los dos con un modelo de la familia GPT. Cuando dos productos son sustitutos casi perfectos, te quedás con el barato. Es economía de primer año, pero aplica.
¿Cómo falla cada uno y cuál es más confiable?
Cada uno tiene su virtud. Fable 5 es un pelo más estable intento por intento: 82,0% de confiabilidad contra 78,8% de GLM, y resuelve más tareas cuatro de cuatro veces (56 contra 48). GLM-5.3 llega más lejos: cubre 87,6% de las tareas al menos una vez, contra 84,1% de Fable. Dicho rápido, GLM intercambia una pizca de estabilidad por alcance.
Los modos de falla son casi calcados, y esto es lo más interesante del estudio. Ambos rompen tests existentes en apenas 11% de sus fallos, muy abajo del 20% de la familia GPT, así que aceptar sus parches sin gates de regresión pesados resulta razonable. Cuando se equivocan, Fable comete errores grandes un poco más seguido (18% contra 16%) y GLM falla por poco más a menudo (61% contra 57%). Fallan “disciplinado”, los dos. Por eso correlacionan tanto.
GLM-5.3 vs Claude Fable 5: ¿conviene armar un routing?
Si igual querés usar los dos, el orden de la cascada favorece al barato como entrada. Correr GLM-5.3 primero y escalar a Fable solo cuando tu suite rechaza la respuesta llega a 81,1% de acierto a USD 10,74 por tarea: once puntos arriba de Fable solo (69,7%) a la mitad de su precio (USD 21,63). Para más detalles técnicos, mirá la comparativa anterior entre Opus y GLM.
Ahora bien, con esa correlación de 0,65 el beneficio de portafolio es limitado. La recomendación honesta del propio análisis es más simple: GLM-5.3 como default captura casi todo lo que Fable daría, a un quinto del costo, y Fable vale la escalada únicamente para trabajo intensivo en Rust o serialización crítica. ¿Y el router perfecto que elige el mejor modelo tarea por tarea? Existe en el estudio como límite teórico, no como producto que puedas instalar mañana.
¿Qué tan abierto es GLM-5.3 si es “open-weight”?
GLM-5.3 es un modelo open-weight desarrollado por Z.ai: los pesos se pueden descargar, así que se lo puede self-hostear o servir a través de proveedores de inferencia como Together AI. También se consume por API en Z.ai.
Ojo con confundir categorías: código abierto, pesos abiertos y API privada no son lo mismo. Y self-hostear un modelo de esta escala no tiene nada que ver con levantar un sitio en un hosting común como donweb.com: hablamos de clústeres de GPUs con costos de energía y operación que, para la mayoría de los equipos, siguen dejando a la API como el camino racional. Que exista la opción de bajar los pesos importa por soberanía de datos y poder de negociación, no porque vayas a montarlo en el sótano.
¿Qué significa esto para equipos de Latinoamérica?
Dos lecturas prácticas. Primera: la factura de IA en dólares deja de ser excusa. Un equipo que gasta USD 20.000 mensuales en Fable 5 para tareas de código podría bajar a unos USD 3.700 con GLM-5.3 manteniendo el nivel de acierto, siempre según estos números. Segunda: al ser open-weight, industrias reguladas como banca o salud ganan una ruta de despliegue privado que un modelo cerrado no ofrece. Habría que ver latencias y disponibilidad regional, que este estudio no mide.
Qué está confirmado y qué no
- Confirmado: los 904 rollouts y todos los porcentajes citados provienen del run que Together AI publicó sobre DeepSWE v1.1, con ambas configuraciones al máximo esfuerzo.
- Confirmado: los precios por rollout (USD 3,99 y USD 21,63) son los costos por trial que publicó Together AI, y la disponibilidad de GLM-5.3 por API en Z.ai y Together AI.
- Confirmado: GLM-5.3 es open-weight: sus pesos permiten self-hostearlo o servirlo a través de proveedores de inferencia como Together AI.
- Pendiente: la replicación fuera de DeepSWE y en otros proveedores; los JSON de trayectoria por turno del batch de GLM-5.3 no estaban en el CDN público al momento del análisis, un detalle que el propio estudio reconoce.
Errores comunes al elegir entre GLM-5.3 y Claude Fable 5
Elegir mirando solo el pass@1. El primer intento empata, y si cortás el análisis ahí vas a pagar 5,4 veces más por lo mismo. Las métricas con reintentos muestran ventaja clara de GLM-5.3, y en agentes con bucles de reintento eso es lo que importa.
Asumir que el modelo más caro es mejor. Fable 5 es la configuración más cara de todo el tablero de DeepSWE y aun así empata en precisión con un modelo que cuesta un quinto. El precio acá no compra calidad general; compra Rust y serialización. Ya lo cubrimos antes en cómo integrar Claude en Make.com.
Montar un routing de dos modelos sin mirar la correlación. Con 0,65, los dos fallan en gran parte en las mismas tareas. Tu cascada sofisticada va a escalar justo cuando el segundo modelo también va a tropezar. Chequeá correlación antes de sumar proveedores.
Confundir “open-weight” con código abierto. GLM-5.3 es open-weight: los pesos se pueden descargar y el modelo puede self-hostearse. Eso no lo vuelve software libre ni elimina el costo de operar tus propios clústeres de GPUs; si tu plan depende de self-hosting, contemplá esa infraestructura antes de comprometer arquitectura.
Preguntas Frecuentes
¿Cuál es la diferencia de costo entre GLM-5.3 y Claude Fable 5?
Según el run de Together AI, GLM-5.3 cuesta USD 3,99 por rollout y Claude Fable 5 USD 21,63, una brecha de 5,4 veces. Medido por resultado, GLM-5.3 resuelve 17 tareas por cada USD 100 gastados y Fable 5 solo 3.
¿Qué modelo es mejor para programar en Rust?
Claude Fable 5. Logra 85% en Rust contra 70% de GLM-5.3, la mayor brecha por lenguaje de la comparativa, y le suma ventaja en serialización de datos (88 contra 79). Fuera de Rust, GLM-5.3 gana en JavaScript, Go y TypeScript.
¿GLM-5.3 tiene el mismo rendimiento que Claude Fable 5 en DeepSWE?
En el primer intento, sí: 69,0% contra 69,7% de pass@1, dentro del margen de error. Con reintentos, GLM-5.3 supera a Fable en pass@2 (81,1% contra 77,1%) y pass@4 (87,6% contra 84,1%), y encima cubre más tareas en total.
¿Vale la pena pagar 5 veces más por Claude Fable 5?
Solo si tu carga es intensiva en Rust o serialización crítica de datos. Para el resto de las tareas de código, el análisis concluye que GLM-5.3 captura casi todo el valor a un quinto del costo. (Spoiler: para la mayoría, no vale.)
¿Cuándo conviene usar GLM-5.3 en lugar de Claude Fable 5?
Como default en la mayoría de los flujos: JavaScript, TypeScript, Go, concurrencia y cualquier pipeline sensible al costo. Reservá Fable 5 como escalada acotada para Rust y protocolos, donde su prima de precio sí compra algo concreto.
Conclusión
Lo que cambió en 2026 no es que un modelo abierto le ganó a uno cerrado: es que empató, y el empate ya alcanza. Cuando la calidad se iguala, la decisión se vuelve aritmética, y la aritmética dice USD 3,99 contra USD 21,63. Mi postura después de leer los números: GLM-5.3 como default, Fable 5 reservado para Rust y serialización, y ninguna prisa por pagar primas sin dato que las justifique. Con los pesos de GLM-5.3 ya descargables, la presión sobre los precios de las APIs cerradas va a seguir subiendo, y ese es un problema bueno de tener.
