GLM-5.3 vs GPT-5.6 Sol en DeepSWE: quién conviene

“`html

En pocas palabras: En DeepSWE, GPT-5.6 Sol gana el tiro único con 72,7% de pass@1 contra 69,0% de GLM-5.3, pero cuesta el doble (USD 8,37 vs USD 3,99 por rollout). Con reintentos gana GLM-5.3 en pass@4 (87,6% vs 85,8%), y la mejor ruta es la cascada: 85,9% resuelto a USD 6,61.

En DeepSWE, GPT-5.6 Sol gana el primer intento por poco (72,7% contra 69,0% de GLM-5.3), pero sale el doble: USD 8,37 contra USD 3,99 por rollout. La cascada que arranca con GLM-5.3 y escala a Sol solo cuando los tests fallan llega al 85,9% de tareas resueltas a USD 6,61 cada una.

DeepSWE es un benchmark de ingeniería de software que evalúa modelos de IA sobre tareas reales de código y aprueba solo las soluciones que pasan una suite de tests oculta. La comparación entre GLM-5.3, el modelo open-weight de la familia GLM que desarrolla Z.ai, y GPT-5.6 Sol, el modelo insignia de OpenAI, la publicó Together sobre 904 rollouts: 113 tareas, cuatro intentos por lado, ambos a esfuerzo máximo.

En 30 segundos

  • Sol gana el tiro único: 72,7% de pass@1 contra 69,0% de GLM-5.3, una brecha de 3,7 puntos que entra dentro de un par de desvíos estándar.
  • Con reintentos, gana GLM-5.3: empate en pass@2 (81,1% vs 81,0%) y victoria en pass@4 (87,6% vs 85,8%).
  • El precio es 2,1x: USD 3,99 por rollout de GLM-5.3 contra USD 8,37 de Sol; por cada 100 dólares, GLM resuelve 17 tareas y Sol 9.
  • La cascada es lo mejor del tablero: GLM primero y Sol solo si los tests fallan — 85,9% de acierto a USD 6,61 por tarea.
  • Cada uno tiene su lenguaje: GLM-5.3 domina JavaScript (90% vs 75%) y Rust; Sol se lleva Python, Go y TypeScript.

GPT-5 es un modelo de lenguaje grande desarrollado por OpenAI, diseñado para generar texto, responder preguntas, razonar y asistir en tareas de programación. Fue lanzado en agosto de 2025.

¿Qué es DeepSWE y cómo evalúa a los modelos de IA?

DeepSWE es un benchmark que mide si un modelo sabe hacer ingeniería de software de verdad: le tira tareas sobre repositorios de código y lo aprueba únicamente si su diff pasa una suite de tests oculta. Esta comparativa usó las 113 tareas de DeepSWE v1.1 con cuatro intentos por configuración y los dos modelos a esfuerzo máximo, según el análisis de Together.

La métrica central es pass@k: te dice si al menos uno de k intentos resuelve la tarea. pass@1 premia al que clava de primera; pass@4 premia al que llega tarde pero llega. Acá está la clave de todo el duelo, porque los dos modelos invierten posiciones según cuántos intentos les des.

Un detalle de metodología que suma credibilidad: el scoring oficial excluye errores de infraestructura, y hubo poquísimos (1 de GLM-5.3, 2 de Sol), así que las cifras oficiales y las estrictas casi coinciden.

¿Y por qué debería importarte como developer? Porque reproduce tu día a día: el modelo entrega código, los tests deciden, y a veces el diff rompe cosas que ya funcionaban. Ese último caso es donde más se separan estos dos modelos, como vas a ver.

¿Cuál modelo es más preciso en el primer intento?

Si solo hay una bala, Sol es la mejor apuesta: 72,7% de pass@1 contra 69,0% de GLM-5.3 bajo el scoring oficial de DeepSWE. Son 3,7 puntos de ventaja que, según el propio análisis, entran dentro de un par de desvíos estándar, así que hablamos de una diferencia real pero no abismal. Te puede servir nuestra cobertura de qué cambia GPT-5.6 Sol en los planes Plus.

La confiabilidad confirma el perfil. Sol resuelve el 84,5% de sus tareas en los cuatro intentos, con 61 tareas perfectas de 4 sobre 4; GLM-5.3 queda en 78,8% y 48 tareas. Es el clásico especialista en precisión: toca un poco menos de terreno, pero lo que toca lo clava.

Ahora bien, fijate cómo falla cada uno, porque acá hay una sorpresa. Sol rompe tests que ya pasaban en el 20% de sus fallos, la firma regresiva típica de la familia GPT. GLM-5.3 lo hace en el 11%, y cuando falla suele fallar “hacia adelante”: el 61% de sus errores son near misses con el baseline intacto, contra 54% de Sol.

Traducción práctica: el modelo que cuesta el doble es el que más cosas rompe cuando falla (sí, en serio).

Si vas a aceptar diffs de Sol en producción, poné un gate de regresión completo antes de mergear. Con GLM-5.3 ese guardrail pesa menos, aunque nunca sobra.

¿Cuánto cuesta cada modelo por tarea resuelta?

GLM-5.3 cuesta USD 3,99 por rollout y GPT-5.6 Sol USD 8,37 a esfuerzo máximo: una relación de 2,1x a favor del modelo abierto. Medido en resultado, son 17 tareas resueltas por cada 100 dólares invertidos en GLM-5.3 contra 9 de Sol, según los registros por intento que publicó Together.

El tema es que esa prima compra algo concreto: velocidad. Sol promedia 19 minutos y 61 pasos por rollout contra 35 minutos y 124 pasos de GLM-5.3, y cierra cada tarea con unos 60 mil tokens de salida contra 80 mil del rival. Si un humano está esperando el resultado, la prima se paga sola. Si lo que espera es una cola de mil tareas overnight, GLM-5.3 es la compra obvia. Más contexto en nuestra guía de herramientas para desarrolladores.

Ponele que tenés trescientos refactors encolados para la noche: los mandás todos a GLM-5.3, el modelo se va por la ruta larga, quema 124 pasos y media hora por tarea, te resuelve la gran mayoría a menos de la mitad del precio, y a la mañana siguiente solo escalás a Sol los pocos casos que los tests rechazaron.

Ese escenario, ni más ni menos, es el argumento del routing.

MétricaGLM-5.3GPT-5.6 Sol
pass@1 (primer intento)69,0%72,7%
pass@281,1%81,0%
pass@487,6%85,8%
Costo por rolloutUSD 3,99USD 8,37
Tareas resueltas por USD 100179
Duración promedio35 min / 124 pasos19 min / 61 pasos
Confiabilidad (4/4)78,8% (48 tareas)84,5% (61 tareas)
Fallos que rompen tests previos11%20%
Cobertura combinada del dúo106 de 113 tareas (93,8%)
glm-5.3 vs gpt-5.6 sol deepswe diagrama explicativo

¿Qué lenguaje de programación gana con cada modelo?

Ninguno gana en todo: GLM-5.3 domina JavaScript y Rust; Sol, Python, Go y TypeScript. El número destacado es el JavaScript de GLM-5.3, 90% contra 75% de Sol, el mejor registro de cualquier modelo en el tablero. En Rust también gana el abierto (70% contra 60%), mientras que Sol responde con Python (74% contra 66%), Go (79% contra 76%) y TypeScript (66% contra 61%).

La regla de ruteo que deja el estudio es simple: JavaScript y Rust van a GLM-5.3, el resto a Sol, con GLM-5.3 como segunda opción barata en casi todo lo demás. Si hoy le estás pagando precio premium a un solo proveedor para que escriba JavaScript, los números te están diciendo algo.

Por tipo de tarea el tablero queda 4 a 4. Sol domina el trabajo de sistemas y contratos exactos: modelado de datos y serialización (92%), tooling de build y operaciones (73%), concurrencia y durabilidad (72%) y conformancia de protocolos (59%). GLM-5.3 se lleva lenguajes de query y configuración (88%, la celda más alta del tablero), internals de lenguaje y runtime (83%) y reactividad con estado (73%), y empata 64 a 64 en análisis de programas.

Ojo con un detalle: la clasificación por dominio la hizo un LLM leyendo cada prompt del benchmark, así que tomala orientativa. Y el punto flaco de GLM-5.3 es clarísimo: conformancia de protocolos, 44%, quince puntos detrás de Sol. Si tu mundo son parsers de protocolos y contratos estrictos de red, pensalo dos veces antes de migrar.

¿Cuál modelo conviene si permito reintentos?

Con reintentos, el orden se da vuelta. En pass@2 ya empatan (81,1% de GLM-5.3 contra 81,0% de Sol) y en pass@4 gana el modelo abierto (87,6% contra 85,8%). Su cobertura explica el dato: toca el 87,6% del benchmark al menos una vez contra 85,8% de Sol, aunque convierte un poco menos por intento. Relacionado: el nuevo agente de Jira en Copilot.

Para pipelines batch, procesos nocturnos y cualquier flujo best-of-k, GLM-5.3 es la elección más precisa y la más barata por intento. Para flujos interactivos, donde cada reintento es una persona mirando un spinner, quedate con Sol y su paso corto de 61 pasos promedio.

Resumiendo el pass@k: GLM escala, Sol clava.

¿Cómo funciona el routing en cascada entre GLM-5.3 y GPT-5.6 Sol?

La mecánica es simple: mandás la tarea primero a GLM-5.3, corrés tu suite de tests sobre el diff, y solo si los tests rechazan la solución escalás a GPT-5.6 Sol. Como los dos modelos divergen de verdad (correlación de 0,43 por tarea), ese segundo intento independiente rescata buena parte de los casos difíciles.

Los números de la cascada GLM-primero: 85,9% de tareas resueltas a USD 6,61 promedio. Son trece puntos más que Sol solo (72,7%) y todavía sale más barato que un único rollout de Sol (USD 8,37), porque el modelo abierto limpia la mayor parte de la cola a mitad de precio y el resto duro recibe un segundo intento fresco (trece puntos enteros, nada menos).

¿Y contra un router perfecto de un solo disparo? También gana: el “oráculo” hipotético que siempre elige al modelo correcto llega a 83,8%, menos que la cascada. Dos intentos independientes le ganan a una elección perfecta única.

El orden importa para el bolsillo, no para el acierto: arrancar con Sol y escalar a GLM da la misma precisión esperada pero a USD 9,47 por tarea. Arrancá siempre por el barato.

Eso sí: la cascada exige un verificador automático confiable, y eso significa tests que corran sobre cada diff y un pipeline que decida la escalada. Sin tests, esto no funciona. Lo explicamos a fondo en comparativa de Fable 5 frente a Kimi K3.

¿Qué significa la correlación de 0.43 entre los modelos?

Una correlación de 0,43 por tarea significa que, pese a parecerse en los agregados, los dos modelos aciertan y fallan en lugares distintos. Juntos cubren 106 de las 113 tareas (93,8%): ambos resuelven 90, GLM-5.3 resuelve 9 que Sol no puede, Sol resuelve 7 únicas, y 7 tareas les ganan a los dos.

Lo llamativo es hacia dónde corre el desacuerdo fuerte: GLM-5.3 barre cuatro de cuatro dos tareas que Sol nunca resuelve (koota-pair-relation-tracking y participle-grammar-conflict-analysis), mientras que Sol no barre ninguna donde GLM-5.3 queda en cero. GLM-5.3 llega adonde Sol no llega.

Para equipos multi-modelo el mensaje es directo: atarse a un solo proveedor te deja afuera de casi el 7% del tablero.

Si querés profundizar en el rendimiento de Claude Fable 5 en DeepSWE, tenemos un artículo que analiza su costo frente a GLM 5.3.

Tres errores comunes al elegir entre GLM-5.3 y GPT-5.6 Sol

  • Elegir solo mirando el pass@1. El 72,7% de Sol brilla en el titular, pero en cuanto permitís dos intentos el empate es total y con cuatro gana GLM-5.3. Si tu flujo tolera reintentos, estás pagando el doble por una métrica que no usa.
  • Aceptar diffs de Sol sin gate de regresión. Uno de cada cinco fallos de Sol rompe tests que ya pasaban. Sin una corrida completa de regresión antes de mergear, ese 20% lo termina pagando tu equipo.
  • Comparar scorecards distintos como si fueran la misma carrera. Estos números salen de una corrida específica: 113 tareas, cuatro intentos, análisis a nivel índice (los JSON de trayectoria de GLM-5.3 no estaban en el CDN público al momento). Otras tablas pueden dar cifras distintas; el leaderboard de DeepSWE v1.1 se actualiza aparte.
  • Mandarle JavaScript a Sol. Es pagar 2,1x por quince puntos menos de rendimiento en ese lenguaje. El ruteo por lenguaje es gratis y acá rinde.

Preguntas Frecuentes

¿Cuál es la diferencia principal entre GLM-5.3 y GPT-5.6 Sol en DeepSWE?

GPT-5.6 Sol gana el primer intento (72,7% contra 69,0% de pass@1), es más del doble de rápido y más confiable (61 tareas perfectas contra 48). GLM-5.3 cuesta la mitad (USD 3,99 contra USD 8,37 por rollout), gana con reintentos (pass@4: 87,6% contra 85,8%) y tiene el mejor JavaScript del tablero (90%).

¿Cuánto cuesta cada modelo por tarea de coding?

Según los datos publicados por Together, un rollout de GLM-5.3 cuesta USD 3,99 y uno de GPT-5.6 Sol USD 8,37 a esfuerzo máximo. Por cada 100 dólares gastados, GLM-5.3 resuelve 17 tareas y Sol 9. La cascada GLM-primero queda en USD 6,61 promedio por tarea resuelta.

¿Cuál modelo es mejor para JavaScript y cuál para Python?

GLM-5.3 es mejor en JavaScript: 90% contra 75% de Sol, el mejor número de cualquier modelo en el benchmark. En Python gana Sol: 74% contra 66%. Completan el mapa: Sol lidera Go (79% vs 76%) y TypeScript (66% vs 61%), y GLM-5.3 se lleva Rust (70% vs 60%).

¿Vale la pena el cascade routing entre GLM-5.3 y Sol?

Sí, si tenés tests automatizados que verifiquen cada respuesta. La cascada GLM-primero alcanza 85,9% de acierto a USD 6,61 por tarea, superando a Sol solo (72,7% a USD 8,37) y hasta a un router oráculo perfecto (83,8%). Sin verificador automático, la estrategia no funciona.

¿Qué es DeepSWE y por qué importa para developers?

DeepSWE es un benchmark de ingeniería de software que evalúa modelos sobre tareas reales de código, aprobadas solo si pasan suites de tests ocultas. Importa porque mide el flujo exacto de un developer asistido por IA: el modelo produce un diff y los tests deciden si sirve, incluyendo si rompió algo que ya funcionaba.

Conclusión

Lo que dejó este duelo es simple: el tier abierto llegó al borde del frontier. GLM-5.3 quedó a 3,7 puntos de GPT-5.6 Sol en tiro único, lo superó con reintentos, tiene el mejor JavaScript del tablero y cuesta menos de la mitad. Esa combinación cambia la ecuación de costos de cualquier equipo que corre agentes de código a volumen.

  • Si un humano espera la respuesta, Sol justifica su prima en latencia y confiabilidad.
  • Si espera una cola overnight, GLM-5.3, sin dudarlo.
  • Si tenés tests automatizados, la cascada GLM-primero te da más cobertura que el flagship a menor precio por tarea.
  • Sea cual sea el modelo, gate de regresión antes de mergear: con Sol es obligatorio, con GLM-5.3 es buena higiene.

Mi lectura después de quince años viendo benchmarks pasar: el dato más valioso acá no es ningún porcentaje, es la correlación de 0,43. Mientras dos modelos buenos fallen distinto, el routing va a seguir rindiendo más que la fidelidad a una sola marca.

Fuentes

Desplazarse hacia arriba