GLM-5.3: lo que los números de Z.ai dicen realmente sobre el nuevo rey open-source del coding
TL;DR
- GLM-5.3 (lanzado el 14 de agosto de 2026) comparte modelo base con GLM-5.2: todos los mejoras vienen del post-training, no de un modelo nuevo. Aun así sube de 4.6 a 28.3 en Terminal-Bench 3.0 y de 46.2 a 66.9 en DeepSWE v1.1
- Es SOTA en CyberGym (84.5%), por delante de Mythos 5 (83.8%) y GPT-5.6 Sol (83.6%). Y no es solo benchmark: encontró 2.436 vulnerabilidades reales en 269 proyectos, 1.097 de severidad media-alta, con la más antigua datando de hace ~40 años
- Los pesos se publican dos semanas después del lanzamiento (pendientes de safety review al escribir esto), rompiendo el patrón MIT-inmediato de GLM-5.2
- En coste por tarea supera a Opus 4.8 en su benchmark interno con menos de la mitad de tokens de salida. Pero Fable 5 sigue por delante (39.5% vs 34.5%)
- Ya está en ClinePass con descuento. Si haces coding agéntico con presupuesto, es el candidato obvio a modelo por defecto; si tu carga es explotación de seguridad profunda, el frontier cerrado sigue ganando
Actualización (25 de agosto): el índice de Artificial Analysis lo confirma
Una semana después del lanzamiento, GLM-5.3 alcanzó 60 en el Artificial Analysis Intelligence Index, empatando con Kimi K3 y 7 puntos por encima de GLM-5.2. En la tabla de posiciones de AA quedó sexto. Cuando Z.ai libere los pesos (pendientes del safety review), será el modelo abierto empatado en cabeza. El registro de precios de la propia AA lo sitúa en 1,40$/4,40$ por millón de tokens de entrada/salida — frente a los ~15-20$ de los frontier cerrados que lo superan en el índice.
Contexto
Z.ai publicó GLM-5.3 el 14 de agosto. En r/LocalLLaMA el hilo de lanzamiento acumuló 1.585 puntos y 335 comentarios en cuatro días, y el subproducto que más ruido hizo fue Project Glasswing (565 puntos): el informe de 2.436 vulnerabilidades sin parchear encontradas en proyectos open source. La comunidad de Cline lo integró casi de inmediato en ClinePass.
Lo interesante del lanzamiento no es el salto de versión (0.1) sino la metodología: mismo base model, post-training más agresivo. Es la confirmación más clara hasta la fecha de que en 2026 la mejora ya no está solo en el pretraining.
Los números, benchmark por benchmark
Tomado del anuncio oficial de Z.ai. Tabla resumida (GLM-5.3 / GLM-5.2):
| Benchmark | GLM-5.3 | GLM-5.2 | Referencia cerrada |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 | GPT-5.6 Sol 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | GPT-5.6 Sol 72.7 |
| Terminal-Bench 2.1 | 88.2 | 81 | GPT-5.6 Sol 88.8 |
| FrontierSWE | 78.1 | 67.5 | Fable 5 88.2 |
| Agents’ Last Exam | 28.5 | 23.8 | GPT-5.6 Sol 28.6 |
Tres lecturas que se pierden en los titulares:
El salto de Terminal-Bench 3.0 es un 6x, no un incremento. De 4.6 a 28.3. Terminal-Bench 3.0 es la versión endurecida del benchmark (task images oficiales, verificador separado, 600 turnos máx, 10h de timeout), y GLM-5.2 sencillamente no la pasaba. Pasar de “falla casi todo” a “compite con GPT-5.6 Sol” con el mismo modelo base dice que el limitador era el post-training, no la capacidad.
Kimi K3 le pasa en varios sitios. En DeepSWE (67.5 vs 66.9), Terminal-Bench 2.1 (88.3 vs 88.2) y Toolathlon (76.5 vs 73). La narrativa de “mejor open de coding” es cierta en agregado del bloque coding, pero no es un dominio. El ranking de “mejor open” cambia según qué benchmark mires.
ExploitGym muestra el patrón incómodo. GLM-5.3 completa 105 tareas en 2h / 130 en 6h; Mythos 5 hace 181/247 y GPT-5.6 Sol 216/293. Cuanto más arriba en la cadena de explotación, más crece GLM-5.3 respecto a su antecesor — y más grande es el hueco con el frontier. Z.ai lo admite literalmente: “capability is growing fastest exactly where we are furthest behind.”
Eficiencia: el dato que importa a tu factura
Z.ai Code Bench es el benchmark interno (privado, 1.507 tareas, anti-cheat con whitelist de dominios y revisión LLM). Los números comparativos:
- GLM-5.3 Max effort: 34.5% de compleción con ~75K tokens de salida por tarea
- GLM-5.2 Max effort: 23.4% con 96K tokens
- Opus 4.8 High effort: 29.5% con 120K tokens — GLM-5.3 High le supera (31.4%) con 50K
- Fable 5 Max: 39.5%, aún fuera de alcance
Un modelo open que rinde más que Opus 4.8 gastando menos de la mitad de tokens de salida, con un precio de API muy por debajo, cambia el cálculo de cualquier pipeline agéntico. Si tu workload es “muchas tareas de coding medias”, el ahorro es directo. El benchmark es interno así que tómalo con el sesgo correspondiente, pero la dirección coincide con DeepSWE y Terminal-Bench, que son públicos.
Lo que de verdad es noticia: la capacidad cyber
Z.ai metió datos de descubrimiento de vulnerabilidades en el post-training esperando mejorar el análisis. Lo que obtuvieron, según su propio informe, fue un modelo que “began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains.”
La validación fuera de benchmark: equipos de seguridad en China corrieron el modelo contra codebases reales. Tras revisión experta y deduplicación: 2.436 vulnerabilidades en 269 proyectos, 1.097 de severidad media-alta, cubriendo kernels, motores de navegador, infraestructura open source y protocolos de red. La más antigua llevaba ~40 años en el código; la media de vida de una vulnerabilidad antes de descubrirse fue 26.6 años. Hay un ledger público de divulgación en curso.
Para un dev esto tiene dos caras:
- Defensiva: GLM-5.3 es probablemente la mejor herramienta open para auditoría de tu propio código. CyberGym 84.5% con la mitad de coste que un frontier cerrado es un argumento serio para integrarlo en CI como SAST de segunda opinión.
- Ofensiva: la misma capacidad está a dos semanas de estar en Hugging Face con pesos abiertos. Z.ai lo reconoce y por eso retrasa la publicación hasta completar el safety review. Es la primera vez que el retraso de pesos por razones de seguridad es el propio titular del lanzamiento.
Cuándo pesan los dos semanas
GLM-5.2 salió con pesos MIT casi inmediatamente. GLM-5.3 no: los weights llegan dos semanas después del lanzamiento, cuando acabe la evaluación de seguridad. Si tu stack depende de self-hosting (vLLM, llama.cpp), hoy solo tienes API y ClinePass. El anuncio dice “two weeks after launch”, así que la ventana es finales de agosto — verifica el estado real antes de planificar un despliegue alrededor.
Qué haría yo
- Coding agéntico diario con presupuesto (Cline, Claude Code harness): cambia el default a GLM-5.3 vía ClinePass o API. El benchmark interno de Z.ai es sesgado pero los públicos apuntan igual.
- Auditoría de seguridad propia: pruébalo contra tu código antes de pagar un pentest. Con 2.436 hallazgos reales validados, el false-positive rate parece bajo, pero revisa todo con criterio igualmente.
- Tareas de explotación profunda o chains largos: sigue en frontier cerrado. ExploitBench 54.4% vs 78.0% de Mythos 5 no es una brecha que cierres ahorrando en API.
- Esperar pesos si self-hosteas: dos semanas no cambian tu quarter, y evitan integrar una API que puede cambiar condiciones.
Fuentes
- Anuncio oficial GLM-5.3 — Z.ai (todos los números de benchmarks, metodología y el informe de vulnerabilidades)
- Hilo de lanzamiento en r/LocalLLaMA (1.585 puntos, 335 comentarios)
- Project Glasswing: 2.436 vulnerabilidades — r/singularity
- GLM-5.3 en ClinePass — r/CLine
- Contexto de la serie open: Open Source Catching Up — GLM-5.1 y Gemma 4