GPT Diffusion

Radar IA agosto 2026, semana del 11 al 15: cuatro releases abiertos en un mes, guerra de precios GLM/Kimi, y los números agénticos de DeepSeek que nadie ha verificado

2026-08-15 · editorial

Qué pasó

  • Cuatro releases abiertos de primer nivel en menos de un mes. Kimi K3 (Moonshot), Qwen 3.8 (Alibaba, en variantes desde la 27B hasta la 2.4T-A95B), GLM-5.3 (Zhipu) y DeepSeek V4 Pro “0813” han aterrizado entre mediados de julio y esta semana. No es un accidente ni una casualidad del calendario: es un ritmo. El ciclo de releases abiertos chinos pasó de trimestral a mensual, y esta semana la comunidad lo ha notado de forma explícita — el hilo recopilatorio de r/LocalLLaMA llevaba casi 200 puntos de score cuando lo capturamos. La 27B de Qwen, de hecho, ya tiene análisis completo en este sitio: Qwen 3.8-27B, análisis a fondo, con una conclusión incómoda para quien re-cuantiza a lo loco: hay reports creíbles de que la 27B es casi indistinguible de la 3.6-27B.

  • DeepSeek V4 Pro 0813: los números agénticos siguen siendo solo del vendor. Esta es la señal más útil de la semana, y viene de comprobarlo uno mismo. A día 3 de los 7 que dura la ventana post-GA, no existe ni una sola evaluación agéntica independiente del 0813. Los +49.9 puntos que DeepSeek presume en DeepSWE son corridas del propio vendor, con un harness que no se ha publicado y contra un baseline que eligieron ellos: su propio preview. El índice de Artificial Analysis lo sitúa en 57 (#8, max effort), por detrás de GPT-5.6 Sol (61), Kimi K3 (60), Claude Opus 5 (59) y GPT-5.6 Sol xhigh (59). Detalle que circuló como “pesos MIT liberados”: los 893GB que aparecieron aplican al preview de abril, no al 0813. El 0813 no ha publicado pesos. Fuente: Artificial Analysis

  • Guerra de precios GLM/Kimi. GLM-5.2 baja a $0.50/$3.15 por 1M (input/output), estabilizándose tras el spike ~10x que subió desde $0.29; GLM-5.1 se queda a $1.4/$4.4 y Kimi K2.6 a $0.95/$4.0. Grok 4.6 debuta en catálogo a $2.0/$6.0. La guerra no es por features: es por el coste de routing, y los dos bandos son abiertos o casi. Fuente: Artificial Analysis, registro de precios en leaderboard-history.

  • OpenCode “Operation Cheapseek” y GLM-5.3 en ClinePass. OpenCode lanzó una campaña de enrutado agresivo hacia modelos baratos con ese nombre, y GLM-5.3 ya está disponible en ClinePass. Mientras, Windsurf —que ahora es Devin— integra Kimi K3, Claude Opus 5 y GPT-5.6 en Devin Desktop y estrena “Stacked PRs” y “Devin Outposts”. Fuente: windsurf.com/blog

  • El ranking AA está apretado arriba y con hueco abajo. GPT-5.6 Sol (max) 61, Kimi K3 60, GPT-5.6 Sol xhigh 59 y Claude Opus 5 59, DeepSeek V4 Pro 0813 en 57, con GLM-5.2 (52) y Nemotron 3 Ultra (52) pisando el top-10. Nueve puntos separan el líder del modelo a un quinto del precio. Fuente: Artificial Analysis

  • La conversación pública se movió a “quién verifica”. Los hilos con más tracción de la semana —los megathreads de releases en r/LocalLLaMA y el “Google needs to up their game” de r/singularity— giran alrededor de benchmarks y marketing, no de demos. Es la primera semana que recuerdo donde el meta-debate (¿esta cifra es del vendor o de un tercio?) genera más comentarios que los propios lanzamientos. Fuente

Por qué importa

El ritmo mensual rompe la asunción de “versión estable”. Si despliegas modelos self-hosted, “el último de Qwen” pasa de ser una decisión de arquitectura a ser una decisión de mantenimiento. Cada pocas semanas hay candidato a actualizar, y esta misma semana hay evidencia de que la actualización no siempre es una mejora: reports de que la 3.8-27B es prácticamente la 3.6-27B significan que re-cuantizar, re-evaluar y re-desplegar puede producir exactamente el mismo modelo con otra fecha. El coste de actualización sin beneficio es coste puro. La respuesta no es dejar de actualizar: es congelar versiones en producción y evaluar en staging con tu propio harness, no con el del anuncio.

La lección DeepSeek es la misma de siempre, pero ahora con fecha de caducidad. El 0813 presume +49.9 puntos en DeepSWE y ninguna eval independiente existe a día 3 de 7 de ventana. Esto no es coyuntural: es el patrón de todos los lanzamientos agénticos de 2026. El vendor corre su benchmark, contra su baseline, con su harness. El índice de AA —que al menos es metodología consistente— lo pone 4 puntos por debajo del líder, y esos 4 puntos valen exactamente lo que valga su metodología. La diferencia entre 57 y 61 en tu workload puede ser cero o puede ser enorme; nadie lo sabe aún. La ventana de verificación cierra el 19 de agosto: si para entonces sigue sin réplicas independientes, el +49.9 se queda en marketing.

La guerra de precios ya no es entre abiertos y frontier: es dentro de los abiertos. GLM-5.2 a $0.50/$3.15 con un índice de 52 significa que hay un modelo a 9 puntos del líder que cuesta una fracción de él. Para todo el trabajo no-agéntico —síntesis, extracción, clasificación, primera pasada de código— la pregunta ya no es “¿puedo permitirme un modelo decente?” sino “¿qué excusa tengo para pagar 10x más?”. OpenCode empujando el routing barato con nombre de campaña y GLM-5.3 entrando en ClinePass son síntomas del mismo movimiento: la capa de herramientas compite por precio de routing, no por features.

El “quién verifica” es la nueva alfabetización del sector. Cuando el debate público se mueve de las demos a la procedencia de los benchmarks, algo cambia en cómo se decide. Si escribes sobre modelos —o decides presupuestos basándote en lo que lees— citar la fuente del número y si es vendor-run o independiente pasa de ser pedantería a ser la mínima higiene. La semana que METR documentó gaming de benchmarks en GPT-5.6 Sol ya avisamos de esto; ahora la desconfianza es default en la comunidad, no una posición marginal.

A quién afecta

  • Devs con pipelines self-hosted: el ritmo mensual os afecta directamente. Congelad versiones en producción, automatizad la eval en staging, y no re-cuanticéis por reflejo. Antes de tocar nada: verificad si el release nuevo es sustancialmente distinto del anterior (caso 3.8-27B vs 3.6-27B) o vais a pagar coste de migración por nada.

  • Equipos con cargas agénticas evaluando DeepSeek V4 Pro 0813: no migréis nada basándoos en el gráfico del anuncio. Esperad a OSWorld 2.0 u otra eval de terceros, o correed vuestra propia réplica. La ventana cierra el 19 de agosto; esperadla.

  • Quien paga facturas de API por volumen: GLM-5.2 a $0.50/$3.15 es probablemente el mejor ratio calidad/€ del mercado para trabajo no-agéntico. Kimi K2.6 a $0.95/$4.0 y GLM-5.1 a $1.4/$4.4 completan la gama. Recalculad el routing: la diferencia anual entre enrutar síntesis masiva al líder del ranking o a GLM-5.2 es un cero en la factura.

  • Usuarios de OpenCode, Cline, Devin/Windsurf: la capa de herramientas se está reorganizando alrededor del precio del modelo subyacente. Probad el routing barato en tareas rutinarias y medid: si la calidad no baja de forma perceptible en vuestro caso, el “modelo caro por defecto” ha dejado de justificarse para esas tareas.

  • Quien escribe comparativas o elige por benchmarks: citad siempre si el número es vendor-run o independiente. Vuestra credibilidad (y la decisión de quien os lee) depende de esa distinción más que del número mismo.

Qué haría yo

  1. Congelar versiones self-hosted y automatizar la eval. Especificaría el modelo por versión exacta (no “qwen latest”) en todos los pipelines, y montaría un harness propio mínimo que corra en staging ante cada release. Con ritmo mensual, la eval manual no escala; la congelación sin eval tampoco. Ambas cosas juntas sí.

  2. No tocar el 0813 hasta el 19. Ni migrar cargas agénticas ni descartarlo. A la espera de la eval independiente; si no llega, la decisión cae del lado de la prudencia. El coste de esperar una semana es cero; el coste de migrar sobre números del vendor puede ser un incidente.

  3. Recalcular el routing con precios de esta semana. Pasaría todo el trabajo no-agéntico de volumen (síntesis, extracción, resúmenes) por GLM-5.2 y mediría calidad con una muestra real de mi tráfico antes y después. Con $0.50/$3.15, el experimento cuesta casi nada y el ahorro potencial es grande.

  4. Probar el routing barato de OpenCode/GLM en tareas rutinarias de agentes. Tareas de bajo riesgo (búsqueda, clasificación, drafts de código) al modelo barato; revisión y decisiones al caro. Es la arquitectura drafter-reviewer aplicada al pricing, y esta semana es más barata que la pasada.

  5. Documentar la procedencia de cada benchmark que cite. Un prefijo simple —“vendor-run” o “independiente”— en cada cifra. Cuesta dos palabras y separa el análisis de la propaganda.

Señales que estoy vigilando

  • Ventana de verificación del DeepSeek V4 Pro 0813 (cierra el 19 de agosto). Si aparece una eval agéntica independiente y confirma los números, cambia el ranking de la gama alta abierta. Si no aparece, el +49.9 queda como marketing documentado — y eso también es una conclusión publicable.

  • Rumor: Qwen 3.8-35BA3B. Ha aparecido un posible avistamiento de una variante 35B-A3B en la familia 3.8. Insisto en el condicional: es un rumor, sin confirmación de Alibaba ni pesos visibles. Si se confirma, llenaría el hueco entre la 27B y la Max — el tamaño dulce para self-hosting serio en una sola máquina. Si no, ruido. Fuente

  • Fine-tunes “heretic” de la comunidad sobre la Qwen3.8-27B. La comunidad local está publicando fine-tunes que retocan el alignment de la 27B para uso sin filtros en casa — el hilo de r/LocalLLaMA con el “Opus 4.6 local” a base de Qwen3.8-27B tuneada llevaba score 530. No es mi caso de uso, pero es un indicador temprano de dos cosas: que la 27B tiene tracción real como base local, y que el ecosistema de fine-tunes se mueve a días del release, no a meses. Fuente


Próximo radar: 22 de agosto de 2026. RSS para actualizaciones semanales.