Radar IA Julio 2026, Semana 4-5: GPT-5.6 recorta precios 80%, Opus 5 arrasa en coding, Kimi K3 aterriza con 2.8T parámetros
Resumen ejecutivo
Las últimas dos semanas de julio han sido de los movimientos más agresivos del mercado de modelos en todo el año:
- OpenAI recortó precios de GPT-5.6 Luna (-80%) y Terra (-20%) a solo tres semanas del lanzamiento. Luna cae a $0.20/$1.20 por 1M tokens. Sol recibe modo Fast (2.5x velocidad, 2x precio).
- Anthropic lanzó Claude Opus 5 (24 julio), nuevo #1 en el Intelligence Index (61.0) y state-of-the-art en coding agéntico — Frontier-Bench 43.3%, más del doble que Opus 4.8.
- Moonshot AI soltó Kimi K3: 2.8T parámetros, pesos abiertos, $3/$15 por 1M tokens. Primer modelo chino que empata con frontier models americanos en múltiples benchmarks.
- GLM-5.2 (Z.AI) mantiene el #1 open-weights en Artificial Analysis Intelligence Index v4.1 con score 51.
- Codex con GPT-5.6 Sol consolidado como “powerhouse” según reportes comunitarios. Coding Agent Index: 80.
El patrón es inequívoco: guerra de precios + eficiencia agéntica. Los modelos frontier se acercan en capacidad mientras los costes colapsan. Para devs, la ventana para lock-in con un único provider se cierra.
Modelos
OpenAI GPT-5.6: recorte de precios histórico
A tres semanas del GA de GPT-5.6, OpenAI anunció recortes agresivos el 30 de julio:
| Variante | Precio anterior | Precio nuevo | Cambio |
|---|---|---|---|
| Luna | $1.00/$6.00 | $0.20/$1.20 | -80% |
| Terra | $2.50/$15.00 | $2.00/$12.00 | -20% |
| Sol | $5.00/$30.00 | sin cambio | + modo Fast |
Además, Sol Fast mode: hasta 2.5x más rápido a 2x el rate. Sam Altman confirmó los números directamente. Los recortes se aplican automáticamente en Codex y ChatGPT Work — sin cambios de cuenta.
Qué significa: Para workloads de alta frecuencia (Luna) y balanced (Terra), el coste real se desploma. Un pipeline que antes costaba $100/día en Luna ahora cuesta $20. Los equipos que evaluaron GPT-5.6 hace 2 semanas deben recalcular: el TCO cambió drásticamente. El modo Fast de Sol ataca directamente el caso de uso de Codex como coding agent en tiempo real.
Claude Opus 5: nuevo #1 en el Intelligence Index
Anthropic lanzó Opus 5 el 24 de julio. Datos clave:
- Intelligence Index: 61.0 — #1 global, superando a Fable 5 (max) y GPT-5.6 Sol (max)
- Frontier-Bench v0.1: 43.3% — más del doble que Opus 4.8 (anterior SOTA en esta suite)
- ARC-AGI-3: 30.2% — ~3x el siguiente mejor modelo
- Pricing: $5/$25 por 1M tokens — la mitad que Fable 5 ($10/$50)
- Effort toggle: low/medium/high para intercambiar coste por capacidad por request
- Es el default model en Claude Max y el más fuerte en Claude Pro
Opus 5 no supera a Fable 5 en las tareas de coding más extremas (SWE-bench Pro), pero en agentic-coding general y knowledge work establece el nuevo estado del arte.
Qué significa: Opus 5 es el nuevo workhorse diario. Para equipos que usaban Fable 5 para todo, Opus 5 ofrece ~95% de la capacidad a la mitad del precio. El effort toggle es relevante: la mayoría de tareas no necesitan high-effort, y el ahorro en medium/low es significativo. Si tu stack dependía de Sonnet 5 para tareas cotidianas, Opus 5 lo reemplaza con salto cualitativo.
Kimi K3: el gigante chino de 2.8T parámetros
Moonshot AI lanzó Kimi K3 el 16 de julio:
- 2.8 trillones de parámetros — MoE, pesos abiertos desde el 27 de julio
- Pricing API: $3/$15 por 1M tokens
- Disponible en Kimi app, Kimi Work (desktop), Kimi Code (CLI) y API desde día 1
- Empata con modelos frontier americanos en múltiples benchmarks según NYT
Qué significa: Kimi K3 es el primer modelo chino que no es “bueno para ser open-weights” sino directamente competitivo con frontier. Para devs con restricciones de soberanía de datos o que operan en mercados asiáticos, K3 ofrece una alternativa real. Los pesos abiertos permiten self-hosting, aunque los requisitos de hardware (2.8T params) lo limitan a organizaciones con infraestructura seria. La CLI (Kimi Code) lo posiciona como competidor directo de Claude Code y Codex.
GLM-5.2: consolida el liderazgo open-weights
GLM-5.2 (Z.AI) mantiene el #1 open-weights en el Artificial Analysis Intelligence Index v4.1 con score 51. Arquitectura: 744B params (40B activos), contexto de 1M tokens, licencia MIT.
En el top open-weights: GLM-5.2 (51) > MiniMax-M3 (44) = DeepSeek V4 Pro Reasoning (44) > Kimi K2.6 (35).
Qué significa: GLM-5.2 es el modelo open-weights de referencia para 2026. La combinación de score competitivo, MIT license y contexto de 1M lo hace la opción más pragmática para self-hosting de LLMs frontier-grade. La debilidad: eficiencia de tokens por debajo de competidores (26k output tokens vs 24k MiniMax-M3), lo que encarece el coste por tarea en inferencia local.
Herramientas
Codex + GPT-5.6 Sol: el coding agent que pega fuerte
La comunidad r/OpenAI reporta que “Codex with GPT-5.6 Sol Ultra is a powerhouse, doing things I never thought possible this early.” El Coding Agent Index de Artificial Analysis sitúa a Sol (max) en 80 puntos, segundo solo a Claude Fable 5 (max).
OpenAI además anunció Realtime Voice para Codex — los usuarios pueden hablar con el agente mientras programa, marcando la convergencia entre coding agents y interfaces multimodales.
Qué significa: El coding agent ya no es un IDE plugin, es un compañero conversacional con voz. Codex + Sol compite directamente con Claude Code + Opus 5. Para devs que deciden su stack de coding agent en agosto 2026, la pregunta ya no es “¿funciona?” sino “¿cuál me cuesta menos en mi workload real?”. La respuesta depende del patrón de uso: Sol gana en velocidad (modo Fast), Opus 5 gana en reasoning complejo.
Coding agents: actualizaciones cruzadas
Todos los coding agents principales actualizaron sus webs/blogs esta semana (detección por competitor monitoring):
- Claude Code: changelog activo, website + blog actualizados
- OpenAI Codex: website + blog actualizados (probablementeVoice rollout + Sol Fast)
- Cursor: website + blog actualizados
- Windsurf: website + blog actualizados
Qué significa: La carrera se acelera. Todas las herramientas principales están en ciclo de updates continuos. Para devs, esto significa que la lock-in a una herramienta se vuelve más arriesgada — las features se igualan rápido. La estrategia más sólida: mantener workflows tool-agnostic (reproducibles en Claude Code, Codex o Cursor).
Open Source Tax Engine: el outlier que sorprende
Un post en r/OpenAI reporta un “Open Source Tax Engine outperforming GPT Sol and Fable 5” en dominios especializados (tax reasoning). Sin confirmación oficial ni benchmark público todavía.
Qué significa: Los modelos especializados de dominio empiezan a superar a los generalistas frontier en sus nichos. Esto es relevante para devs que trabajan en sectores verticales: no necesitas un frontier model si un modelo especializado lo hace mejor y más barato. Tendencia a vigilar.
Benchmarks y datos
Intelligence Index: top 5 global (julio 2026)
| # | Modelo | Score | Tipo |
|---|---|---|---|
| 1 | Claude Opus 5 (max) | 61.0 | Propietario |
| 2 | Claude Fable 5 (max) | ~59 | Propietario |
| 3 | GPT-5.6 Sol (max) | ~58 | Propietario |
| 4 | GLM-5.2 | 51 | Open-weights |
| 5 | MiniMax-M3 | 44 | Open-weights |
Coding Agent Index: Sol a la cabeza
| Modelo | Score | Fuente |
|---|---|---|
| GPT-5.6 Sol (max) | 80 | AA Coding Agent Index |
| Claude Fable 5 (max) | ~79 | BenchLM |
| Claude Opus 5 (max) | ~77 | BenchLM |
GPT-5.6 Sol lidera en agentic-coding con Terminal-Bench 2.1 (88.8%) y BrowseComp (92.2%), quedando a 1 punto de Fable 5 en el Intelligence Index general.
Atención en Reddit (14 días)
Menciones por modelo/tema:
- GPT: 65 menciones
- Claude: 64 menciones
- Opus: 36 menciones (subida fuerte tras lanzamiento)
- Codex: 30 menciones
- Kimi: 27 menciones (pico por K3)
- Gemini: 24 menciones
- DeepSeek: 20 menciones
- Llama: 13 menciones
Qué significa: La conversación se polariza entre GPT y Claude, con Opus 5 como driver de atención para Anthropic. Kimi K3 generó pico de menciones en la semana de lanzamiento. DeepSeek y Llama pierden tracción frente a los nuevos open-weights chinos (GLM-5.2, K3).
Precios frontier: tabla comparativa (31 julio 2026)
| Modelo | Input/1M | Output/1M | Notas |
|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | Recortado -80% |
| DeepSeek V4 Flash | $0.14 | $0.28 | Estable, más barato |
| GPT-5.6 Terra | $2.00 | $12.00 | Recortado -20% |
| Claude Sonnet 5 | $2.00 | $10.00 | Promo activa |
| DeepSeek V4 Pro | $1.50 | $4.50 | Estable |
| Kimi K3 | $3.00 | $15.00 | Nuevo |
| GPT-5.6 Sol | $5.00 | $30.00 | Estable + Fast mode |
| Claude Opus 5 | $5.00 | $25.00 | Nuevo |
| Claude Fable 5 | $10.00 | $50.00 | Estable |
Qué significa: DeepSeek V4 Flash sigue siendo el más barato por token para workloads masivos. Pero GPT-5.6 Luna tras el recorte ($0.20/$1.20) lo acerca peligrosamente. Para razonamiento, Opus 5 ($5/$25) ofrece mejor relación calidad-precio que Fable 5 ($10/$50) o Sol sin Fast ($5/$30).
Tendencias
La guerra de precios se acelera
OpenAI recortando precios 80% a 3 semanas del lanzamiento es un movimiento sin precedentes. Forbes lo contextualiza: los recortes de precios suelen llegar meses después del lanzamiento. Esto señala presión competitiva real — Anthropic, Google y los open-weights chinos están forzando a OpenAI a competir en coste, no solo en capacidad.
Qué significa: El coste de los modelos frontier va a seguir bajando. Los equipos que diseñan arquitecturas alrededor de un coste fijo de API deben asumir que ese coste se reduce 30-50% cada trimestre. Planificar para precios a la baja, no para el precio actual.
Codex Realtime Voice: el agente habla
OpenAI empezó a desplegar voz en tiempo real para Codex. Los coding agents dejan de ser texto-only: ahora hablas con ellos mientras programas.
Qué significa: La interfaz del coding agent converge con la del asistente conversacional. Esto cambia el patrón de uso: en lugar de escribir prompts largos, el dev describe lo que quiere verbalmente mientras revisa el código generado. Requiere ajustar workflows y expectativas.
Open-weights chinos como categoría
GLM-5.2, MiniMax-M3, DeepSeek V4 Pro y ahora Kimi K3 (2.8T) forman ya una categoría consolidada de open-weights chinos competitivos con frontier americanos. NYT lo califica como amenaza directa al liderazgo estadounidense.
Qué significa: Para devs fuera de China, el acceso a estos modelos via API (Z.AI, DeepSeek API) o self-hosting ofrece soberanía de datos y costes bajos. El trade-off: disponibilidad, latencia y soporte. Pero técnicamente, la brecha se ha cerrado.
Qué leer esta semana
- OpenAI — Advancing the price-performance frontier with GPT-5.6 — openai.com. Detalles oficiales de los recortes de Luna y Terra + Sol Fast mode.
- Anthropic — Introducing Claude Opus 5 — anthropic.com. El lanzamiento oficial con scores de Frontier-Bench, ARC-AGI-3 y effort toggle.
- Artificial Analysis — GLM-5.2 leading open weights — artificialanalysis.ai. Análisis del #1 open-weights con datos de eficiencia de tokens.
- NYT — China’s Moonshot AI Unveils Kimi Model — nytimes.com. Contexto geopolítico del lanzamiento de K3 y su impacto en la carrera de IA.
- The Agent Report — GPT-5.6 Sol, Terra, Luna benchmark analysis — the-agent-report.com. Desglose completo de benchmarks agénticos por variante.
Próximo radar: 7 de agosto de 2026. RSS para actualizaciones semanales.