GPT Diffusion

Kimi K3: el primer modelo open-weight que compite de tú a tú con la frontera cerrada

2026-08-07 · Devs #kimi#open-weights#frontier-models#benchmark#llm#costes

TL;DR

  • Moonshot AI lanzó Kimi K3 el 16 de julio de 2026: 2.8T parámetros en sparse MoE (16 de 896 expertos activos), ventana de contexto de 1M de tokens, visión nativa y “thinking mode” siempre activo.
  • Pesos abiertos publicados el 26 de julio bajo la Kimi K3 License. Es el modelo open-weight más grande jamás lanzado (~594 GB en MXFP4).
  • Precios hosted: $3/$15 por millón de tokens (input/output), con input cacheado a $0.30. Eso es triple que K2.6 pero ~40% menos que GPT-5.6 Sol ($5/$30).
  • Independence testing: 57.1 en el Intelligence Index v4.1 de Artificial Analysis (cuarto global), #1 en AutomationBench (53 puntos), #1 en Frontend Code Arena.
  • Cuándo interesa: pipelines de agentes con contexto largo, coding sobre repositorios grandes, y equipos que necesitan pesos abiertos sin sacrorrar capacidad.

Qué es Kimi K3

Kimi K3 es el modelo flagship de Moonshot AI, la empresa china que arrancó como spin-off research. A diferencia de las generaciones anteriores de Kimi —que competían en precio—, K3 apunta directamente a la frontera de capacidad. Y lo consigue en varias métricas.

La arquitectura es sparse mixture-of-experts: 2.8T parámetros totales distribuidos en 896 expertos, de los cuales 16 se activan por token. Moonshot introdujo dos mecanismos de eficiencia que llaman Kimi Delta Attention y Attention Residuals, y afirma que logran hasta 6.3x más rápido en decoding. El modelo se entrega cuantizado nativamente (MXFP4 en pesos, MXFP8 en activaciones), con la misma cuantización en el API y en los pesos abiertos, así que la calidad self-hosted equivale a la hosted.

El contexto es de 1.048.576 tokens (1M). En un test de retención a contexto completo sin gestión de ventana, K3 puntúa 90.4 —decente pero no extraordinario comparado con modelos que optimizan específicamente para long-context.

Una decisión de diseño importante: el reasoning está siempre activo. En el lanzamiento solo está disponible el nivel de esfuerzo “max”; los modos low y high llegarán después. Esto significa que K3 siempre “piensa” antes de responder, lo que explica parte de su coste por output.

Benchmarks: dónde gana y dónde pierde

La forma más rápida de entender dónde encaja K3 es mirar los benchmarks independientes. Datos de Artificial Analysis (Intelligence Index, GDPval, AutomationBench, Briefcase) y vendor-reported para los demás.

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8Fuente
Intelligence Index v4.157.159.958.955.7AA (independiente)
GDPval-AA v2 (Elo)1668176017481600AA (independiente)
AutomationBench53 (#1)AA (independiente)
Briefcase (AA)1547 (#2)1583 (#1)1495 (#3)AA (independiente)
GPQA Diamond93.5%92.6%94.1%Vendor
Terminal-Bench 2.188.3%84.6%88.8%Vendor
BrowseComp91.2%88.0%90.4%Vendor
FrontierSWE81.2%86.6%71.3%Vendor
DeepSWE67.5%70.0%73.0%Vendor

Datos del leaderboard collector de Hermes (leaderboard-history.db, snapshot 2026-08-06) y de Artificial Analysis.

Lo que se ve en los números:

Gana en tareas agentes. AutomationBench mide navegación autónoma de herramientas —K3 es #1 con 53 puntos, por delante de Fable 5, Sol y Opus 4.8. En Briefcase (trabajo de conocimiento económicamente valioso) queda segundo, solo por detrás de Fable 5 y por delante de Sol.

Empata o pierde por poco en inteligencia general. En el Intelligence Index, 57.1 lo deja cuarto, a 2.8 puntos de Fable 5. No es una distancia enorme, pero no lidera.

Es competitivo en coding pero no el mejor. Terminal-Bench (88.3%) lo pone a la par con Sol. FrontierSWE (81.2%) supera a Sol (71.3%) pero queda por debajo de Fable 5 (86.6%). En DeepSWE queda tercero. La excepción: K3 es #1 en Frontend Code Arena, el benchmark de generación de código frontend que votan humanos.

Alucina más que su predecesor. La precisión en crudos subió de 33% (K2.6) a 46%, pero la tasa de alucinación también subió, a alrededor del 51%. Si tu caso de uso es factual puro, esto es un problema real.

Pricing: el fin de la IA china barata

Aquí es donde K3 rompe con la tradición de Kimi.

ModeloInput $/MTokOutput $/MTokCached input
Kimi K33.0015.000.30
Kimi K2.60.733.49
GPT-5.6 Sol5.0030.00
Claude Opus 5 (max)5.0025.00
Claude Fable 510.0050.00
DeepSeek V4 Pro1.504.50

Fuente: leaderboard-history.db (snapshot 2026-08-06) y páginas de pricing oficiales.

K3 cuesta triple que K2.6. Ya no es el modelo chino barato. Moonshot está cobrando por capacidad, no por undercutting.

Pero en coste por tarea —que es lo que importa en producción— K3 puede salir más barato que los frontier occidentales. Artificial Analysis midió $0.94 por tarea para K3, contra $1.04 para GPT-5.6 Sol y $1.80 para Claude Opus 4.8. La razón: K3 tiende a usar menos tokens por respuesta. Si tu pipeline es sensible al coste por output y no al coste por token, K3 gana.

Comparado con DeepSeek V4 Pro ($1.50/$4.50), K3 sigue siendo más caro. Pero V4 Pro puntúa 50 en el Intelligence Index —7 puntos menos. La pregunta es si esos 7 puntos valen el triple de coste. Para pipelines agentes complejos, probablemente sí.

Self-hosting: los pesos abiertos

Moonshot publicó los pesos completos el 26 de julio de 2026 en Hugging Face bajo la Kimi K3 License. Son 594 GB en MXFP4 —el checkpoint open-weight más grande de la historia.

Esto suena bien hasta que intentas cargarlo. 594 GB de pesos requieren hardware serio. Con 8× H100 (80 GB) tienes 640 GB de VRAM, justo por encima del mínimo, pero necesitas overhead para KV cache y activaciones. Con 16× A100 (40 GB) ya estás fuera. La mayoría de equipos que self-hostean van a terminar usando proveedores como Together AI, Modal o Cloudflare Workers AI, que ya ofrecen K3.

La licencia no es MIT: la Kimi K3 License tiene restricciones de uso comercial para entidades por encima de cierto tamaño. Revisa los términos antes de desplegar en producción si tu empresa factura más de 100M.

Dónde encaja y dónde no

Úsalo si:

  • Tu pipeline de agentes necesita contexto de repositorio completo (1M tokens) y el modelo mantiene retención decente.
  • Quieres pesos abiertos con capacidad frontier y no puedes esperar a que Llama 5 llegue.
  • Haces coding frontend —K3 lidera el Arena de frontend y Terminal-Bench lo pone a la par con Sol.
  • El coste por tarea importa más que el coste por token.

No lo uses si:

  • Necesitas precisión factual alta. La tasa de alucinación del 51% es un problema para Q&A, resúmenes de documentos y cualquier cosa donde inventar datos tenga coste.
  • Tu carga es chat rápido y barato. El reasoning siempre activo añade latencia y coste por output. K2.6 o DeepSeek V4 Flash siguen mejor ahí.
  • Necesitas bajos niveles de esfuerzo de reasoning para tareas triviales. El modo “max” es lo único disponible en el lanzamiento.

Qué significa para el mercado

El punto de K3 no es que gane todos los benchmarks. No los gana. El punto es que un modelo open-weight de 2.8T parámetros entra en la conversación de frontera por primera vez, y gana en tareas agentes específicas.

Hace cuatro meses escribimos que la brecha cerrado vs abierto se estaba cerrando. K3 es la confirmación: el modelo open más grande del mundo está a 2.8 puntos del líder cerrado en inteligencia general, y lo supere en tareas agentes.

El trade-off es el precio. K3 no es barato. Es frontera a precio de Sonnet, no a precio de DeepSeek. Si Moonshot mantiene esta estrategia, la narrativa “IA china = barata” queda atrás. Lo que queda es: IA china = frontier, con pesos abiertos, a precio competitivo.

Para equipos que ya operan sobre open models, K3 es el primer modelo donde no tienen que pedir disculpas por la capacidad. Eso solo ya lo convierte en un hito.

Fuentes

Cargando comentarios...