Qwen3.8-27B | Análisis Completo: Benchmarks, Hardware Local y Licencia
Qwen3.8-27B: lo que los benchmarks dicen y lo que no
TL;DR: Alibaba liberó Qwen3.8-27B el 14 de agosto de 2026 a las 15:00 UTC. Es un modelo denso de 27.780 millones de parámetros, multimodal (texto, imagen, vídeo), con contexto nativo de 262.144 tokens extensible a 1M con YaRN, bajo Apache 2.0. Los números que publica Qwen sobre coding agentic son un salto enorme sobre Qwen3.6-27B — DeepSWE 1.1 pasa de 13.3 a 42.2. Pero no existe ninguna reproducción independiente en el momento del lanzamiento, el checkpoint BF16 ocupa 51.76 GiB, y el “1M de contexto” requiere escalado YaRN que Qwen misma advierte que puede empeorar prompts cortos. Para trabajo local en una GPU de 24GB, la versión realista es un Q4_K_M de terceros a contexto moderado.
Qué se lanzó exactamente
El modelo es Qwen/Qwen3.8-27B en Hugging Face. No es Qwen3-8B ni el Qwen3.8-Max de 2.4 billones de parámetros que ya analizamos — es el checkpoint denso pensado para despliegue local y estación de trabajo.
Datos verificables del repositorio oficial:
- Parámetros exactos: 27.781.427.952 (Safetensors)
- Arquitectura: decodificador híbrido de 64 capas — 48 capas Gated DeltaNet (atención lineal) y 16 capas de atención completa GQA (24 cabezas Q, 4 KV, dimensión 256)
- Contexto: 262.144 tokens nativos; 1M con YaRN (factor 4.0)
- Modalidades: texto, imagen y vídeo de entrada; texto de salida
- Licencia: Apache 2.0 (pesos; los datos de entrenamiento y la receta no se publican)
- Checkpoints oficiales: BF16 (55.58 GB) y FP8 por bloques (30.88 GB). No hay GGUF, AWQ ni MLX oficial.
Un detalle curioso que circula por r/LocalLLaMA: el config.json sigue diciendo model_type: qwen3_5 y carga con Qwen3_5ForConditionalGeneration. Es una decisión de compatibilidad de software, no evidencia de que sea un Qwen3.5 reciclado. Lo que sí es cierto, y aquí el escepticismo de la comunidad tiene fundamento, es que la geometría del decodificador es prácticamente idéntica a Qwen3.6-27B: mismas capas, mismo tamaño oculto, misma FFN, mismo contexto nativo. El salto de benchmarks no viene de una arquitectura nueva — viene de pesos, entrenamiento y post-entrenamiento distintos. Qwen no publica suficiente información (corpus, tokens, RL, destilación) para separar las contribuciones.
Los benchmarks: salto real, fuente única
Tabla oficial de Qwen (todos los valores del model card, harness Claude Code a temp 1.0, top_p 0.95, contexto 256K):
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | Opus 4.6 Max |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus) | 73.0 | 63.4 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 53.4 |
| DeepSWE 1.1 | 42.2 | 13.3 | — |
| QwenSWEBench | 79.0 | 49.3 | 63.8 |
| CoWorkBench (oficina largo plazo) | 70.7 | 61.0 | 68.2 |
| IFBench (instrucciones) | 79.5 | 69.1 | 62.5 |
| LiveCodeBench v6 | 90.3 | 83.9 | 88.8 |
| GPQA Diamond | 89.2 | 87.8 | 91.3 |
En multimodal y uso de ordenador, el patrón se repite: OSWorld-Verified sube de 63.9 a 84.3, WebArena-Verified de 48.8 a 64.8, AndroidWorld llega a 81.9. Gana a Qwen3.6 en todas las filas publicadas.
El hilo de r/LocalLLaMA con más tracción el día del lanzamiento preguntaba directamente si “Qwen3.8-27B es idéntico a Qwen3.6-27B” (827 upvotes, 146 comentarios). Con la misma forma pero benchmarks radicalmente distintos, la respuesta honesta es: mismos planos, motor distinto.
Advertencias que importan antes de citar estos números:
- Todos los valores salen de Qwen. No había reproducción independiente en el momento del lanzamiento.
- SWE-bench Pro: el 61.7 se mide en un conjunto refinado por Qwen; el 53.4 de Opus 4.6 Max es el número oficial de Anthropic importado, no re-evaluado bajo el mismo harness. Esa comparación no es apples-to-apples.
- RecreationBench y CoWorkBench son benchmarks internos de Qwen.
- MathVision usa un prompting asimétrico: Qwen3.8 con un prompt fijo, los comparadores con el mejor de dos prompts.
El salto sobre el predecesor parece genuino y consistente. Las comparaciones con frontera hay que leerlas con comillas.
¿Es nivel frontier?
En tests seleccionados ejecutados por Qwen, se acerca o supera a comparadores frontera anteriores. Como afirmación general, no. Referencia direccional (harness distintos, no es un leaderboard controlado):
| Benchmark | Qwen3.8-27B | DeepSeek V4 Flash 0731 | GPT-5.6 Sol | Opus 4.8 / 5 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 82.7 | 88.8 | 78.9 |
| DeepSWE 1.1 | 42.2 | 54.4 | 72.7 | 59.0 |
| SWE-bench Pro | 61.7 | — | 64.6 | Opus 5: 79.2 |
La lectura práctica: para 27B densos está absurdamente cerca. En el trabajo más difícil de largo plazo, los sistemas frontera siguen con ventaja real. Y una API frontera incluye capacidad gestionada, herramientas, caché y soporte; un checkpoint descargado te da control, privacidad y personalización a cambio de owning serving, validación de cuantización, monitoring e incidents.
Hardware local: el archivo de pesos no es toda la factura de memoria
Esta es la parte que los titulares de “corre en 17GB” se saltan.
El checkpoint BF16 ocupa 51.76 GiB. El FP8 oficial, 28.76 GiB. Eso son solo los pesos. La inferencia también necesita KV cache, estado de atención lineal, activaciones, procesamiento de visión y buffers del framework.
Cálculo del KV cache de atención completa (cota inferior, solo las 16 capas full-attention):
16 capas × 4 cabezas KV × 256 dims × 2 (K+V) × 2 bytes BF16 = 65.536 bytes/token
Eso son 16 GiB para el contexto nativo completo de 262K, y ~61 GiB para 1M de tokens. La arquitectura híbrida ayuda (solo 16 de 64 capas construyen KV cache convencional), pero no lo elimina.
| Formato | Pesos | Realidad de memoria | Conclusión |
|---|---|---|---|
| BF16 oficial | 51.76 GiB | ≥67.76 GiB con KV a 262K | Despliegue de 80GB o multi-GPU |
| FP8 oficial | 28.76 GiB | ≥44.76 GiB a 262K | Entra en 48GB solo con contexto reducido |
| Q4_K_M GGUF (Unsloth, terceros) | 15.93 GiB + 0.87 de proyector de visión | ~2 GiB de KV a 32K | Viable en 24GB a contexto moderado |
| Q6_K GGUF (terceros) | 21.31 GiB | poco margen en 24GB | Mejor 32GB+ o offload parcial |
Los GGUF son conversiones de terceros (el repositorio de Unsloth apareció el día del lanzamiento), no artefactos oficiales. La cuantización puede cambiar razonamiento, visión, uso de herramientas y comportamiento de contexto largo aunque el archivo cargue.
Regla operativa: no fusionar “pesa 17GB” con “soporta 262K”. Ambas frases son ciertas por separado y falsas combinadas.
El contexto de 1M, correctamente enunciado
El model card documenta extensión a un millón de tokens con YaRN. Qwen recomienda factor 4.0 para 1M y advierte que los frameworks open actuales implementan YaRN estático: el factor de escalado queda activo también en prompts cortos y puede degradarlos. Un servicio con documentos de 500K debería usar factor ~2.0; un asistente de coding normal no debería pagar la penalización de contexto corto solo porque 1M luce bien en la tabla de especificaciones.
Thinking por defecto y esfuerzo configurable
Qwen3.8 piensa por defecto antes de responder. Se puede desactivar por request, y hay tres niveles de reasoning_effort (xhigh por defecto, medium, low). Dos detalles que importan en producción:
preserve_thinkingactivo por defecto: en agentes multi-turno, los bloques de razonamiento anteriores se conservan en la conversación en vez de descartarse. Mejora continuidad y reutilización de KV cache, pero obliga a presupuestar un contexto de razonamiento creciente y a decidir qué se guarda, se re-playa y se expone en logs.- Sampling recomendado: temp 1.0 / top_p 0.95 en thinking; temp 0.7 / top_p 0.8 / presence penalty 1.5 sin thinking. Defaults de vendor, no óptimos universales — en migración, mantén prompts, herramientas y tests de aceptación fijos mientras varías esfuerzo y sampling.
Disponibilidad y pricing
Los pesos están en Hugging Face ahora. La API gestionada de Qwen Cloud del modelo exacto estaba marcada “coming soon” en el lanzamiento — cuando llegue promete 1M de contexto por defecto y herramientas oficiales integradas. No existe precio publicado; ojo con sustituirlo por las tarifas de Qwen3.7-Plus o 3.7-Max, que no son este modelo.
Qué haría yo
- Coding assistant local privado en una GPU de 24GB: este es el caso de uso estrella. Q4_K_M a 32-64K de contexto, esperando validación de la comunidad sobre qué pierde la cuantización en modo agentic.
- Sustituto de API frontera: no. Los números de DeepSWE y Terminal-Bench de GPT-5.6, Opus 4.8/5 y DeepSeek V4 Flash siguen claramente por encima, y una API incluye el sistema de producto alrededor.
- Routing híbrido: la arquitectura ganadora en 2026 sigue siendo la misma — rutina y trabajo privado al modelo open pequeño, escalar lo ambiguo y caro al endpoint frontera. Qwen3.8-27B acaba de subir bastante el techo del primer escalón.
- Corporativo/documental: OSWorld 84.3 y visión nativa lo hacen candidato serio para automatización de escritorio y análisis de documentos on-premise bajo Apache 2.0.
Lo que falta esperar: reproducción independiente de los benchmarks (sobre todo DeepSWE 13.3→42.2, que es un salto enorme), el precio real de Qwen Cloud, y cuantizaciones oficiales.
Fuentes
- Model card oficial, Hugging Face
- Análisis de especificaciones y hardware, Kingy.ai (14 ago 2026)
- GGUF de Unsloth (conversión de terceros)
- Terminal-Bench 2.1 leaderboard
- Hilos de lanzamiento en r/LocalLLaMA: Qwen3.8-27B released (928 pts, 286 comentarios), ¿idéntico a Qwen3.6? (827 pts)