Qwen 3.8 27B: lo que 700 usuarios reales aprendieron en 48 horas — quants, t/s por GPU y si merece la migración desde el 3.5
Qwen 3.8 27B: lo que 700 usuarios reales aprendieron en 48 horas
TL;DR:
- El consenso de la comunidad tras 48 horas: es el mejor modelo denso de 27B que ha pasado por hardware consumer, pero piensa demasiado y hay que configurarlo bien para que no dé guerra.
- Los quants que la gente está usando de verdad: UD-Q8_K_XL y UD-Q5_XL de Unsloth (con MTP funcional desde el primer repo, a diferencia de lo que pasó con 3.6).
- El setup estrella documentado en el hilo: RTX 3090 + 5070 Ti en tensor parallel con 48 t/s de decode y 850 t/s de prefill a contexto de 128K.
- La mayoría de “el modelo va mal” (loops en LM Studio, respuestas basura) se resuelve con los sampling params oficiales y el reasoning effort en
medium. No es el modelo: es la config.
De dónde salen estos datos
Qwen publicó Qwen3.8-27B el 14 de agosto a las 15:16 UTC. En 48 horas, el hilo “Please Share Your Experience” de r/LocalLLaMA acumuló más de 700 comentarios con configs, velocidades y quejas concretas. Este artículo es la síntesis de ese hilo más sus satélites (el de harnesses, el de migración desde 3.5 122B y el post de AMD con soporte Day 0). Para el análisis del modelo en sí — benchmarks, arquitectura, licencia — ya escribimos la pieza completa; aquí no repito benchmarks de Qwen, solo lo que la gente ha medido en sus máquinas.
Advertencia honesta antes de empezar: son reportes de usuarios individuales, no un banco de pruebas controlado. Cada fila de la tabla de abajo es una persona con su config, no una medición reproducida. Trátalo como lo que es: la muestra más grande disponible de experiencia real.
Rendimiento real por hardware
Lo primero que busca quien vuelve el lunes a su workstation: ¿qué velocidad puedo esperar?
| Hardware | Quant / config | Decode | Fuente |
|---|---|---|---|
| RTX 3090 + RTX 5070 Ti (tensor parallel 65/35) | UD-Q8_K_XL, ctx 128K, KV q8_0, MTP | 48 t/s (prefill 850 t/s) | hilo principal |
| 2× RTX PRO 6000 Blackwell 96GB | Q8_0 | 97 t/s | hilo principal |
| AMD Radeon AI PRO R9700 32GB | llama.cpp, MTP=2 | 51,8 t/s | blog AMD |
| RTX 5070 Ti sola (47/53 CPU/GPU) | Q4 | 14,9 t/s | hilo principal |
| AMD Ryzen AI Max+ 395 | llama.cpp Vulkan, MTP=4 | 24,5 t/s | blog AMD |
| 2× RTX 3060 12GB | ~Q4 “999 qbit xl”, ctx 120K | ~17 t/s | hilo principal |
Tres lecturas de esta tabla:
El techo es más alto de lo que sugiere una sola GPU. El dato más interesante no es el 97 t/s del equipo de 190 GB de VRAM, sino los 48 t/s del combo 3090 + 5070 Ti: dos GPUs de segunda mano y gama media, con arquitecturas distintas, hacen tensor parallel en llama.cpp y dan una experiencia fluida a contexto de 128K. Que eso funcione con GPUs heterogeneous es la sorpresa técnica del hilo.
Una GPU de 16GB te deja en zona incómoda. 14,9 t/s con la mitad del modelo en CPU se nota. Es utilizable para tareas por lotes, frustrante para iterar en un agente de coding. El modelo “cabe” en 17 GB, pero explotarlo bien pide más.
La Memoria unificada de AMD aguanta el tipo. El Ryzen AI Max+ 395 a 24,5 t/s con MTP activado (dato oficial de AMD, medido en llama.cpp con Vulkan) confirma que un portátil con memoria unificada es una plataforma real para este modelo. No es la opción rápida, pero es la opción portable.
El setup que la comunidad ha convergido
Después de 700 comentarios, hay un consenso bastante claro en tres capas.
Quants: UD-Q8_K_XL o UD-Q5_XL de Unsloth
Prácticamente nadie está usando el checkpoint BF16 oficial (51,76 GiB). Los GGUF de Unsloth son el estándar de facto del hilo, y esta vez MTP (Multi-Token Prediction) funciona en el repo inicial, cosa que con 3.6 requirió un repo aparte. La regla práctica que se repite: si te cabe el UD-Q8_K_XL (unos 30 GB con contexto moderado), ese; si no, UD-Q5_XL, que varios usuarios describen como su “daily driver” desde la época del 3.6. Varios comentarios coinciden en que el salto de Q4 a Q5 se nota más de lo habitual en este modelo.
Sampling params: los que todo el mundo se saltó
El model card de Qwen especifica temperature: 1.0, top_p: 0.95, top_k: 20. Es lo mismo que pasa con cada release de Qwen: media comunidad lo ejecuta con los defaults de su frontend, obtiene loops o respuestas raras, y culpa al modelo. El hilo está lleno de eso. Si ejecutas este modelo en LM Studio o cualquier wrapper de llama.cpp, lo primero es poner los sampling oficiales.
Reasoning effort: medium salvo que la tarea lo merezca
El control granular que más se agradece es el reasoning_effort del chat template (xhigh por defecto, medium, low, o desactivado). El dato de un usuario que lo midió: xhigh consume entre 2 y 15 veces más tokens que medium en tareas de un solo turno, con ganancia de calidad marginal en la mayoría de casos. La recomendación repetida en el hilo: medium para casi todo, low o off para trabajo mecánico de código, xhigh reservado para problemas difíciles donde te da igual que piense cinco minutos.
Un matiz importante si te tentó cortar el razonamiento por la fuerza con --reasoning-budget en llama.cpp: funciona, pero un usuario citó su propia medición en un modelo Qwen anterior donde forzar el budget hundió HumanEval del 94% al 78%. Con el mensaje de transición (--reasoning-budget-message) se recuperaba hasta el 89%, pero sigues perdiendo contra dejarlo razonar. Con reasoning_effort entrenado, el brute force del budget rara vez es la respuesta.
Fallos conocidos y sus fixes
“Solo obtengo loops y loops” (LM Studio, frontends varios). Casi siempre sampling por defecto en vez de los oficiales. Fix: temperature 1.0, top_p 0.95, top_k 20, sin presence penalty ni repeat penalty agresivos. En el script de ejemplo de abajo están exactos.
Piensa muchísimo. Es la queja número uno del hilo, con un caso extremo documentado: 15.000 palabras de razonamiento para un Tetris (aunque el resultado fue objetivamente mejor que el del 3.6, con detalles que nadie pidió). Fix: reasoning_effort: medium o menos. El thinking verbose es el coste, no un bug: este modelo traslada parte de su capacidad al razonamiento largo.
Los harnesses se ahogan con el thinking. Un usuario reportó que OpenCode se rompe cuando el modelo pasa de 32K tokens de razonamiento. Si tu herramienta tiene límites de salida por turno, súbelos o baja el reasoning effort antes de culpar al modelo.
Detalle cómico pero real: es el primer modelo que varios usuarios han visto “despotrar durante el thinking”. La capa de razonamiento es menos filtrada que la salida final. No afecta a la calidad, pero sorprende la primera vez.
El config listo para copiar
Este es el setup estrella del hilo, adaptado ligeramente para legibilidad — 3090 + 5070 Ti, UD-Q8_K_XL, 128K de contexto, ~1 GB libre en cada GPU:
llama-server \
-m Qwen3.8-27B-UD-Q8_K_XL.gguf \
--ctx-size 131072 \
--no-mmap \
--split-mode tensor \
--tensor-split 0.65,0.35 \
--n-gpu-layers 99 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--flash-attn on \
--batch-size 4096 --ubatch-size 128 \
--temp 1.0 --top-p 0.95 --top-k 20 \
--spec-type draft-mtp --spec-draft-n-max 2 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true, "reasoning_effort": "medium"}' \
--port 8080
Notas: el KV cache de este modelo es caro (38,3 KB/token con las 17 capas de atención completa en q8_0), así que el contexto que te cabe depende directamente del quant. --keep 3000 protege el system prompt de ser desplazado en sesiones largas, y --image-min-tokens 1024 es necesario si usas las capacidades visuales.
Sobre harness: la encuesta comunitaria de esta semana sobre qué usar con este modelo dejó dos datos útiles. Uno triste: Continue está discontinuado. Uno entusiasta: el combo Qwen 3.8 27B + DSH (DeepSeek Harness) tiene hilo propio y dedicado. Pi.dev también aparece varias veces bien documentado, con mapping de thinking levels incluido.
¿Merece la migración desde Qwen 3.5 122B?
La pregunta que abrió un hilo propio este domingo (“Sigo con Qwen 3.5 122B, ¿debería cambiarme?”) y merece respuesta sin rodeos.
El argumento del 27B: capacidad de coding agentic que compite una categoría por encima de su tamaño, la mitad de requisitos de memoria, tres veces la velocidad en hardware equivalente, y un salto documentado sobre 3.6 tan grande que varios usuarios lo describen como “ni comparable”. Si tu carga de trabajo es código y agentes, el 3.8 27B en un UD-Q8 bien servido es hoy la mejor relación capacidad/hardware del ecosistema open-weight.
El argumento del 122B: nadie en el hilo ha demostrado que el 27B iguale al 122B en conocimiento general, matices o tareas de razonamiento largo que no sean código. “Drásticamente mejor que los anteriores Qwen” no implica “mejor que un modelo 4,5 veces más grande”. Y un comentario con mucho peso práctico: los modelos no son drop-in replacements — el mismo pipeline puede rendir distinto tras cambiar de modelo, y migrar una configuración pulida cuesta tiempo real.
Mi veredicto, en dos líneas:
- Si trabajas principalmente con código: migra. El 3.8 27B es más rápido, más barato de servir y probablemente mejor en tu caso de uso, con la ventaja de que reajustar prompts es una tarde de trabajo.
- Si tu uso del 122B es generalista o crítico: mantén el 122B como modelo principal, monta el 27B al lado (cabe en la mitad de memoria) y compáralo en tus tareas reales durante una semana antes de tocar nada. Y si tu plan era esperar un 3.8 de mayor tamaño: varios hilos sugieren que la familia no ha terminado de salir — la paciencia puede tener recompensa, pero eso es especulación, no dato.
Conclusión
El patrón que dejan 48 horas y 712 comentarios es inusualmente consistente para un lanzamiento de LLM: el modelo es real, el salto sobre 3.6 es percibido por casi todo el mundo, y los problemas reportados son mayoritariamente de configuración, no de capacidad. La excepción honesta: piensa demasiado por defecto, y eso lo hace inadecuado para usos de latencia baja sin ajustar el reasoning effort.
La configuración correcta importa aquí más que en ningún release reciente: quant Unsloth correcto, sampling oficiales, reasoning_effort: medium. Con eso, el reporte medio del hilo se resume en una frase que resume el momento del ecosistema local: capacidad cercana a frontera en hardware de hace tres años. Sin comillas sería exagerar. Con comillas, es literalmente lo que dice la gente que lo está ejecutando.
Fuentes: hilo de experiencia Qwen 3.8 27B en r/LocalLLaMA (712 comentarios), encuesta sobre harnesses, hilo de migración desde 3.5 122B, blog AMD con soporte Day 0 y benchmarks Ryzen AI Max+ 395 / Radeon R9700. Análisis técnico del modelo en Qwen3.8-27B: análisis completo.