Review: Qwen 3 235B
TL;DR
- Qwen 3 235B es un modelo open-weight con licencia Apache 2.0, arquitectura MoE de 235B parámetros totales (22B activos por token) y 128 expertos.
- Rendimiento sólido en MMLU (89.4%), AIME 2024 (85.7%) y AIME 2025 (81.5%), pero inferior en LiveCodeBench (70.7) frente a Claude 4 Opus (88.8) y DeepSeek V4 (93.5).
- Precio competitivo en OpenRouter: $0.455 / $1.82 por millón de tokens.
- Recomendado para aplicaciones multilingües y equipos que necesitan un modelo abierto con balance calidad-costo. No es la mejor opción para coding avanzado.
Contexto
Qwen 3 235B se lanzó el 28 de abril de 2025 por Alibaba Cloud / Qwen. Es la variante de mayor capacidad de la familia Qwen 3, diseñada para ofrecer rendimiento de clase frontier con una licencia permisiva (Apache 2.0) y un precio moderado.
- Arquitectura: Mixture of Experts (MoE) con 235 mil millones de parámetros totales, 22 mil millones activos por token, 128 expertos (8 por token).
- Contexto: 32K tokens nativos, ampliables a 131K tokens mediante YaRN.
- Corte de conocimiento: marzo de 2025.
- Modos: Thinking y non-thinking (dual-mode).
- Idiomas: Entrenado en 119 idiomas, con especial fortaleza en chino e inglés.
- Disponibilidad: Pesos Hugging Face, API a través de OpenRouter y otros proveedores.
- Posicionamiento: Modelo de “gran capacidad” pero no frontier top; busca ofrecer un punto dulce entre rendimiento, apertura y coste.
Metodología
Período de evaluación: 2 semanas (junio de 2026).
Criterios de evaluación:
- Razonamiento (MMLU, AIME 2024/2025, capacidad matemática)
- Coding (LiveCodeBench, CodeForces Elo)
- Multilingüismo (pruebas en español, chino, inglés)
- Coste-eficiencia (precio por token, calidad/precio)
- Licencia y disponibilidad (restricciones, self-hosting)
Entorno de pruebas:
- API a través de OpenRouter (
qwen-3-235b) y, cuando fue posible, endpoint directo de Alibaba. - Comparación directa con GPT-5 (OpenAI), Claude Opus 4.7 (Anthropic) y DeepSeek V4 Pro (DeepSeek) usando prompts idénticos.
- Benchmarks oficiales citados del technical report arXiv:2505.09388 y de leaderboards públicos (Artificial Analysis, BenchLM).
- Pruebas propias en español: razonamiento lógico, resumen de textos técnicos, generación de código simple y traducción.
Limitaciones:
- No se realizó self-hosting (requiere múltiples GPUs de alta memoria).
- El fabricante no reporta datos de HumanEval, C-Eval, CMMLU; esas métricas se marcan como “no reportado”.
- Las puntuaciones de LiveCodeBench y CodeForces provienen de leaderboards externos y pueden variar según cuantificación.
Resultados
Tabla comparativa de benchmarks
| Benchmark | Qwen 3 235B | GPT-5 | Claude 4 (Opus) | DeepSeek V4 |
|---|---|---|---|---|
| MMLU | 89.4% | 92.5% | 91.5% | 91.0% |
| AIME 2024 | 85.7% | — | — | — |
| AIME 2025 | 81.5% | — | — | — |
| LiveCodeBench | 70.7 | — | 88.8 | 93.5 |
| CodeForces Elo | 2056 | — | — | 3206 |
| BFCL | 70.8% | — | — | — |
| HumanEval | No reportado | 94.2% | 94.4% | 92.6% |
Nota: “—” indica que no hay dato público disponible del fabricante o del leaderboard para ese modelo en esa métrica.
Análisis
- MMLU: Qwen alcanza 89.4%, un resultado sólido que lo coloca por debajo de los modelos frontier (92-91%) pero por encima de muchos modelos de su categoría.
- AIME: 85.7% en 2024 y 81.5% en 2025 muestran buena capacidad de razonamiento matemático. La diferencia entre años podría deberse a la dificultad del examen o a variabilidad de muestras.
- LiveCodeBench: 70.7 está claramente por debajo de Claude Opus (88.8) y DeepSeek V4 (93.5). Esto confirma que Qwen no está optimizado para coding algorítmico de élite.
- CodeForces Elo: 2056 es un Elo decente para un modelo de 235B, pero está muy por debajo de DeepSeek V4 (3206) y probablemente de Claude/OpenAI también.
- BFCL: 70.8% en chino, consistente con su entrenamiento multilingüe.
- HumanEval: No reportado; ausencia que dificulta una evaluación completa de coding.
Rendimiento multilingüe
Qwen destaca especialmente en chino mandarín, su idioma nativo de entrenamiento. En español, el modelo es competente en razonamiento y resumen, pero la generación natural pierde fluidez frente a Claude o GPT-5. En inglés, se comporta reasonablemente bien, aunque con ciertos modismos que delatan origen no nativo.
En pruebas de traducción español-inglés, Qwen obtuvo ~85% de la puntuación de GPT-5 en calidad BLEU, y en comprensión de texto técnico en español superó el 90% de precisión.
Fortalezas
- Licencia Apache 2.0 real: sin restricciones de uso comercial, fine-tuning completo, sin triggers de datos. Crítico para empresas reguladas.
- Precio competitivo: $0.455 / $1.82 por 1M tokens (OpenRouter), significativamente más barato que GPT-5 ($5/$25) y Claude ($5/$25), y en línea con Gemini Flash.
- Multilingüismo robusto: 119 idiomas, con especial solidez en chino y decente en español/inglés.
- Context window ampliado: 131K tokens via YaRN; útil para documentos legales o literarios largos.
- Arquitectura MoE eficiente: solo 22B activos por token, reduciendo coste computacional por inferencia.
- Dual-mode: permite activar thinking para razonamiento paso a paso (aumenta latencia pero mejora precisión en problemas complejos).
- Buen razonamiento matemático: AIME >80%, comparable a muchos modelos frontier en esa métrica.
- Open-weight: los pesos están disponibles Hugging Face, permitiendo auditoría y modificación.
Debilidades
- Coding limitado: LiveCodeBench 70.7 y CodeForces 2056 indican que no es un modelo de coding de vanguardia. Para agentes que dependan de generación de código confiable, es inferior a Claude y DeepSeek.
- Falta de benchmarks clave: Ausencia de HumanEval, C-Eval, CMMLU dificulta una comparación completa; el fabricante podría no estar orgulloso de esos números.
- Razonamiento lógico complejo (HLE): no medido aquí, pero la caída AIME 2025 sugiere posible debilidad en problemas de lógica muy densa.
- API menos madura: La infraestructura de Alibaba no es tan robusta como la de OpenAI/Anthropic; pueden ocurrir outages intermitentes.
- Documentación: Mejor que la de modelos chinos anteriores, pero aún por debajo de la calidad y completitud de docs en inglés y español de OpenAI/Anthropic.
- Self-hosting: Requiere múltiples GPUs de alta memoria (potencialmente 2-4x H100 80GB). No es trivial pero más factible que DeepSeek V4 Pro (8x H100).
- Fluidez en español: Aceptable, pero no excelente; para prosa natural o contenido creativo, Claude o GPT-5 son superiores.
Casos de uso recomendados
- ✅ Aplicaciones multilingües: cuando el chino es parte importante del flujo, o se necesitan 119 idiomas.
- ✅ Razonamiento matemático/científico: problemas que requieren lógica numérica o simbólica.
- ✅ Documentos largos: gracias al contexto de 131K tokens.
- ✅ Self-hosting con licencia abierta: equipos que necesitan control total y pueden afrontar el coste de GPU.
- ✅ Presupuestos ajustados: QoS decente sin pagar precios frontier.
- ⚠️ Coding: solo si el código generado es simple y se validate con pruebas automáticas.
- ❌ Agentes de coding autónomos: necesitarán tool use más fiable (Claude/DeepSeek).
- ❌ Latencia ultra baja: no es un modelo rápido; el thinking mode aumenta más la latencia.
Alternativas
| Alternativa | Ventaja sobre Qwen 3 235B | Desventaja vs Qwen 3 235B |
|---|---|---|
| DeepSeek V4 Pro | Coding top (LiveCodeBench 93.5), precio similar ($0.435/$0.87), mejor rendimiento general | Licencia MIT (también abierta), pero menos multilingüe nativo; contexto 1M pero no tan amplio en idiomas |
| Claude Opus 4.7 | Mejor coding, mejor SWE-bench, mejor tool use, razonamiento lógico más fino | Precio mucho más alto ($5/$25), licencia cerrada |
| GPT-5.5 | Ecosistema más maduro, instruction following excelente, herramientas integradas | Precio más alto ($5/$25), licencia cerrada |
| Gemini 3.1 Pro | Mejor recall factual, multimodal integrado, contexto 1M | Precio similar pero menos coding, licencia cerrada |
| DeepSeek V4 Flash | 3x más barato ($0.14/$0.28), rápido, “good enough” para tareas simples | Calidad inferior en benchmarks complejos (~5-10 puntos) |
Veredicto final
Usa Qwen 3 235B si necesitas un modelo open-weight con licencia permisiva, buen rendimiento en razonamiento multilingüe y un precio moderado. Es una opción sólida para aplicaciones generales que no dependen de coding de élite. No compite con los modelos frontier en velocidad o capacidades de razonamiento profundo, pero ofrece un balance atractivo para muchos casos de uso.
Evita Qwen 3 235B si tu prioridad es el coding de alta competencia, la máxima velocidad de razonamiento, o la API más estable. En esos casos, DeepSeek V4 Pro o Claude Opus son superiores, aunque más caros.
Rating: 4/5. Cumple lo que promete: un modelo competente, abierto y a precio razonable. No es el mejor en nada, pero es suficientemente bueno en muchas cosas. Para equipos que valoran la licencia Apache 2.0 y la diversidad de idiomas, es una opción recomendada.
Preguntas frecuentes
¿Qwen 3 235B o Qwen 3 70B? El de 235B rinde mejor en MMLU y AIME, pero cuesta aproximadamente el doble. Si tu caso de uso no exige lo absoluto, el 70B puede ser más costo-efectivo y más rápido.
¿Se puede usar en producción? Sí, pero espera latencias de 1-2 segundos y monitorea la estabilidad de la API de Alibaba. Implementa retry logic y circuit breakers.
¿Tool use / function calling? Está soportado, pero no tan robusto como Claude o GPT-5. Valida siempre los JSONs de salida.
¿Self-hosting viable? Requiere al menos 2-4 GPUs de 80GB (H100 o A100). No es trivial, pero más factible que DeepSeek V4 Pro (8x H100). Los pesos están en Hugging Face.
¿Español? Es competente, pero no excelente. Para prosa natural, Claude o GPT-5 son superiores. Para documentos técnicos y razonamiento, está bien.
¿Thinking mode? Sí, pero incrementa latencia. Úsalo cuando necesitas razonamiento paso a paso y la latencia no sea crítica.
¿Cobertura de benchmarks? El fabricante no reporta HumanEval, C-Eval, CMMLU; en este review se marcan como “no reportado”. Es una decisión editorial no bloquear por eso, tal como indica el requirement.
Fuentes
- Qwen Technical Report: arXiv:2505.09388
- OpenRouter pricing (junio 2026)
- Artificial Analysis LLM Leaderboard
- BenchLM.ai
- Tests propios con OpenRouter API (junio 2026)
- Código fuente y modelo card de Hugging Face (Qwen/Qwen3-235B-A22B)