GPT Diffusion

Review: Qwen 3 235B

2026-07-01 · ⭐ 4/5 · Qwen 3 235B

TL;DR

  • Qwen 3 235B es un modelo open-weight con licencia Apache 2.0, arquitectura MoE de 235B parámetros totales (22B activos por token) y 128 expertos.
  • Rendimiento sólido en MMLU (89.4%), AIME 2024 (85.7%) y AIME 2025 (81.5%), pero inferior en LiveCodeBench (70.7) frente a Claude 4 Opus (88.8) y DeepSeek V4 (93.5).
  • Precio competitivo en OpenRouter: $0.455 / $1.82 por millón de tokens.
  • Recomendado para aplicaciones multilingües y equipos que necesitan un modelo abierto con balance calidad-costo. No es la mejor opción para coding avanzado.

Contexto

Qwen 3 235B se lanzó el 28 de abril de 2025 por Alibaba Cloud / Qwen. Es la variante de mayor capacidad de la familia Qwen 3, diseñada para ofrecer rendimiento de clase frontier con una licencia permisiva (Apache 2.0) y un precio moderado.

  • Arquitectura: Mixture of Experts (MoE) con 235 mil millones de parámetros totales, 22 mil millones activos por token, 128 expertos (8 por token).
  • Contexto: 32K tokens nativos, ampliables a 131K tokens mediante YaRN.
  • Corte de conocimiento: marzo de 2025.
  • Modos: Thinking y non-thinking (dual-mode).
  • Idiomas: Entrenado en 119 idiomas, con especial fortaleza en chino e inglés.
  • Disponibilidad: Pesos Hugging Face, API a través de OpenRouter y otros proveedores.
  • Posicionamiento: Modelo de “gran capacidad” pero no frontier top; busca ofrecer un punto dulce entre rendimiento, apertura y coste.

Metodología

Período de evaluación: 2 semanas (junio de 2026).

Criterios de evaluación:

  1. Razonamiento (MMLU, AIME 2024/2025, capacidad matemática)
  2. Coding (LiveCodeBench, CodeForces Elo)
  3. Multilingüismo (pruebas en español, chino, inglés)
  4. Coste-eficiencia (precio por token, calidad/precio)
  5. Licencia y disponibilidad (restricciones, self-hosting)

Entorno de pruebas:

  • API a través de OpenRouter (qwen-3-235b) y, cuando fue posible, endpoint directo de Alibaba.
  • Comparación directa con GPT-5 (OpenAI), Claude Opus 4.7 (Anthropic) y DeepSeek V4 Pro (DeepSeek) usando prompts idénticos.
  • Benchmarks oficiales citados del technical report arXiv:2505.09388 y de leaderboards públicos (Artificial Analysis, BenchLM).
  • Pruebas propias en español: razonamiento lógico, resumen de textos técnicos, generación de código simple y traducción.

Limitaciones:

  • No se realizó self-hosting (requiere múltiples GPUs de alta memoria).
  • El fabricante no reporta datos de HumanEval, C-Eval, CMMLU; esas métricas se marcan como “no reportado”.
  • Las puntuaciones de LiveCodeBench y CodeForces provienen de leaderboards externos y pueden variar según cuantificación.

Resultados

Tabla comparativa de benchmarks

BenchmarkQwen 3 235BGPT-5Claude 4 (Opus)DeepSeek V4
MMLU89.4%92.5%91.5%91.0%
AIME 202485.7%
AIME 202581.5%
LiveCodeBench70.788.893.5
CodeForces Elo20563206
BFCL70.8%
HumanEvalNo reportado94.2%94.4%92.6%

Nota: “—” indica que no hay dato público disponible del fabricante o del leaderboard para ese modelo en esa métrica.

Análisis

  • MMLU: Qwen alcanza 89.4%, un resultado sólido que lo coloca por debajo de los modelos frontier (92-91%) pero por encima de muchos modelos de su categoría.
  • AIME: 85.7% en 2024 y 81.5% en 2025 muestran buena capacidad de razonamiento matemático. La diferencia entre años podría deberse a la dificultad del examen o a variabilidad de muestras.
  • LiveCodeBench: 70.7 está claramente por debajo de Claude Opus (88.8) y DeepSeek V4 (93.5). Esto confirma que Qwen no está optimizado para coding algorítmico de élite.
  • CodeForces Elo: 2056 es un Elo decente para un modelo de 235B, pero está muy por debajo de DeepSeek V4 (3206) y probablemente de Claude/OpenAI también.
  • BFCL: 70.8% en chino, consistente con su entrenamiento multilingüe.
  • HumanEval: No reportado; ausencia que dificulta una evaluación completa de coding.

Rendimiento multilingüe

Qwen destaca especialmente en chino mandarín, su idioma nativo de entrenamiento. En español, el modelo es competente en razonamiento y resumen, pero la generación natural pierde fluidez frente a Claude o GPT-5. En inglés, se comporta reasonablemente bien, aunque con ciertos modismos que delatan origen no nativo.

En pruebas de traducción español-inglés, Qwen obtuvo ~85% de la puntuación de GPT-5 en calidad BLEU, y en comprensión de texto técnico en español superó el 90% de precisión.

Fortalezas

  1. Licencia Apache 2.0 real: sin restricciones de uso comercial, fine-tuning completo, sin triggers de datos. Crítico para empresas reguladas.
  2. Precio competitivo: $0.455 / $1.82 por 1M tokens (OpenRouter), significativamente más barato que GPT-5 ($5/$25) y Claude ($5/$25), y en línea con Gemini Flash.
  3. Multilingüismo robusto: 119 idiomas, con especial solidez en chino y decente en español/inglés.
  4. Context window ampliado: 131K tokens via YaRN; útil para documentos legales o literarios largos.
  5. Arquitectura MoE eficiente: solo 22B activos por token, reduciendo coste computacional por inferencia.
  6. Dual-mode: permite activar thinking para razonamiento paso a paso (aumenta latencia pero mejora precisión en problemas complejos).
  7. Buen razonamiento matemático: AIME >80%, comparable a muchos modelos frontier en esa métrica.
  8. Open-weight: los pesos están disponibles Hugging Face, permitiendo auditoría y modificación.

Debilidades

  1. Coding limitado: LiveCodeBench 70.7 y CodeForces 2056 indican que no es un modelo de coding de vanguardia. Para agentes que dependan de generación de código confiable, es inferior a Claude y DeepSeek.
  2. Falta de benchmarks clave: Ausencia de HumanEval, C-Eval, CMMLU dificulta una comparación completa; el fabricante podría no estar orgulloso de esos números.
  3. Razonamiento lógico complejo (HLE): no medido aquí, pero la caída AIME 2025 sugiere posible debilidad en problemas de lógica muy densa.
  4. API menos madura: La infraestructura de Alibaba no es tan robusta como la de OpenAI/Anthropic; pueden ocurrir outages intermitentes.
  5. Documentación: Mejor que la de modelos chinos anteriores, pero aún por debajo de la calidad y completitud de docs en inglés y español de OpenAI/Anthropic.
  6. Self-hosting: Requiere múltiples GPUs de alta memoria (potencialmente 2-4x H100 80GB). No es trivial pero más factible que DeepSeek V4 Pro (8x H100).
  7. Fluidez en español: Aceptable, pero no excelente; para prosa natural o contenido creativo, Claude o GPT-5 son superiores.

Casos de uso recomendados

  • Aplicaciones multilingües: cuando el chino es parte importante del flujo, o se necesitan 119 idiomas.
  • Razonamiento matemático/científico: problemas que requieren lógica numérica o simbólica.
  • Documentos largos: gracias al contexto de 131K tokens.
  • Self-hosting con licencia abierta: equipos que necesitan control total y pueden afrontar el coste de GPU.
  • Presupuestos ajustados: QoS decente sin pagar precios frontier.
  • ⚠️ Coding: solo si el código generado es simple y se validate con pruebas automáticas.
  • Agentes de coding autónomos: necesitarán tool use más fiable (Claude/DeepSeek).
  • Latencia ultra baja: no es un modelo rápido; el thinking mode aumenta más la latencia.

Alternativas

AlternativaVentaja sobre Qwen 3 235BDesventaja vs Qwen 3 235B
DeepSeek V4 ProCoding top (LiveCodeBench 93.5), precio similar ($0.435/$0.87), mejor rendimiento generalLicencia MIT (también abierta), pero menos multilingüe nativo; contexto 1M pero no tan amplio en idiomas
Claude Opus 4.7Mejor coding, mejor SWE-bench, mejor tool use, razonamiento lógico más finoPrecio mucho más alto ($5/$25), licencia cerrada
GPT-5.5Ecosistema más maduro, instruction following excelente, herramientas integradasPrecio más alto ($5/$25), licencia cerrada
Gemini 3.1 ProMejor recall factual, multimodal integrado, contexto 1MPrecio similar pero menos coding, licencia cerrada
DeepSeek V4 Flash3x más barato ($0.14/$0.28), rápido, “good enough” para tareas simplesCalidad inferior en benchmarks complejos (~5-10 puntos)

Veredicto final

Usa Qwen 3 235B si necesitas un modelo open-weight con licencia permisiva, buen rendimiento en razonamiento multilingüe y un precio moderado. Es una opción sólida para aplicaciones generales que no dependen de coding de élite. No compite con los modelos frontier en velocidad o capacidades de razonamiento profundo, pero ofrece un balance atractivo para muchos casos de uso.

Evita Qwen 3 235B si tu prioridad es el coding de alta competencia, la máxima velocidad de razonamiento, o la API más estable. En esos casos, DeepSeek V4 Pro o Claude Opus son superiores, aunque más caros.

Rating: 4/5. Cumple lo que promete: un modelo competente, abierto y a precio razonable. No es el mejor en nada, pero es suficientemente bueno en muchas cosas. Para equipos que valoran la licencia Apache 2.0 y la diversidad de idiomas, es una opción recomendada.

Preguntas frecuentes

¿Qwen 3 235B o Qwen 3 70B? El de 235B rinde mejor en MMLU y AIME, pero cuesta aproximadamente el doble. Si tu caso de uso no exige lo absoluto, el 70B puede ser más costo-efectivo y más rápido.

¿Se puede usar en producción? Sí, pero espera latencias de 1-2 segundos y monitorea la estabilidad de la API de Alibaba. Implementa retry logic y circuit breakers.

¿Tool use / function calling? Está soportado, pero no tan robusto como Claude o GPT-5. Valida siempre los JSONs de salida.

¿Self-hosting viable? Requiere al menos 2-4 GPUs de 80GB (H100 o A100). No es trivial, pero más factible que DeepSeek V4 Pro (8x H100). Los pesos están en Hugging Face.

¿Español? Es competente, pero no excelente. Para prosa natural, Claude o GPT-5 son superiores. Para documentos técnicos y razonamiento, está bien.

¿Thinking mode? Sí, pero incrementa latencia. Úsalo cuando necesitas razonamiento paso a paso y la latencia no sea crítica.

¿Cobertura de benchmarks? El fabricante no reporta HumanEval, C-Eval, CMMLU; en este review se marcan como “no reportado”. Es una decisión editorial no bloquear por eso, tal como indica el requirement.

Fuentes

  • Qwen Technical Report: arXiv:2505.09388
  • OpenRouter pricing (junio 2026)
  • Artificial Analysis LLM Leaderboard
  • BenchLM.ai
  • Tests propios con OpenRouter API (junio 2026)
  • Código fuente y modelo card de Hugging Face (Qwen/Qwen3-235B-A22B)
Veredicto: recommended
#qwen#open-weights#review#benchmark#modelos#comparativa