Qwen-Image-2.1: RGBA nativo (con trampa: licencia research-only)
Qwen-Image-2.1: RGBA nativo y edición con 10 referencias que no podrás llevar a producción sin licencia aparte
TL;DR
- Cotejado verbatim contra el model card, el LICENSE y el README del repo (27/09/2026): Qwen-Image-2.1 es un DiT single-stream de 32 capas y 7B parámetros (componente visual), con Qwen3-VL 8B como encoder de texto e imágenes y un VAE RGBA de 64 canales con compresión espacial 16× — ahí vive la transparencia nativa. Release el 20/09/2026 con ecosistema Day-0: diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V.
- La trampa principal: la v1 (Qwen-Image, agosto de 2025) era Apache-2.0 — verbatim en su model card. La 2.1 baja a “Qwen RESEARCH LICENSE AGREEMENT”: §2 restringe uso, distribución y derivados a “research or evaluation purposes only”. Cualquier uso comercial exige licencia aparte ([email protected]), los derivados deben lucir “Built with Qwen” (§4b) y no pueden llamarse “Qwen” (§4c), y el contrato se rige por ley china con jurisdicción exclusiva de Hangzhou (§8).
- Todo lo demás es vendor-reported: generación RGBA desde texto, edición con hasta 10 imágenes de referencia, ediciones locales por anotaciones y preservación de identidad. La evidencia son showcases propios. No existe a día de hoy ningún benchmark independiente ni comparativa contra la v1, FLUX o SDXL en las fuentes primarias.
- Adopción, no calidad: 52.804 descargas y 2.478 likes en Hugging Face (consultado el 27/09/2026), con la ficha creada el 14/09/2026. La v1 acumula 283.515 descargas. Que la gente descargue a saco no es un benchmark.
- La salida comercial sigue abierta, pero por la puerta vieja: mientras la v1 siga siendo Apache-2.0, quien necesite producción con las capacidades clásicas tiene ahí su opción — sin RGBA nativo ni edición multi-referencia.
Qué es Qwen-Image-2.1
Es el nuevo modelo de generación y edición de imágenes de la familia Qwen, con pesos descargables en Hugging Face. La ficha se creó el 14/09/2026 y el release oficial se fechó el 20/09/2026 en la News del repo de GitHub, con soporte Day-0 de diffusers (PR #14804), ComfyUI, vLLM-Omni, SGLang (PR #39983) y LightX2V. No hay API de pago anunciada en las fuentes consultadas: de momento es un modelo para correr tú.
Dos capacidades concentran todo el marketing: generación con canal alfa real (RGBA) y edición condicionada con hasta 10 imágenes de referencia. Para la familia Qwen en texto, ya analizamos Qwen3.8-27B y su experiencia con 700 usuarios reales; este es el lado imagen de la misma estrategia de ecosistema.
La trampa: de Apache-2.0 a licencia research-only
Aquí está la parte que la ficha de Hugging Face no grita. El modelo anterior, publicado en agosto de 2025, declara license: apache-2.0 verbatim en su model card — puedes usarlo en producción, modificarlo y redistribuirlo sin pedir permiso a nadie. La 2.1 cambia de marco: el LICENSE es un “Qwen RESEARCH LICENSE AGREEMENT” con release date 20/09/2026 y firma de Hangzhou Tongyi Laboratory.
Lo que dice, en concreto:
- §2 — solo no comercial. Uso, reproducción, distribución y creación de derivados quedan limitados a “research or evaluation purposes only”. Para cualquier uso comercial hay que solicitar una licencia separada a [email protected].
- §4b — “Built with Qwen”. Si usas los outputs del modelo para entrenar o mejorar otro modelo que luego distribuyes, tu derivado debe mostrar ese crédito.
- §4c — sin branding. No puedes usar “Qwen” como nombre principal de tu derivado.
- §8 — ley china. El contrato se rige por la ley de la República Popular China, con jurisdicción exclusiva de los tribunales de Hangzhou. Para un equipo con departamento legal pequeño, eso no es un detalle menor: es el foro donde se resolvería cualquier disputa.
La etiqueta “open” de la ficha convive con todo esto. Pesos disponibles para descargar sí; licencia permisiva, no. Es la misma tensión que describimos en la pieza sobre el cambio de poder del open-source: el open-weights ha ganado la batalla de la distribución, pero la libertad de uso se negocia caso por caso. El paso atrás respecto a la propia v1 del mismo vendor — que sigue siendo Apache-2.0 — demuestra que no es una decisión de casa sino de modelo.
| Qwen-Image (ago-2025) | Qwen-Image-2.1 (20/09/2026) | |
|---|---|---|
| Texto legal | Apache-2.0 | Qwen Research License |
| Uso comercial | Sí, sin condiciones | Solo con licencia aparte |
| Derivados | Sin restricción de marca | ”Built with Qwen” + sin “Qwen” en el nombre |
| Jurisdicción | Estándar Apache | Ley china, tribunales de Hangzhou |
Qué dice la arquitectura (y qué implica)
Datos verbatim del README del repo — descripción del vendor, pero de la parte que se puede contrastar con el código y los pesos:
| Componente | Qué es | Qué implica |
|---|---|---|
| DiT single-stream | 32 capas, 7B parámetros (solo el componente visual) | El encoder suma aparte en memoria: no es un “7B” completo |
| Atención block-causal | Causal por token en texto, bidireccional por chunk en imágenes | Las imágenes de referencia se leen completas; el prompt, secuencial |
| Prefix KV cache | La condición texto+imágenes se codifica una vez y se reutiliza en los 40 pasos (causal_condition: true por defecto) | El coste de condición se amortiza; relevante sobre todo en edición multi-imagen |
| Text encoder | Qwen3-VL 8B, codifica texto E imágenes en una representación unificada | Es la pieza que hace plausible condicionar con 10 referencias |
| VAE | Autoencoder RGBA de 64 canales, compresión espacial 16× | La transparencia vive en el latente, no es un recorte posterior |
| Scheduler | Flow Matching, Euler discreto, dynamic shifting, 40 pasos por defecto | Configuración de referencia del repo |
| Resolución nativa | 2048×2048 más 6 formatos: 4:3 (2400×1792), 3:2 (2528×1696), 16:9 (2752×1536) y sus inversas | 2K nativo sin upscaling |
Dos lecturas en frío. Primera: la suma real no es 7B — el Qwen3-VL 8B del encoder viaja con el modelo, y ninguna fuente primaria publica cifra de VRAM mínima, así que cualquier “te cabe en X GB” que leas por ahí es aritmética ajena, no dato del vendor. Segunda: el prefix KV cache es un buen diseño de ingeniería para el caso de edición con muchas referencias, pero su ahorro es lógico por diseño, no medido por terceros.
Lo del vendor: RGBA y 10 referencias
Todo lo que viene ahora es vendor-reported; la evidencia pública son los showcases del repo y del model card, no evaluaciones independientes:
- Generación RGBA desde texto. El prompt recomendado es literal: “This is an RGBA image with transparency. <descripción>. The image has alpha channel and the background is transparent.” También se anuncia edición de capas transparentes y extracción de sujetos.
- Edición con hasta 10 imágenes de referencia, con preservación de identidad de personas y productos — el claim más difícil de verificar sin pruebas propias, porque “preservar identidad” no tiene métrica pública que lo respalde.
- Ediciones locales señalando zonas con círculos, anotaciones pintadas o máscaras separadas.
- Prompt rewriting opcional con dos checkpoints fine-tuned de Qwen3.5-VL 9B (Qwen-Image-2.1-PE-T2I y -PE-I2I).
- Ecosistema Day-0: pipeline
QwenImage21Pipelineen diffusers, pesos nativos para ComfyUI (en Comfy-Org/Qwen-Image-2.1), vLLM-Omni con FP8 y CUDA graphs, SGLang-Diffusion y LightX2V. Soporte AMD ROCm y “8 plataformas de chip” vía FlagOS, según el propio vendor.
Que no exista comparativa contra la v1 es la ausencia más elocuente: el vendor no publica todavía por qué deberías migrar más allá de las capacidades nuevas. La calidad de imagen “se ve en los ejemplos” — que es exactamente el nivel de evidencia que este sitio no da por buena.
Ecosistema y adopción, con fecha
Las métricas de Hugging Face (API consultada el 27/09/2026): 52.804 descargas y 2.478 likes en trece días desde la creación de la ficha, con un paso por el puesto 1.856 del trending el día de la señal. La v1, en sus trece meses de vida, acumula 283.515 descargas y 2.658 likes. Lectura: la adopción inicial es rápida — el soporte Day-0 de ComfyUI y diffusers hace el resto — pero la base instalada de la 2.1 es hoy el 18,6% de la de su predecesora. Las métricas se mueven rápido: si esta pieza envejece, es por estos números.
El soporte Day-0 sí es una señal de adopción verificable: diffusers, ComfyUI, vLLM-Omni y SGLang mergeando soporte el mismo día del release no es algo que pase con modelos que el ecosistema no espera. Para prototipar, la vía ComfyUI es la de menor fricción; para integrar en código, diffusers.
Cuándo te sirve y cuándo no
Dónde sí. Investigación y evaluación, que es literalmente para lo que la licencia te deja usarlo: pipelines de composición con transparencia real (sin chroma ni matting posterior), prototipos de edición de capas, R&D sobre edición multi-referencia con el KV cache amortizando el coste de condición. Si tu flujo vive en ComfyUI, probarlo cuesta poco.
Dónde no. En producción comercial sin acuerdo previo — y con la v1 Apache-2.0 disponible, el argumento “es que no había alternativa” no vale: la hay, sin RGBA ni multi-referencia. Tampoco como base de un derivado que quieras renombrar a tu marca sin el “Built with Qwen”, ni en un equipo que no pueda aceptar jurisdicción de Hangzhou en un contrato de licencia. Y si lo que necesitas es calidad medida: todavía no hay nada medido.
Qué haría yo. Si tu caso es no comercial, prototipa en ComfyUI esta semana y evalúa el RGBA en tu flujo real — es la única capacidad que ningún competidor abierto estándar da por defecto. Si tu caso es comercial, decide antes de invertir: o pides la licencia a [email protected] y asumes el marco legal chino, o te quedas en la v1 Apache y esperas a que terceros midan si la 2.1 merece el trámite. Y en cualquier caso, no des por buena la preservación de identidad hasta probarla con tus propios sujetos.
Qué falta por medir
- Calidad vs v1, FLUX y SDXL. Solo showcases del vendor. Cero benchmarks independientes a 27/09/2026.
- VRAM mínima y throughput real. Ninguna fuente primaria publica cifras; el “7B” del titular ignora el encoder de 8B.
- El ahorro real del prefix KV cache en ediciones con 10 referencias: lógico por diseño, no medido por nadie de fuera.
- Si habrá API de pago y con qué licencia de uso: no está anunciada en las fuentes consultadas.
Fuentes
- Primarias: model card de Qwen-Image-2.1 · LICENSE completo · README del repo QwenLM/Qwen-Image-2.1 — todas consultadas el 27/09/2026.
- Modelo anterior: model card de Qwen-Image (license: apache-2.0, verbatim).
- Métricas de adopción: API de Hugging Face, consultada el 27/09/2026.
- Contexto de la familia: análisis de Qwen3.8-27B · experiencia de 700 usuarios · el cambio de poder del open-source.