GPT Diffusion

Nex-N2.5: agentes de computer-use gratis en OpenRouter y el mayor post-training trillion-scale en pesos abiertos (sobre DeepSeek)

2026-09-21 · Devs #modelos#open-weights#agentes#openrouter#deepseek

TL;DR

  • Nex AGI lanzó el 8 de septiembre de 2026 la familia Nex-N2.5, las tres variantes Apache-2.0: mini (35B, A3B activos), Pro (397B, A17B) y Max (1,6T, A49B). Mini y Pro tienen variante :free en OpenRouter a $0/$0 con 262.144 tokens de contexto y soporte de tools. Max no está en OpenRouter: hoy es self-host de referencia con 16× H200 o nada.
  • La “familia” comparte receta de post-training, no base: mini y Pro van sobre Qwen3.5-MoE (multimodal); Max sobre DeepSeek-V4-Pro-Base, de 1,6T y solo texto. El config.json de Max es, campo a campo, un DeepSeek-V4.
  • El dato de fondo no es el free tier: es que el primer post-training completo a escala trillion en pesos abiertos lo ha hecho un tercero sobre una base que DeepSeek no vende como API (desde el 14-sep reenruta todo el tráfico de deepseek-v4-pro a V4.1-Flash).
  • Benchmarks 100% del vendor (harness propio NexAU/NexCUA, sin verificación de terceros a 21-sep): Max 86,1 en Terminal-Bench 2.1 y 92,6 en BrowseComp; Pro 82,2 en OSWorld-Verified. Y la trampa del free tier para computer-use: en el tier gratis de OpenRouter, los proveedores pueden entrenar con tus prompts — incluidas tus capturas de pantalla.

Qué es Nex-N2.5 (y qué no es una familia)

Nex AGI publicó Nex-N2.5 el 8 de septiembre de 2026. Tres variantes, todas Apache-2.0, según el sitio del vendor y las fichas de Hugging Face (verificadas el 21-sep):

MiniProMax
Parámetros totales35B397B1,6T
Parámetros activosA3BA17BA49B
BaseQwen3.5-MoEQwen3.5-MoEDeepSeek-V4-Pro-Base
Modalidadtexto + imagentexto + imagensolo texto
Contexto servido262.144262.144262.144 (receta oficial; el checkpoint declara 1.048.576)
AccesoOpenRouter :free + pesosOpenRouter :free + pesosSolo pesos (HF / ModelScope)
Pesos en HF (21-sep)16 shards (~70 GB)122 shards (~400 GB)644 shards (~1,6 TB)
Self-host de referencia——2 nodos × 8 H200 (TP16/EP16)

El matiz que la palabra “familia” esconde: mini y Pro usan config qwen3_5_moe (parser qwen3); Max usa model_type: deepseek_v4 (parser deepseek-r1). No es una escala continua del mismo modelo. Lo que comparten es la receta de post-training, no la base. Si evalúas Pro :free y asumes que estás probando “el hermano pequeño de Max”, estás probando otra arquitectura con el mismo adiestramiento.

El free tier de verdad: qué cabe en 20 rpm y 50-1.000 req/día

Los límites del free tier de OpenRouter (docs oficiales, consultados el 21-sep-2026):

LímiteValor
Ritmo20 req/min
Diario con menos de 10 créditos comprados (all-time)50 req/día
Diario con ≥10 créditos comprados en la vida de la cuenta1.000 req/día
BYOK y cuentas exentassin gate

Ambos modelos :free (nex-agi/nex-n2.5-mini:free y nex-n2.5-pro:free) comparten la misma ficha técnica en la API viva: pricing 0/0, contexto 262.144, text+image→text, y soporte para tools, reasoning, reasoning_effort y structured_outputs. Es decir: agéntico de verdad, no un chatbot de demostración.

Qué puedes hacer con eso, en cuentas rápidas (no medido, aritmética): un run agéntico de computer-use gasta fácilmente entre 5 y 10 llamadas — una por captura más acción. Con 50 req/día te quedan unos 5-10 runs diarios; con 1.000, del orden de 100-200. Para construir y ajustar un suite de evaluación llega. Para un agente en bucle en producción, no. El muro real es el límite diario, no los 20 rpm: a 5-10 llamadas por tarea, el ritmo por minuto te permite 2-3 tareas concurrentes antes de empezar a recibir 429.

La trampa del free tier para computer-use: tu política de datos

Aquí está la parte incómoda. Los docs de OpenRouter sobre privacidad (“Provider Logging”) dicen que los ajustes de logging y entrenamiento son separados para paid y free, y que en el tier gratis los proveedores pueden entrenar con tus prompts según sus propias políticas. El opt-out existe en los settings “wherever possible… but there are exceptions” — textual.

Para un chatbot, eso es un problema de redacción del contrato. Para computer-use en producción, es el problema entero: cada captura de pantalla que envías puede contener bandejas de entrada, datos de clientes, código propietario, sesiones autenticadas. Si enrutas eso por un endpoint :free, estás regalando a terceros de entrenamiento justo los datos que tu política de seguridad intenta proteger.

Mi lectura: el free tier es para sesiones sintéticas y sandbox — tu suite de evaluación, tareas inventadas, capturas de máquinas de prueba. Todo lo que toque datos reales va por el endpoint de pago con el opt-out activado (sabiendo que tiene excepciones) o por self-host. La alternativa de no pagar y no exponer no existe en OpenRouter; sí existe fuera (ver self-host más abajo).

El dato de fondo: Max sobre DeepSeek-V4-Pro-Base

El claim del vendor, textual (nex-agi.com, texto en inglés, consultado 21-sep-2026): “Max builds on DeepSeek-V4-Pro-Base, a 1.6-trillion-parameter, text-only MoE base. Our first full post-training effort at this scale”.

Y el config.json de Max en Hugging Face respalda la parte verificable. Campo a campo:

  • model_type: deepseek_v4, arquitectura DeepseekV4ForCausalLM.
  • MoE: 384 expertos, 6 activos, 1 experto compartido.
  • MLA con un único kv head (MQA).
  • MTP: 1 capa nextn (decodificación especulativa).
  • fp8 (ue8m0), YaRN con factor 16, vocabulario de 129.280 tokens.

Es DeepSeek-V4 con otro post-training. No hay arquitectura nueva que analizar: hay una base de 1,6T que ya conoces (si no, la analizamos aquí: /blog/deepseek-v4-analisis-completo) y un adiestramiento encima hecho por otra empresa.

Por qué esto importa más que el free tier. DeepSeek no vende esa base como API: desde el 14 de septiembre a las 04:00 UTC reenruta todo el tráfico de deepseek-v4-pro a V4.1-Flash, con facturación de Flash (changelog del 10-sep; lo documentamos en /blog/deepseek-v4-api-precios-guia). La base de 1,6T solo existe como pesos. Y el primer post-training completo que recibe públicamente viene de un tercero que la descargó, la adiestró y publicó el resultado.

Hasta ahora, “modelo open-weight” significaba un paquete cerrado: base y post-training siempre juntos, del mismo vendor. Nex-N2.5-Max es la primera muestra pública de la otra posibilidad: una base común trillion-scale, 644 shards y ~1,6 TB de descarga, que cualquiera con capacidad de sobra puede post-entrenar. El foso de servir la base se evapora; lo que queda es la receta. Si ese patrón se repite, el mercado de pesos abiertos se parece menos a “labs que publican modelos” y más a “bases comunes + post-trains especializados”. Es un modelo de negocio distinto para todos los que vendían inferencia de la base.

Dos matices antes de que alguien venda Max como “modelo de 1M de contexto”. Uno: el checkpoint declara max_position_embeddings: 1048576, pero el comando oficial de serving lo lanza con --context-length 262144. El 1M es el techo del checkpoint; lo que el vendor sirve de referencia son 262K. Algunos agregadores ya listan 1,05M sin el matiz. Dos: self-hostear Max no es gratis — 1,6T de parámetros en fp8 son ~1,6 TB solo de pesos, y la receta de referencia pide dos nodos completos de 8× H200 (16 GPUs, TP16/EP16, imagen nexagi/sglang:v0.5.18-nex-patch). Para self-host open-weight sin ese presupuesto, la referencia sigue siendo el catálogo gratuito de NIM.

Los benchmarks del vendor y cómo leerlos

La tabla es del vendor, con harness propio: NexAU para coding y NexCUA para computer-use, con muestreo agéntico (temperatura 0,7, top_p 0,95, top_k 40 — no es evaluación greedy single-shot). Cabezas de tabla:

BenchmarkScoreVariante
Terminal-Bench 2.186,1Max
SWE-Bench Pro65,7Max
DeepSWE v1.165,6Max
BrowseComp92,6Max
OSWorld-Verified82,2Pro
OSWorld-G87,4Pro
WebArena-Verified67,6Pro
Terminal-Bench 2.1 (mini)73,4mini

Los comparan contra Opus 5, GPT-5.6 Sol, Kimi-K3, GLM-5.3, DeepSeek-V4-Pro-0813 y Qwen3.8-Max.

Cómo leer esto: aplicando el mismo marco de siempre (/blog/leaderboards-explicados-benchmark-mirar-ignorar). Los números salen de un harness propio del vendor que, a 21-sep-2026, no ha sido replicado por terceros. No son falsos por definición, pero son la versión del vendor de su propio examen, con su propio corrector. Trátalos como “según Nex AGI” en cada frase, igual que hacemos con los de DeepSeek o Qwen. Lo que convertiría estas cifras en información accionable es una réplica independiente en OSWorld o SWE-Bench Pro; hasta entonces, la única métrica que cuenta es tu tasa de éxito en tus tareas.

Qué haría yo: evaluar el free tier para computer-use en 5 pasos

Ya aprendimos la lección con GPT-6 Astra como agente computer-use: lo que importa no es el benchmark del vendor, es tu tasa de éxito por tarea. Con un free tier, además, el coste de hacer ese trabajo es cero. El plan:

  1. Define 15-20 tareas de tu dominio con verificador binario. No OSWorld ni Terminal-Bench: esas las usó el vendor y están contaminadas para tu comparación. Tareas tuyas: “crea este PR a partir de este issue”, “rellena este formulario con estos datos”, “extrae estos campos de esta factura”. Criterio de éxito binario, sin juicios de modelo salvo como segunda opinión.
  2. Mide tasa de éxito por tarea, con n≥5 intentos por tarea y la configuración real de uso (mismo reasoning_effort, mismo formato de prompt que usarás en producción). Con menos de 5 intentos, cualquier tasa de éxito es ruido con dos decimales. Publica la tasa por tarea, no la media global: la media esconde las tareas donde el modelo se hunde.
  3. Caracteriza los límites reales, no los del folleto. Sostenibilidad de 20 rpm bajo tu carga, qué devuelve exactamente OpenRouter al cruzar el límite diario (¿429 con cabeceras de retry? ¿silencio?), latencia p50/p95 por llamada, y cuántas llamadas por tarea cuesta cada nivel de reasoning_effort. Ese último número define si el free tier te sirve para algo más que para prototipar.
  4. Escribe la política de datos por endpoint antes de conectar nada real. Qué sesiones van a :free (sintéticas, sandbox), cuáles a pago o self-host. Activa el opt-out de entrenamiento en los settings del tier free — recordando que la letra pequeña dice “there are exceptions” — y comprueba que los ajustes de paid y free están separados, porque lo están.
  5. Gate barato: el free propone, un modelo pago verifica. El free tier sugiere la acción (diff, coordenadas de click, comando); un modelo de pago solo la valida antes de ejecutarla. Verificar una acción cuesta una fracción de generarla — el mismo patrón de routing por coste que ya usamos con otros modelos — y convierte un agente gratis-que-se-equivoca en algo que puedes presentar. Mide el coste de verificación: si se come el ahorro, el free tier no compensa la complejidad.

Si tu caso necesita Max, este plan no te sirve de consuelo: no hay free tier, hay 16× H200 o esperar a que algún proveedor de inferencia lo sirva. Para el resto, Pro :free cubre la evaluación de patrones agénticos a coste cero — con la diferencia de base en mente (Qwen multimodal, no DeepSeek; si tu carga es de visión, Pro incluso tiene ventaja sobre el Max text-only).

Cómo lo hemos verificado (y qué no hemos hecho)

Todas las cifras de este análisis están comprobadas contra fuentes primarias el 21-sep-2026: el texto del vendor en nex-agi.com, los README y config.json de Hugging Face vía API (incluidos los HEAD de shards para confirmar que los pesos son descargables — el “coming soon” del día del lanzamiento ya caducó), la API viva de OpenRouter y sus docs oficiales de límites y privacidad. No hemos ejecutado los modelos: no hay pruebas propias que añadir, y los benchmarks son exclusivamente del vendor. Los límites y precios del free tier son constantes que cambian; si lees esto mucho después, re-verifícalos.

Fuentes

Cargando comentarios...