GPT Diffusion

Review: Llama 4 Scout — El especialista en contexto ultra-largo

2026-06-29 · ⭐ 3.5/5 · Llama 4 Scout

TL;DR

Llama 4 Scout es un modelo open-weight optimizado para contexto extremadamente largo (10 millones de tokens) con arquitectura MoE de 17B parámetros activos. Su nicho es claro: análisis de codebases completas, RAG sobre libros enteros, y procesamiento de conversaciones Historiales masivos. En benchmarks de razonamiento puro, está por debajo de su hermano Maverick, Gemma 4 y todos los frontier models. Pero su combinación de open-weight + 10M contexto + precio accesible (~$0.10-0.20/M tokens) lo hacen única. Rating: 3.5/5.

Contexto

Meta lanzó Llama 4 en abril de 2025 con una apuesta clara: arquitectura Mixture-of-Experts (MoE) y ventanas de contexto récord. La familia incluye:

  • Scout: 109B total, 17B activos, 16 expertos, 10M contexto, especializado en longitud.
  • Maverick: 400B total, 17B activos, 128 expertos, 1M contexto, generalista flagship.
  • Behemoth: 2T+, en entrenamiento, paraKnowledge distillation.

Scout se posiciona como el modelo para casos donde el contexto es el principal cuello de botella: ingestión de repositorios enteros, análisis de throughput en logs de décadas, o sistemas de RAG sobre corpus gigantes. Es open-weight (licencia comunitaria de Meta con cláusula 700M MAU), lo que permite descargar pesos y ejecutar localmente o en propia infraestructura.

Metodología

Esta review se basa en:

  1. Documentación oficial de Meta: notas técnicas sobre iRoPE, especificaciones de arquitectura MoE, guías de deployment (vLLM, Ollama).
  2. Benchmarks de terceros: datos de AIMadeTools, n1n.ai, Gemma4-ai.com, y PromptChief (última actualización mayo 2026). Se priorizaron fuentes que reportan números específicos con fechas.
  3. Pricing y disponibilidad: precios de APIs públicas (Together AI, Fireworks AI, AWS Bedrock) y costes de auto-hospedaje (quantización Q4, requisitos de GPU/RAM).
  4. Análisis de casos de uso: experiencias de desarrolladores en foros (r/LocalLLaMA, Hacker News) y guías de producción (vLLM, Ollama).
  5. Limitaciones reconocidas: discrepancies entre fuentes (MMLU vs MMLU-Pro, variantes de evaluación), ausencia de SWE-bench oficial para Scout, y riesgo de “lost-in-the-middle” a 10M contexto a pesar de iRoPE.

No se realizaron pruebas API directas debido al coste y tiempo, pero los benchmarks citados provienen de evaluaciones reproducibles con checkpoints públicos. Se cruzaron datos de múltiples fuentes para detectar outliers.

Resultados

Tabla 1: Especificaciones técnicas Llama 4 Scout vs competidores

ModeloParams activosParams totalesExpertosContextoArquitecturaOpen-weightPrecio input ($/1M)
Llama 4 Scout17B109B1610MMoE + iRoPE~$0.10-0.20
Llama 4 Maverick17B400B1281MMoE~$0.22
Gemma 4 31B31B (dense)31B-256KDense~$0.15-0.25 (API)
GPT-5---1.05MPropietario$1.25
Claude Opus 4.8---~200KPropietario$5.00

Nota: Precios de APIs aproximados (Together, Fireworks, Bedrock para Llama;厂商 oficial para otros).

Tabla 2: Benchmarks comparativos

ModeloMMLUHumanEvalMATHGPQASWE-benchLMArena / MT-Bench
Llama 4 Scout~82.1%~78.1%???~1350+
Llama 4 Maverick88.3%88.0%83.0%69.8%38.4%~1400+
Gemma 4 31B87.1%76.8%43.2%??MT-Bench 8.52, ELO 1247
GPT-591.5%95.8%95.2%81.3%57.2%-
Claude Opus 4.892.9%96.9%96.9%86.4%76.0%-

Fuentes: PromptChief (para GPT-5, Claude, Maverick), Gemma4-ai.com (Gemma 4), AIMadeTools/n1n.ai (Llama 4 familia). Discrepancias metodológicas: MMLU vs MMLU-Pro, diferentes Few-shot, fechas de evaluación.

Interpretación de datos

Scout tiene un perfil claramente especializado:

  • MMLU 82.1%: aceptable para un modelo de 17B activos, pero 6-10 puntos por debajo de Maverick y Gemma 4 31B. En conocimiento general, no compite.
  • HumanEval ~78.1%: decente para coding, pero lejos del 88%+ de Maverick y 95%+ de Claude/GPT-5. No es un modelo de coding top.
  • Contexto 10M: su principal ventaja. Ningún modelo open-weight ofrece tanto. Maverick se queda en 1M, Gemma 4 en 256K, frontier models en ~1-2M.
  • Eficiencia MoE: solo activa 17B de 109B por token, lo que permite inferencia relativamente rápida para su capacidadtotal.
  • Pricing: ~$0.10-0.20 por 1M tokens es 5-50× más barato que frontier models.

Fortalezas

  1. Contexto masivo (10M tokens): Único en open-weight. Permite meter repositorios enteros, libros, o historiales de chat de años en un solo prompt. Para RAG sobre documentos extensos, es una ventaja práctica enorme.

  2. Eficiencia MoE: 17B parámetros activos significan latencia y coste reducidos comparado con un modelo dense de 109B. En GPUs modernas (A100, H100) alcanza 95+ tokens/segundo (n1n.ai).

  3. Open-weight + licencia comercial (hasta 700M MAU): Puedes descargar pesos y ejecutar donde quieras, sin vendor lock-in. crucial para empresas con requisitos de privacidad o coste a escala.

  4. Multimodalidad nativa: Procesa texto e imagen en el mismo modelo, útil para documentos escaneados o diagramas de código. (A diferencia de algunos modelos solo-texto).

  5. Despliegue flexible: Soporta Ollama (ollama pull llama4-scout), vLLM, TGI. Requisitos modestos: ~32GB RAM en Q4_K_M, o 4×A100 para producción.

  6. Costo accesible: ~$0.10-0.20/M tokens en APIs cloud es orders of magnitude más barato que Claude/OpenAI. Para alto volumen, justifica auto-hospedaje.

  7. iRoPE para contexto largo: Interleaved Rotary Position Embeddings mitiga “lost-in-the-middle” y permite extrapolar más allá de los 256K de pre-entrenamiento.

Debilidades

  1. Razonamiento inferior a Maverick: En benchmarks de lógica, matemáticas y código, Maverick (+6-10 puntos) y Gemma 4 (+5-7 puntos) lo superan claramente. No es frontier-tier.

  2. SWE-bench desconocido (bajo): Inferimos que, dado que Maverick solo logra 38.4%, Scout debería estar más bajo aún. Para automation de código real, no es confiable.

  3. MMLU 82.1% vs 87-93% de competidores: Conocimiento general limitado. No esperes la profundidad de Claude o GPT-5 en temas especializados.

  4. Licencia 700M MAU: Si tu producto supera 700 millones de usuarios activos mensuales, necesitas licencia comercial separate con Meta. Cuidado en escalamiento.

  5. Estado de frontera incierto: Meta no ha publicado resultados oficiales extensos para Scout; muchos datos vienen de evaluaciones third-party. Podría haber variaciones no reportadas.

  6. Vision no optimizada para EU: La licencia restringe características de visión para usuarios de la UE por regulaciones. Si estás en Europa, podrías no poder usar la multimodalidad.

  7. Throughput costoso a 10M: Aunque MoE ayuda, procesar 10M tokens por request sigue siendo compute-intensive. En auto-hospedaje, necesitas hardware de gama alta para producción.

  8. Sin fine-tuning oficial (aún): A diferencia de otros modelos open-weight, Meta no ha liberado herramientas de fine-tuning específicas para Llama 4. Debes adaptar scripts de Llama 3 o usar LoRA genéricos.

Casos de uso recomendados

RAG sobre corpus gigantes: Si tu knowledge base son codebases completas, log files de años, o libros técnicos, los 10M tokens de Scout permiten inyectar todo el contexto relevante en un solo prompt, evitando chunking y pérdida de coherencia.

Análisis de código a gran escala: Para refactorizaciones masivas, búsqueda de vulnerabilidades en repositorios enteros, o generación de documentación API, Scout puede procesar el códigobase completo en una pasada.

Edge/on-device con contexto razonable: Con 32GB RAM (Q4) corre en estaciones de trabajo poderosas o edge servers. Para aplicaciones locales que necesitan memoria de conversación extensa (ej. asistentes de programación con historial completo), es viable.

Prototipado de largo-contexto sin vendor lock-in: Si quieres experimentar con 10M contexto antes decommitir a una solución proprietary, Scout es la única opción open-weight.

Coding agents de producción: SWE-bench probablemente <40%. Para agents que deben resolver issues reales de GitHub, Maverick (38.4%) ya es justo; Scout sería peor. Usa Claude Opus o GPT-5 para coding agents.

Razonamiento matemático/científico: MMLU 82% y MATH desconocido (bajo). Para problemas que requieren deduct logic avanzada, Better: DeepSeek V4 Pro, o3, Claude.

Aplicaciones de bajo coste por token: Aunque Scout es barato en comparación a frontier, sigue siendo más caro que modelos tiny (Llama 3.2 3B, Gemma 2B). Si tu volumen es enorme y la tarea es simple (clasificación, extracción), un modelo pequeño dense rinde más por dólar.

Usuarios en UE que necesitan visión: Restricción de licencia puede bloquear características multimodales. Verifica con asesor legal antes de implementar.

Alternativas

Llama 4 Maverick

  • Ventajas sobre Scout: Mejor en todos los benchmarks (MMLU 88.3% vs 82.1%, HumanEval 88% vs 78%), 1M contexto (aún largo), mismo MoE efficiency.
  • Desventajas: Precio ligeramente mayor ($0.22 vs $0.10-0.20), contexto 10× menor, mismo requisito de licencia.
  • ¿Cuándo elegirlo? Si tu prioridad es calidad de razonamiento sobre contexto máximo. Maverick es elLlama 4 “todo-terreno” y open-weight competitivo con frontier en muchas tareas.

Gemma 4 31B

  • Ventajas sobre Scout: MMLU 87.1% (vs 82.1%), HumanEval 76.8% (similar), MT-Bench 8.52, ELO 1247. Licencia Apache 2.0 (sin restricciones de MAU). Mejor throughput en GPUs consumer (RTX 4090: 28 t/s vs Scout ~?).
  • Desventajas: Solo 256K contexto, dense (no MoE), por lo que más lento por token que Scout en hardware limitado.
  • ¿Cuándo elegirlo? Si no necesitas >256K contexto y quieres licencia más permisiva + mejor rendimiento general en benchmarks. Es el mejor open-weight dense.

GPT-5

  • Ventajas sobre Scout: MMLU 91.5%, HumanEval 95.8%, reasoning top-tier, ecosistema maduro, multimodal completo, 1M+ contexto, fine-tuning disponible.
  • Desventajas: Propietario, carísimo ($1.25+), lock-in con OpenAI, no open-weight.
  • ¿Cuándo elegirlo? Cuando la calidad es primordial y el presupuesto no es limitado. Para agentes de coding, investigación, o aplicaciones críticas.

Claude Opus 4.8

  • Ventajas: Liderazgo en coding (SWE-bench 76%), honestidad mejorada, Dynamic Workflows, ecosistema robusto.
  • Desventajas: Más caro ($5), solo texto (no multimodal), contexto ~200K.
  • ¿Cuándo elegirlo? Si tu caso de uso es coding agents, code review, o tareas que requieren alta fiabilidad y consistencia.

Veredicto final

Comprar si tu principal necesidad es procesar contexto muy largo (codebases enteras, libros, conversaciones históricas) y necesitas open-weight para auto-hospedaje o privacidad. Scout es, a junio 2026, el único modelo open-weight con 10M tokens reales (no solo teóricos). Su rendimiento en razonamiento puro es mediocre, pero para RAG y análisis de documentos gigantes, el contexto extra compensa. Precio accesible (~$0.10-0.20/M tokens) y despliegue flexible (Ollama, vLLM) lo hacen práctico para equipos técnicos.

Evitar si tu prioridad es máxima calidad en coding, matemáticas o conocimiento general. En esos casos, Maverick o Gemma 4 ofrecen mejor rendimiento por token. Tampoco elijas Scout si estás en la UE y necesitas visión (restricción de licencia), o si tu producto superará 700M MAU (necesitas licencia comercial con Meta).

Nota final: Los 10M tokens son impresionantes en papel, pero en práctica, la calidad de attention a través de 10M tokens puede degradarse (lost-in-the-middle). iRoPE ayuda, pero prueba con tu propio corpus antes de commitir. Para la mayoría de casos de uso, 1M (Maverick) o 256K (Gemma 4) son suficientes. Solo escala a 10M si realmente llenarías ese contexto.

Rating: 3.5/5 — Buena implementación de una idea arriesgada (10M contexto open-weight), pero no es un modelo top en razonamiento. Su valor depende completamente de si necesitas ese contexto extremo.

Preguntas frecuentes

  • ¿Cuánto cuesta ejecutar Scout auto-hospedado? ~$0.10-0.20 por 1M tokens en cloud APIs. Auto-hospedado: necesitas 4×A100 (80GB) para producción, o 32GB RAM en Q4 para prototyping. Coste de infraestructura depende de tu escala.
  • ¿Se puede hacer fine-tuning? Oficialmente no hay scripts de fine-tuning de Meta, pero la comunidad ha adaptado LoRA para Llama 4. Espera instrucciones oficiales.
  • ¿Vale la pena vs Maverick? Sí, solo si 10M contexto es unrequirement hard. Para la mayoría de tareas, Maverick rinde mejor en benchmarks y sigue teniendo 1M (que ya es mucho).
  • ¿Qué cuantización recomiendas? Q4_K_M (Ollama) para balance calidad/tamaño. Q8 si tienes RAM de sobra. FP16 solo para investigación.
  • ¿Soporta function calling? Según documentación, sí, compatible con OpenAI schema. Pero no tan robusto como Claude/GPT.
  • ¿Disponibilidad geográfica? APIs cloud (Together, Fireworks, Bedrock) tienen cobertura global, pero revisa restricciones de licencia para UE (visión).
  • ¿Es realmente open-weight? Sí, pesos disponibles en Hugging Face bajo licencia comunitaria de Meta. No OSI-approved pero permite uso comercial con límites.
  • ¿Cuándo lanzarán Behemoth? Rumores apuntan a finales 2026. Será el modelo de conocimiento masivo (2T+ params) para distillation, no deployment directo.

Checklist antes de publicar

  • reviewStatus: complete
  • Metodología explícita (~200 palabras)
  • Tablas de benchmarks comparativos (Llama 4 Maverick, Gemma 4, GPT-5, Claude Opus 4.8)
  • Fortalezas y debilidades concretas
  • Veredicto claro con condiciones (on-device, edge, RAG)
  • Rating justificado (3.5/5)
  • Tags canónicos: llama-4, scout, open-weights, review, benchmark, modelos, contexto-largo, rag
  • Frontmatter completo con hub, contentType, searchIntent, verdict
  • Más de 900 palabras (~1,200+ palabras)
  • Enlaces internos sugeridos: [Llama 4 Maverick review] (si existe), [Gemma 4 review] (si existe), [editorial sobre open-weight models]
  • Lint editorial pasado
Veredicto: Compra si necesitas contexto masivo (10M tokens) y open-weight, con presupuesto ajustado. Evita si priorizas máxima calidad de razonamiento o SWE-bench. Para RAG de código y documentos largos, es único en su clase.
#llama#open-weights#review#benchmark#modelos