Review: Llama 4 Scout — El especialista en contexto ultra-largo
TL;DR
Llama 4 Scout es un modelo open-weight optimizado para contexto extremadamente largo (10 millones de tokens) con arquitectura MoE de 17B parámetros activos. Su nicho es claro: análisis de codebases completas, RAG sobre libros enteros, y procesamiento de conversaciones Historiales masivos. En benchmarks de razonamiento puro, está por debajo de su hermano Maverick, Gemma 4 y todos los frontier models. Pero su combinación de open-weight + 10M contexto + precio accesible (~$0.10-0.20/M tokens) lo hacen única. Rating: 3.5/5.
Contexto
Meta lanzó Llama 4 en abril de 2025 con una apuesta clara: arquitectura Mixture-of-Experts (MoE) y ventanas de contexto récord. La familia incluye:
- Scout: 109B total, 17B activos, 16 expertos, 10M contexto, especializado en longitud.
- Maverick: 400B total, 17B activos, 128 expertos, 1M contexto, generalista flagship.
- Behemoth: 2T+, en entrenamiento, paraKnowledge distillation.
Scout se posiciona como el modelo para casos donde el contexto es el principal cuello de botella: ingestión de repositorios enteros, análisis de throughput en logs de décadas, o sistemas de RAG sobre corpus gigantes. Es open-weight (licencia comunitaria de Meta con cláusula 700M MAU), lo que permite descargar pesos y ejecutar localmente o en propia infraestructura.
Metodología
Esta review se basa en:
- Documentación oficial de Meta: notas técnicas sobre iRoPE, especificaciones de arquitectura MoE, guías de deployment (vLLM, Ollama).
- Benchmarks de terceros: datos de AIMadeTools, n1n.ai, Gemma4-ai.com, y PromptChief (última actualización mayo 2026). Se priorizaron fuentes que reportan números específicos con fechas.
- Pricing y disponibilidad: precios de APIs públicas (Together AI, Fireworks AI, AWS Bedrock) y costes de auto-hospedaje (quantización Q4, requisitos de GPU/RAM).
- Análisis de casos de uso: experiencias de desarrolladores en foros (r/LocalLLaMA, Hacker News) y guías de producción (vLLM, Ollama).
- Limitaciones reconocidas: discrepancies entre fuentes (MMLU vs MMLU-Pro, variantes de evaluación), ausencia de SWE-bench oficial para Scout, y riesgo de “lost-in-the-middle” a 10M contexto a pesar de iRoPE.
No se realizaron pruebas API directas debido al coste y tiempo, pero los benchmarks citados provienen de evaluaciones reproducibles con checkpoints públicos. Se cruzaron datos de múltiples fuentes para detectar outliers.
Resultados
Tabla 1: Especificaciones técnicas Llama 4 Scout vs competidores
| Modelo | Params activos | Params totales | Expertos | Contexto | Arquitectura | Open-weight | Precio input ($/1M) |
|---|---|---|---|---|---|---|---|
| Llama 4 Scout | 17B | 109B | 16 | 10M | MoE + iRoPE | ✅ | ~$0.10-0.20 |
| Llama 4 Maverick | 17B | 400B | 128 | 1M | MoE | ✅ | ~$0.22 |
| Gemma 4 31B | 31B (dense) | 31B | - | 256K | Dense | ✅ | ~$0.15-0.25 (API) |
| GPT-5 | - | - | - | 1.05M | Propietario | ❌ | $1.25 |
| Claude Opus 4.8 | - | - | - | ~200K | Propietario | ❌ | $5.00 |
Nota: Precios de APIs aproximados (Together, Fireworks, Bedrock para Llama;厂商 oficial para otros).
Tabla 2: Benchmarks comparativos
| Modelo | MMLU | HumanEval | MATH | GPQA | SWE-bench | LMArena / MT-Bench |
|---|---|---|---|---|---|---|
| Llama 4 Scout | ~82.1% | ~78.1% | ? | ? | ? | ~1350+ |
| Llama 4 Maverick | 88.3% | 88.0% | 83.0% | 69.8% | 38.4% | ~1400+ |
| Gemma 4 31B | 87.1% | 76.8% | 43.2% | ? | ? | MT-Bench 8.52, ELO 1247 |
| GPT-5 | 91.5% | 95.8% | 95.2% | 81.3% | 57.2% | - |
| Claude Opus 4.8 | 92.9% | 96.9% | 96.9% | 86.4% | 76.0% | - |
Fuentes: PromptChief (para GPT-5, Claude, Maverick), Gemma4-ai.com (Gemma 4), AIMadeTools/n1n.ai (Llama 4 familia). Discrepancias metodológicas: MMLU vs MMLU-Pro, diferentes Few-shot, fechas de evaluación.
Interpretación de datos
Scout tiene un perfil claramente especializado:
- MMLU 82.1%: aceptable para un modelo de 17B activos, pero 6-10 puntos por debajo de Maverick y Gemma 4 31B. En conocimiento general, no compite.
- HumanEval ~78.1%: decente para coding, pero lejos del 88%+ de Maverick y 95%+ de Claude/GPT-5. No es un modelo de coding top.
- Contexto 10M: su principal ventaja. Ningún modelo open-weight ofrece tanto. Maverick se queda en 1M, Gemma 4 en 256K, frontier models en ~1-2M.
- Eficiencia MoE: solo activa 17B de 109B por token, lo que permite inferencia relativamente rápida para su capacidadtotal.
- Pricing: ~$0.10-0.20 por 1M tokens es 5-50× más barato que frontier models.
Fortalezas
-
Contexto masivo (10M tokens): Único en open-weight. Permite meter repositorios enteros, libros, o historiales de chat de años en un solo prompt. Para RAG sobre documentos extensos, es una ventaja práctica enorme.
-
Eficiencia MoE: 17B parámetros activos significan latencia y coste reducidos comparado con un modelo dense de 109B. En GPUs modernas (A100, H100) alcanza 95+ tokens/segundo (n1n.ai).
-
Open-weight + licencia comercial (hasta 700M MAU): Puedes descargar pesos y ejecutar donde quieras, sin vendor lock-in. crucial para empresas con requisitos de privacidad o coste a escala.
-
Multimodalidad nativa: Procesa texto e imagen en el mismo modelo, útil para documentos escaneados o diagramas de código. (A diferencia de algunos modelos solo-texto).
-
Despliegue flexible: Soporta Ollama (
ollama pull llama4-scout), vLLM, TGI. Requisitos modestos: ~32GB RAM en Q4_K_M, o 4×A100 para producción. -
Costo accesible: ~$0.10-0.20/M tokens en APIs cloud es orders of magnitude más barato que Claude/OpenAI. Para alto volumen, justifica auto-hospedaje.
-
iRoPE para contexto largo: Interleaved Rotary Position Embeddings mitiga “lost-in-the-middle” y permite extrapolar más allá de los 256K de pre-entrenamiento.
Debilidades
-
Razonamiento inferior a Maverick: En benchmarks de lógica, matemáticas y código, Maverick (+6-10 puntos) y Gemma 4 (+5-7 puntos) lo superan claramente. No es frontier-tier.
-
SWE-bench desconocido (bajo): Inferimos que, dado que Maverick solo logra 38.4%, Scout debería estar más bajo aún. Para automation de código real, no es confiable.
-
MMLU 82.1% vs 87-93% de competidores: Conocimiento general limitado. No esperes la profundidad de Claude o GPT-5 en temas especializados.
-
Licencia 700M MAU: Si tu producto supera 700 millones de usuarios activos mensuales, necesitas licencia comercial separate con Meta. Cuidado en escalamiento.
-
Estado de frontera incierto: Meta no ha publicado resultados oficiales extensos para Scout; muchos datos vienen de evaluaciones third-party. Podría haber variaciones no reportadas.
-
Vision no optimizada para EU: La licencia restringe características de visión para usuarios de la UE por regulaciones. Si estás en Europa, podrías no poder usar la multimodalidad.
-
Throughput costoso a 10M: Aunque MoE ayuda, procesar 10M tokens por request sigue siendo compute-intensive. En auto-hospedaje, necesitas hardware de gama alta para producción.
-
Sin fine-tuning oficial (aún): A diferencia de otros modelos open-weight, Meta no ha liberado herramientas de fine-tuning específicas para Llama 4. Debes adaptar scripts de Llama 3 o usar LoRA genéricos.
Casos de uso recomendados
✅ RAG sobre corpus gigantes: Si tu knowledge base son codebases completas, log files de años, o libros técnicos, los 10M tokens de Scout permiten inyectar todo el contexto relevante en un solo prompt, evitando chunking y pérdida de coherencia.
✅ Análisis de código a gran escala: Para refactorizaciones masivas, búsqueda de vulnerabilidades en repositorios enteros, o generación de documentación API, Scout puede procesar el códigobase completo en una pasada.
✅ Edge/on-device con contexto razonable: Con 32GB RAM (Q4) corre en estaciones de trabajo poderosas o edge servers. Para aplicaciones locales que necesitan memoria de conversación extensa (ej. asistentes de programación con historial completo), es viable.
✅ Prototipado de largo-contexto sin vendor lock-in: Si quieres experimentar con 10M contexto antes decommitir a una solución proprietary, Scout es la única opción open-weight.
❌ Coding agents de producción: SWE-bench probablemente <40%. Para agents que deben resolver issues reales de GitHub, Maverick (38.4%) ya es justo; Scout sería peor. Usa Claude Opus o GPT-5 para coding agents.
❌ Razonamiento matemático/científico: MMLU 82% y MATH desconocido (bajo). Para problemas que requieren deduct logic avanzada, Better: DeepSeek V4 Pro, o3, Claude.
❌ Aplicaciones de bajo coste por token: Aunque Scout es barato en comparación a frontier, sigue siendo más caro que modelos tiny (Llama 3.2 3B, Gemma 2B). Si tu volumen es enorme y la tarea es simple (clasificación, extracción), un modelo pequeño dense rinde más por dólar.
❌ Usuarios en UE que necesitan visión: Restricción de licencia puede bloquear características multimodales. Verifica con asesor legal antes de implementar.
Alternativas
Llama 4 Maverick
- Ventajas sobre Scout: Mejor en todos los benchmarks (MMLU 88.3% vs 82.1%, HumanEval 88% vs 78%), 1M contexto (aún largo), mismo MoE efficiency.
- Desventajas: Precio ligeramente mayor ($0.22 vs $0.10-0.20), contexto 10× menor, mismo requisito de licencia.
- ¿Cuándo elegirlo? Si tu prioridad es calidad de razonamiento sobre contexto máximo. Maverick es elLlama 4 “todo-terreno” y open-weight competitivo con frontier en muchas tareas.
Gemma 4 31B
- Ventajas sobre Scout: MMLU 87.1% (vs 82.1%), HumanEval 76.8% (similar), MT-Bench 8.52, ELO 1247. Licencia Apache 2.0 (sin restricciones de MAU). Mejor throughput en GPUs consumer (RTX 4090: 28 t/s vs Scout ~?).
- Desventajas: Solo 256K contexto, dense (no MoE), por lo que más lento por token que Scout en hardware limitado.
- ¿Cuándo elegirlo? Si no necesitas >256K contexto y quieres licencia más permisiva + mejor rendimiento general en benchmarks. Es el mejor open-weight dense.
GPT-5
- Ventajas sobre Scout: MMLU 91.5%, HumanEval 95.8%, reasoning top-tier, ecosistema maduro, multimodal completo, 1M+ contexto, fine-tuning disponible.
- Desventajas: Propietario, carísimo ($1.25+), lock-in con OpenAI, no open-weight.
- ¿Cuándo elegirlo? Cuando la calidad es primordial y el presupuesto no es limitado. Para agentes de coding, investigación, o aplicaciones críticas.
Claude Opus 4.8
- Ventajas: Liderazgo en coding (SWE-bench 76%), honestidad mejorada, Dynamic Workflows, ecosistema robusto.
- Desventajas: Más caro ($5), solo texto (no multimodal), contexto ~200K.
- ¿Cuándo elegirlo? Si tu caso de uso es coding agents, code review, o tareas que requieren alta fiabilidad y consistencia.
Veredicto final
Comprar si tu principal necesidad es procesar contexto muy largo (codebases enteras, libros, conversaciones históricas) y necesitas open-weight para auto-hospedaje o privacidad. Scout es, a junio 2026, el único modelo open-weight con 10M tokens reales (no solo teóricos). Su rendimiento en razonamiento puro es mediocre, pero para RAG y análisis de documentos gigantes, el contexto extra compensa. Precio accesible (~$0.10-0.20/M tokens) y despliegue flexible (Ollama, vLLM) lo hacen práctico para equipos técnicos.
Evitar si tu prioridad es máxima calidad en coding, matemáticas o conocimiento general. En esos casos, Maverick o Gemma 4 ofrecen mejor rendimiento por token. Tampoco elijas Scout si estás en la UE y necesitas visión (restricción de licencia), o si tu producto superará 700M MAU (necesitas licencia comercial con Meta).
Nota final: Los 10M tokens son impresionantes en papel, pero en práctica, la calidad de attention a través de 10M tokens puede degradarse (lost-in-the-middle). iRoPE ayuda, pero prueba con tu propio corpus antes de commitir. Para la mayoría de casos de uso, 1M (Maverick) o 256K (Gemma 4) son suficientes. Solo escala a 10M si realmente llenarías ese contexto.
Rating: 3.5/5 — Buena implementación de una idea arriesgada (10M contexto open-weight), pero no es un modelo top en razonamiento. Su valor depende completamente de si necesitas ese contexto extremo.
Preguntas frecuentes
- ¿Cuánto cuesta ejecutar Scout auto-hospedado? ~$0.10-0.20 por 1M tokens en cloud APIs. Auto-hospedado: necesitas 4×A100 (80GB) para producción, o 32GB RAM en Q4 para prototyping. Coste de infraestructura depende de tu escala.
- ¿Se puede hacer fine-tuning? Oficialmente no hay scripts de fine-tuning de Meta, pero la comunidad ha adaptado LoRA para Llama 4. Espera instrucciones oficiales.
- ¿Vale la pena vs Maverick? Sí, solo si 10M contexto es unrequirement hard. Para la mayoría de tareas, Maverick rinde mejor en benchmarks y sigue teniendo 1M (que ya es mucho).
- ¿Qué cuantización recomiendas? Q4_K_M (Ollama) para balance calidad/tamaño. Q8 si tienes RAM de sobra. FP16 solo para investigación.
- ¿Soporta function calling? Según documentación, sí, compatible con OpenAI schema. Pero no tan robusto como Claude/GPT.
- ¿Disponibilidad geográfica? APIs cloud (Together, Fireworks, Bedrock) tienen cobertura global, pero revisa restricciones de licencia para UE (visión).
- ¿Es realmente open-weight? Sí, pesos disponibles en Hugging Face bajo licencia comunitaria de Meta. No OSI-approved pero permite uso comercial con límites.
- ¿Cuándo lanzarán Behemoth? Rumores apuntan a finales 2026. Será el modelo de conocimiento masivo (2T+ params) para distillation, no deployment directo.
Checklist antes de publicar
-
reviewStatus: complete - Metodología explícita (~200 palabras)
- Tablas de benchmarks comparativos (Llama 4 Maverick, Gemma 4, GPT-5, Claude Opus 4.8)
- Fortalezas y debilidades concretas
- Veredicto claro con condiciones (on-device, edge, RAG)
- Rating justificado (3.5/5)
- Tags canónicos: llama-4, scout, open-weights, review, benchmark, modelos, contexto-largo, rag
- Frontmatter completo con hub, contentType, searchIntent, verdict
- Más de 900 palabras (~1,200+ palabras)
- Enlaces internos sugeridos: [Llama 4 Maverick review] (si existe), [Gemma 4 review] (si existe), [editorial sobre open-weight models]
- Lint editorial pasado