GPT Diffusion

Review: Claude Opus 5 — inteligencia frontier a mitad de precio que Fable 5

2026-08-05 · ⭐ 4.5/5 · claude-opus-5

TL;DR

Claude Opus 5 se lanzó el 24 de julio de 2026 a $5/$25 por millón de tokens, exactamente el mismo precio que Opus 4.8 y la mitad de lo que cuesta Fable 5. El deal: inteligencia prácticamente idéntica a Fable 5 (61 vs 60 en el Artificial Analysis Intelligence Index), liderazgo outright en benchmarks agenticos como Frontier-Bench y GDPval-AA, y un toggle de effort de 5 niveles que te deja controlar cuánto piensa el modelo antes de responder.

El catch: la tasa de alucinación subió 14 puntos respecto a Opus 4.8, hasta el 50%. Opus 5 responde más a menudo cuando no debería. Para coding y agentes eso casi no importa porque el código se ejecuta y se valida. Para conocimiento factual puro, Fable 5 sigue siendo la opción más segura.

Rating: 4.5/5.

Contexto

Anthropic posiciona Opus 5 entre Sonnet 5 ($3/$15 intro) y Fable 5 ($10/$50) en su lineup. El mensaje de lanzamiento es inusual para un release frontier: el precio no baja, los specs no se duplican. Lo que cambia es cuánta inteligencia obtienes por ese dinero, y cómo el modelo decide gastar tokens pensando.

El modelo se identifica como claude-opus-5 en la API. Es el modelo por defecto en Claude Max. Tiene contexto de 1M de tokens, output máximo de 128k tokens, y un knowledge cutoff de mayo 2026, el más fresco de toda la línea Claude (4 meses por delante de Fable 5).

Tres cosas rotas o cambiadas respecto a Opus 4.8 que vas a notar si migras:

  1. thinking: {type: "enabled"} con un budget de tokens ya no funciona. Solo se soporta type: "adaptive". Si tu código setea el tipo viejo, la petición falla.
  2. Adaptive thinking viene activado por defecto. En 4.8 era opt-in.
  3. Hay 5 niveles de effort (low, medium, high, xhigh, max) en lugar del binario de antes. El default es high.

Metodología

Esta review se basa en:

  1. Artificial Analysis (artificialanalysis.ai): Intelligence Index, GDPval-AA v2, AA-Briefcase, Terminal-Bench, AA-Omniscience. AA colaboró con Anthropic en la evaluación previa al lanzamiento y publicó los resultados el 24 de julio.
  2. ComputingForGeeks (computingforgeeks.com): benchmarks de Anthropic (SWE-bench, Frontier-Bench, ARC-AGI-3, CursorBench) más tests propios en DevOps real (Terraform, Kubernetes, Bash) con linters como judge, ejecutados el 25 de julio.
  3. claude5.ai: desglose independiente de SWE-bench Verified (96.0%), SWE-bench Pro (79.2%), Frontier-Bench (43.3%).
  4. Leaderboard local (leaderboard-history.db): confirmación de precios y rankings en la base de inteligencia de Hermes, registrados el 27 de julio.

No se realizaron pruebas API directas en esta review por coste. Los benchmarks citados son de fuentes independientes o reproducibles vía la API pública de Anthropic (curl https://api.anthropic.com/v1/models/claude-opus-5).

Resultados

Benchmarks de inteligencia y razonamiento

BenchmarkOpus 5 (max)Fable 5 (max)GPT-5.6 Sol (max)Opus 4.8 (max)
AA Intelligence Index61.0 (#1)60.059.056.0
ARC-AGI-330.2%7.8%
GDPval-AA v2 (Elo)18611760 (+114)17361600
AA-Briefcase (Elo)17201583 (+146)
Terminal-Bench v2.189%~líder
Humanity’s Last Exam53%53%

Opus 5 no gana por mucho en el Intelligence Index (1 punto sobre Fable 5), pero gana donde el coste por task importa. AA reporta $2.03 de media por tarea del Intelligence Index, frente a $2.75 de Fable 5. Eso es 26% menos coste por unidad de inteligencia.

ARC-AGI-3 es el resultado más llamativo: 30.2%, aproximadamente 3 veces el siguiente modelo publicado (GPT-5.6 Sol a 7.8%). ARC-AGI está diseñado para resistir memorización, así que esto sugiere razonamiento genuino, no sobreajuste a datos de entrenamiento.

Benchmarks de coding y agentes

BenchmarkOpus 5Fable 5GPT-5.6 SolOpus 4.8
SWE-bench Verified96.0%95.0%88.6%
SWE-bench Pro79.2%80.0%69.2%
Frontier-Bench v0.143.3% (#1)33.7%34.4%~20%
CursorBench 3.2~Fable 5 (−0.5%)líder
OSWorld 2.0supera Fable 5 a ⅓ del coste
Zapier AutomationBench~1.5× pass rate del siguiente

Frontier-Bench es donde Opus 5 se distancia de todo el campo. 43.3% frente a 33.7% de Fable 5 y 34.4% de GPT-5.6 Sol. Anthropic dice que más que duplica el score de Opus 4.8 a un coste por tarea menor.

El test independiente de ComputingForGeeks en trabajo DevOps real (escribir un módulo OpenTofu, arreglar un Deployment de Kubernetes con 6 bugs, script de rotación de logs) confirma la dirección: Opus 5 produce código más defensivo y validado que Opus 4.8, a costa de más líneas y más tiempo de generación (301 líneas y 28s frente a 194 líneas y 19s en el módulo Terraform).

SWE-bench Pro es el único benchmark donde Fable 5 (80.0%) y Mythos 5 (80.3%) siguen por encima de Opus 5 (79.2%). La diferencia es menor a 1 punto.

Pricing y coste

ModeloInput/MTokOutput/MTokContextoCache writeCache hit
Opus 5$5$251M$6.25$0.50
Opus 4.8$5$251M$6.25$0.50
Fable 5$10$501M
Sonnet 5 (intro)$2$101M
GPT-5.6 Sol$5$30

Precio idéntico a Opus 4.8. Misma estructura de cache: 25% de premium en writes, 90% de descuento en hits, TTL de 5 minutos.

Fast mode: 2.5x más rápido a 2x el precio base. Es research preview, gated por waitlist en la API y accesible vía usage credits en Claude Code. No construyas un budget de latencia sobre esto hasta que tu cuenta tenga acceso.

Fortalezas

  • Inteligencia frontier a precio medio. 61 en el Intelligence Index empatado con Fable 5 que cuesta el doble. Para cargas de trabajo donde el coste por task importa (agentes en bucle, pipelines de coding), este es el modelo que cambia las matemáticas.
  • Liderazgo agentic. Frontier-Bench 43.3% (el siguiente es 34.4%). GDPval-AA 1861 Elo (+114 sobre Fable 5). Si tu uso es agentes que ejecutan tareas de conocimiento, Opus 5 es el líder medido.
  • ARC-AGI-3 a 30.2%. 3x el siguiente modelo. Es la señal más fuerte de que el razonamiento mejoró de forma real, no solo memorización.
  • Knowledge cutoff mayo 2026. El más fresco del lineup. Importa si trabajas con tooling reciente, APIs de proveedores o deprecaciones de Kubernetes.
  • Effort toggle de 5 niveles. Te deja controlar cuánto piensa. En GDPval-AA el rango es de 407 Elo points entre low y max, con uso de tokens ~8x. Para tareas rutinarias, bajar a medium o high ahorra sin degradar mucho.

Debilidades

  • Tasa de alucinación al 50%. Subió 14 puntos respecto a Opus 4.8. El modelo responde más a menudo cuando no debería. En AA-Omniscience la accuracy mejoró (+7 puntos) pero el modelo contesta cuando no sabe en lugar de decir “no sé”. Para coding esto se mitiga con tests y linters. Para conocimiento factual, Fable 5 sigue siendo más fiable.
  • SWE-bench Pro por debajo de Fable 5 y Mythos 5. 79.2% vs 80.0% y 80.3%. La diferencia es sub-1%, pero si tu workload es exclusivamente el Pro variant, Fable 5 sigue ganando.
  • Rotura de API en migración. thinking: {type: "enabled"} ya no funciona. Solo adaptive. Si tienes pipelines que setean el tipo viejo con un budget de tokens, se rompen al cambiar el model ID.
  • Effort toggle añade complejidad. 5 niveles es más control, pero también más superficie para configurarlo mal. El default es high, que no es ni el más barato ni el más inteligente. Tienes que saber qué nivel usar para cada tarea.
  • No supera a Fable 5 en factual knowledge. AA-Omniscience: Opus 5 mejora +7 puntos sobre 4.8 pero sigue por detrás de Fable 5, esperable dado el tamaño del modelo.

Casos de uso recomendados

Usa Opus 5 si:

  • Tu carga principal es coding, agentes o automatización de tareas de conocimiento. Aquí es el líder medido en múltiples benchmarks.
  • El coste por task importa. Frente a Fable 5 ahorras 26% por unidad de inteligencia con la misma calidad de output.
  • Necesitas contexto fresco (cutoff mayo 2026) para tooling reciente.
  • Quieres un solo modelo que cubra desde tareas rutinarias (effort low/medium) hasta razonamiento profundo (max).

Usa Fable 5 si:

  • Necesitas precisión factual máxima. Fable 5 alucina menos.
  • Tu workload depende de SWE-bench Pro específicamente.
  • El coste no es problema y quieres el top absoluto en conocimiento.

Usa Sonnet 5 si:

  • Tu budget es ajustado. El coste por task de Sonnet 5 ($1.53 en Intelligence Index) sigue siendo menor que Opus 5 ($2.03).
  • No necesitas el razonamiento deep de Opus 5 para la mayoría de tareas.

Quédate en Opus 4.8 si:

  • Tu código usa thinking: {type: "enabled"} y no quieres migrar ahora.
  • No necesitas el extra de inteligencia y tu workload actual funciona.

Alternativas

ModeloInteligencia (AA Index)Precio (in/out)Mejor para
Opus 561$5/$25Coding, agentes, coste-efficiency
Fable 560$10/$50Conocimiento factual, máxima calidad sin importar coste
GPT-5.6 Sol59$5/$30Coste-eficiencia en effort bajo, ecosystem OpenAI
Opus 4.856$5/$25Estabilidad, migración diferida
Sonnet 5~54$3/$15Budget ajustado, alta frecuencia

Veredicto final

Opus 5 es el mejor modelo calidad-precio del segmento frontier a fecha de agosto 2026. Lidera o empata en la mayoría de benchmarks relevantes para desarrollo y agentes, y lo hace a mitad de precio que su competidor más cercano en inteligencia pura (Fable 5).

La razón por la que no es 5 estrellas: la tasa de alucinación. Subir al 50% es un trade-off real. Anthropic mejoró la accuracy pero el modelo contesta cuando no debería, y eso es un problema para casos de uso donde no hay un test o un linter que valide la respuesta.

Si vienes de Opus 4.8 y tu carga de trabajo es coding o agentes, migra. Revisa antes que tu código no setea thinking: {type: "enabled"}. Si vienes de Fable 5 y tu prioridad es conocimiento factual, quédate donde estás.

Para una comparativa más amplia del landscape actual de modelos frontier, incluyendo DeepSeek V4 y Gemini 3.5, ver nuestra comparativa de modelos y el análisis completo de DeepSeek V4.

Fuentes

Veredicto: El mejor modelo calidad-precio del segmento frontier si tu carga de trabajo es coding o agentes. Baja a 4 estrellas si necesitas conocimiento factual puro: alucina más que Fable 5 y responde cuando no debería.
#claude#frontier-models#llm#benchmark#pricing#review