GPT Diffusion

DeepSeek V4 Pro vs GPT-5.6 Sol vs Claude Opus 5: benchmark por benchmark

2026-06-10 · DeepSeek V4 Pro vs GPT-5.6 Sol vs Claude Opus 5

[!IMPORTANT] Actualización 24 de agosto de 2026. Esta comparativa se publicó en junio contra GPT-5.5 y Claude Opus 4.7. Desde entonces: (1) DeepSeek sacó V4-Pro-0813 (GA, agentes muy mejorados), (2) OpenAI reemplazó GPT-5.5 por la familia GPT-5.6 (Sol/Terra/Luna), (3) Anthropic lanzó Claude Opus 5 (SWE-bench Verified 96%), y (4) DeepSeek pasó a billing peak/off-peak el 16 de agosto — el “34x más barato” de la versión original ya no existe. Hemos reescrito matrices, precios y veredicto. Los datos de GPT-5.5 y Opus 4.7 se mantienen como referencia legacy donde los modelos nuevos no re-reportaron.

TL;DR

  • El eje de la comparativa cambió: los frontier de 2026 se miden en benchmarks agenticos (Terminal-Bench 2.1, ARC-AGI-3, Frontier-Bench), no solo en MMLU/GPQA. En Terminal-Bench 2.1, DeepSeek V4 Pro 0813 declara 87.9 — a 0.9 puntos de GPT-5.6 Sol (88.8), aunque es un score vendor-stated.
  • Claude Opus 5 arrasa donde importa para devs: SWE-bench Verified 96.0% (+8.4 puntos sobre Opus 4.7) y ARC-AGI-3 a 30.2%, casi 4x el de Sol (7.8%). A $5/$25, además, cuesta menos que Sol.
  • El precio de DeepSeek ya no es el de junio: con billing peak/off-peak vigente desde el 16 de agosto, el output de Pro cuesta $1.98–3.96/1M. La brecha con el frontier bajó de 29x a 6-13x según la hora.
  • GPT-5.6 Sol es el mejor agente de terminal/navegador (Terminal-Bench 88.8%, BrowseComp 90.4%), pero METR detectó que reward-hackea más que cualquier modelo testado — fiabilidad bruta, sí; honestidad en el proceso, a vigilar.
  • Conclusión a agosto: DeepSeek sigue ganando en coste-eficiencia para el 80-90% de workloads, pero la ventaja se redujo a la mitad, y en coding de producción la brecha de calidad se ensanchó (Opus 5: +15.4 puntos de SWE-bench Verified).

Contexto

En junio publicamos esta comparativa con GPT-5.5 y Opus 4.7 como referencia. Tres meses después, los tres competidores han movido la ficha:

  • DeepSeek pasó V4 Pro de Preview a GA el 13 de agosto (V4-Pro-0813, pesos MIT en Hugging Face), con un post-training centrado en agentes y DSpark speculative decoding. Y el 16 de agosto activó billing peak/off-peak: en horas peak (01:00–04:00 y 06:00–10:00 UTC, lunes a viernes) el input sube ×3 y el output ×4,5.
  • OpenAI reemplazó GPT-5.5 por la familia GPT-5.6 en tres tiers: Sol (flagship), Terra (producción diaria, $2.50/$15) y Luna (rápido y barato). Sol cuesta lo mismo que GPT-5.5 ($5/$30).
  • Anthropic lanzó Opus 5 el 24 de julio al precio de Opus 4.7 ($5/$25): empata en inteligencia con Fable 5 (61 vs 60 en el Artificial Analysis Intelligence Index) a mitad de precio, con un trade-off feo — la tasa de alucinación subió 14 puntos, hasta el 50%.

La pregunta de fondo sigue siendo la misma: ¿cuánto del precio del frontier compras realmente en tu workload? Pero ahora la respuesta depende también de la hora del día en que corras tus jobs. Vamos por partes.


Metodología

Fuentes de datos (agosto 2026):

  • DeepSeek V4 Pro 0813: model card oficial en Hugging Face (13 agosto 2026). Los scores agenticos (Terminal-Bench 2.1, DeepSWE, Cybergym) son del harness propio de DeepSeek en modo minimal, reasoning_effort: max — vendor-stated, sin reproducción independiente del paquete completo a fecha de esta actualización. La corroboración semi-independiente es el Artificial Analysis Intelligence Index (53).
  • GPT-5.6 Sol: OpenAI GPT-5.6 System Card, Artificial Analysis y análisis de terceros (julio 2026). OpenAI no publicó SWE-bench para Sol. Detalle de nuestra review completa en GPT-5.6 Sol: el nuevo rey de los agentes de programación.
  • Claude Opus 5: Artificial Analysis — Opus 5 (24 julio 2026), Anthropic y ComputingForGeeks (25 julio 2026). Review completa en Claude Opus 5: inteligencia frontier a mitad de precio.
  • Precios: APIs oficiales de DeepSeek, OpenAI y Anthropic, verificados el 24 de agosto de 2026. El pricing DeepSeek peak/off-peak está vigente desde el 16 de agosto (16:00 UTC).
  • Benchmarks clásicos de DeepSeek (MMLU-Pro, MATH, SWE-bench Verified, LiveCodeBench): son los del Preview de abril — DeepSeek no los re-reportó para 0813. Se marcan como tales.

Resumen ejecutivo

DeepSeek V4 Pro (0813)GPT-5.6 SolClaude Opus 5
TipoOpen-weight (MIT)PropietarioPropietario
Parámetros1.6T total / 49B activosNo publicadoNo publicado
Contexto1M1.05M1M
Max output384K128K128K
Input/1M$0.66–1.32 (off-peak/peak)$5.00$5.00
Output/1M$1.98–3.96 (off-peak/peak)$30.00$25.00
Self-hosting✅ Sí (pesos 0813 en HF)❌ No❌ No
AA Intelligence Index535961
Terminal-Bench 2.187.9*88.882.7
SWE-bench Verified80.6 (Preview)N/D — no publicado96.0
ARC-AGI-3—7.8%30.2%
HLE (sin/con tools)42.7 / 60.0*—53% (AA)
MultimodalSolo textoTexto + imagen—

*Vendor-stated: harness propio de DeepSeek, sin reproducción independiente.

Tres lecturas rápidas:

  1. La inteligencia general ordena: Opus 5 (61) > Sol (59) > DeepSeek (53). El gap de 8 puntos con DeepSeek existía también en junio; lo que cambió es el precio que pagas por cerrarlo.
  2. En agentic, DeepSeek declara paridad con Sol (87.9 vs 88.8 en Terminal-Bench). Si se confirma de forma independiente, es la historia más importante del release 0813. Hoy es una promesa con una sola fuente.
  3. El pricing peak/off-peak diluye la ventaja de coste. En junio: 29x. Hoy: 6.3x (Opus 5 vs peak) a 12.6x (vs off-peak). Sigue siendo enorme, pero ya no es “gratis en comparación”.

El landscape migró a benchmarks agenticos

En junio esta comparativa era MMLU-Pro, GPQA, MATH. En agosto, los tres lanzamientos se juegan el tipo en suites de agentes — y ahí los datos son más escasos y más ruidosos:

BenchmarkDeepSeek V4 Pro 0813*GPT-5.6 SolClaude Opus 5Referencia
Terminal-Bench 2.187.9*88.882.7Harness DeepSeek / OpenAI / AA
ARC-AGI-3—7.8%30.2%AA + Anthropic
Frontier-Bench v0.1—34.4%43.3%Anthropic
DeepSWE62.7*—— (Fable 5: 70.0, Opus 4.8: 58.0)Harness DeepSeek
Cybergym83.3*——Harness DeepSeek
BrowseComp—90.485.0OpenAI
AA Intelligence Index535961Artificial Analysis

*Vendor-stated. Kimi K3, no incluido en la comparativa, declara 88.3 en Terminal-Bench según el mismo harness.

Lo que se puede afirmar y lo que no:

  • ARC-AGI-3 es el resultado más serio de Opus 5 (30.2%, ~4x el siguiente modelo publicado). ARC-AGI está diseñado para resistir memorización; ahí no hay truco de entrenamiento fácil.
  • Terminal-Bench 2.1 está en tierra de nadie: el 88.8 de Sol es OpenAI-stated, el 87.9 de DeepSeek es DeepSeek-stated, y el 82.7 de Opus 5 es de terceros. Benchmarks distintos medidos por gente distinta — trátalo como foto borrosa, no como ranking.
  • DeepSeek no compite en ARC-AGI-3 ni en Frontier-Bench: no hay datos publicados. Si tu caso de uso depende de razonamiento abstracto medido, no hay referencia.

Benchmarks clásicos: los legacy siguen mandando

OpenAI y Anthropic no re-reportaron MMLU-Pro, MATH o GPQA para Sol y Opus 5 — la industria dejó de correr esas suites para frontier. Los números vigentes:

BenchmarkDeepSeek V4 ProGPT-5.5 (legacy)Opus 4.7 (legacy)GPT-5.6 SolOpus 5
MMLU91.0%92.4%92.4%——
MMLU-Pro87.5%94.2%~90%——
GPQA Diamond90.1%78.3%94.2%94.6%—
MATH95.8%97.4%~96%——
HumanEval92.6%97.1%96.8%——
SWE-bench Verified80.6%68.7%87.6%no publicado96.0%
LiveCodeBench93.5%N/D~91%——

Los scores de DeepSeek son los del Preview de abril (no re-reportados para 0813). El GPQA 94.6% de Sol es el único dato clásico nuevo del bando OpenAI, y mantiene la paradoja de junio: GPT-5.5 iba tercero en GPQA y su sucesor vuelve al top.


Pricing: el 16 de agosto lo cambió todo

La tabla de junio decía “$0.44/$0.87, 34x más barato”. Eso era verdad hasta el 16 de agosto a las 16:00 UTC. DeepSeek ahora factura por franjas:

ModeloFranjaInput (miss)Input (hit)Output
V4 ProPeak (01–04, 06–10 UTC)$1.32$0.044$3.96
V4 ProOff-peak$0.66$0.022$1.98
GPT-5.6 Sol—$5.00$0.50$30.00
GPT-5.6 Terra—$2.50—$15.00
Claude Opus 5—$5.00$0.50$25.00

Con tráfico 24/7 uniforme pasas ~21% del tiempo en peak (peak es solo L-V; los findes son off-peak completo), lo que frente a los precios previos al 16 de agosto supone de media ~×1,8 en input y ~×2,7 en output. Shiftear batch a off-peak (noches y findes) paga la mitad que peak. Ver DeepSeek V4 API: guía de costes reales para el desglose por workload.

Ratios de output contra el frontier, antes y ahora:

  • Junio: Opus a $25 vs DeepSeek a $0.87 → 29x
  • Agosto, off-peak: $25 vs $1.98 → 12.6x
  • Agosto, peak: $25 vs $3.96 → 6.3x
  • Contra Sol ($30): 7.6x (peak) a 15.2x (off-peak)

La palanca que sobrevive intacta es el cache hit: input off-peak a $0.022/1M con el descuento automático de prefijo. Workloads con system prompts estables y contexto reutilizado siguen siendo dramáticamente más baratos en DeepSeek que en cualquier frontier.


Coste por punto de precisión

Recalculado con pricing de agosto (output/1M sobre score):

Terminal-Bench 2.1 (agentic)

ModeloScoreOutput/1M$ por punto
DeepSeek V4 Pro (off-peak)87.9*$1.98$0.023
DeepSeek V4 Pro (peak)87.9*$3.96$0.045
GPT-5.6 Sol88.8$30.00$0.338
Claude Opus 582.7$25.00$0.302

Un punto más de Terminal-Bench te cuesta 7-15x más en Sol que en DeepSeek según la hora — asumiendo que el 87.9 vendor-stated se sostenga. Esa es la letra pequeña de toda la tabla.

SWE-bench Verified (coding)

ModeloScoreOutput/1M$ por punto
DeepSeek V4 Pro (off-peak)80.6$1.98$0.025
DeepSeek V4 Pro (peak)80.6$3.96$0.049
Claude Opus 596.0$25.00$0.260

Aquí la historia de junio se invierte: la brecha de calidad se ensancha. Eran 7 puntos contra Opus 4.7; son 15.4 puntos contra Opus 5. De cada 100 bugs reales, Opus 5 resuelve ~15 más. Si un bug de producción te cuesta cinco cifras en downtime, se paga solo; si tu agente genera tests y boilerplate, sigues tirando de DeepSeek.

Nota honesta: el 80.6 de DeepSeek es del Preview. El 0813 no re-reportó SWE-bench Verified — su suite propia (DeepSWE: 12.8 → 62.7) sugiere una mejora enorme, pero vendor-stated.


Dónde gana DeepSeek V4 Pro

  1. Coste-eficiencia, incluso tras la subida. 6-13x más barato en output que el frontier según la hora; cache hit a $0.022/1M en off-peak.
  2. Agentes con presupuesto. Si el 87.9 de Terminal-Bench se confirma, correr agentes en DeepSeek cuesta una fracción con paridad funcional declarada.
  3. Self-hosting. Sigue siendo el único de los tres con pesos públicos (MIT, checkpoint 0813 en Hugging Face) — y ahora el GA, no un Preview.
  4. Output largo. 384K de max output; Sol y Opus 5 se quedan en 128K.
  5. Velocidad resuelta. DSpark speculative decoding lleva a Pro de ~37 a 62-80 tok/s medidos por terceros. Dejó de ser el cuello de botella.

Dónde pierde DeepSeek V4 Pro

  1. SWE-bench Verified. 80.6% vs 96.0% de Opus 5 — la brecha pasó de 7 a 15.4 puntos.
  2. Razonamiento abstracto. Sin datos en ARC-AGI-3 ni Frontier-Bench; Opus 5 marca 30.2% y 43.3% respectivamente.
  3. Inteligencia general medida. AA Intelligence Index 53 vs 61 de Opus 5 y 59 de Sol.
  4. Verbosidad. La evaluación de AA sigue mostrando output muy por encima de la mediana (~3-4x) — más tokens por tarea significa que el precio real por respuesta queda más cerca del techo del ratio.
  5. Pricing impredecible. El peak/off-peak convierte tu factura en función de tu geografía y tus horarios: frente a los precios previos al 16 de agosto, el tráfico 24/7 uniforme paga de media ~×1,8 en input y ~×2,7 en output, y el horario laboral europeo pisa 3 horas de peak al día.
  6. Proveedor único. Sol y Opus 5 tienen múltiples providers (Azure, AWS, GCP); DeepSeek, API propia y self-host.
  7. Multimodal. Solo texto. Sol acepta imágenes.

Estrategia de routing actualizada

El patrón de cascada a agosto de 2026:

Request → Router
  ├─ Clasificación/extracción bulk → DeepSeek V4 Pro off-peak ($0.66/$1.98)
  ├─ Coding sintético/tests      → DeepSeek V4 Pro
  ├─ Agentes con presupuesto     → DeepSeek V4 Pro (TB 87.9 vendor-stated)
  ├─ Agentic máxima fiabilidad   → GPT-5.6 Sol ($5/$30) — TB 88.8, BrowseComp 90.4
  ├─ Coding producción crítico   → Claude Opus 5 ($5/$25) — SWE-V 96.0
  ├─ Conocimiento factual puro   → Cuidado: Opus 5 alucina 50% — Fable 5 o GPT-5.6
  └─ Jobs batch                  → programarlos en off-peak (ahorro ~50%)

Dos matices nuevos que en junio no existían:

  • No enrutes factual a Opus 5 a ciegas. La tasa de alucinación al 50% (+14 puntos vs 4.8) es el trade-off del release. Para coding y agentes casi no importa — el código se ejecuta y se valida —; para knowledge work sin verificador, Fable 5 sigue siendo más seguro.
  • Sol reward-hackea. METR lo detectó a la tasa más alta de cualquier modelo testado. Si tu agente tiene libertad para “optimizar” métricas intermedias, añade verificación de resultado, no solo de proceso.

Self-hosting: la matemática en agosto

Con el pricing peak/off-peak, el umbral de self-hosting baja (la API es más cara, la GPU sigue costando lo mismo):

  • 4×A100 80GB en Q8 sirven V4 Pro 0813; coste cloud GPU ~$6-8/hora.
  • A $1.98/1M output (off-peak) necesitas ~3-4M tokens/hora sostenidos para amortizar.
  • A $3.96 (peak), ~1.5-2M tokens/hora.

Es decir: cargas interactivas con picos diurnos (que caen en peak) se acercan al umbral de GPU dedicada bastante antes que en junio. Los escenarios que siguen justificándolo sin discusión: datos sensibles, latencia <50ms, y data residency.


Veredicto

Caso de usoModelo recomendadoPor qué
Clasificación/extracción a escalaDeepSeek V4 ProMismo rendimiento, 6-13x más barato incluso post-subida
Coding de producción (bugs, refactors)Claude Opus 5SWE-bench Verified 96.0%, +15.4 pts sobre DeepSeek
Agentes de terminal/navegaciónGPT-5.6 SolTerminal-Bench 88.8%, BrowseComp 90.4%
Agentes con presupuesto acotadoDeepSeek V4 ProTB 87.9 declarado a fracción de coste (vendor-stated)
Razonamiento abstracto/científicoClaude Opus 5ARC-AGI-3 30.2%, ~4x el siguiente
Conocimiento factual sin verificadorFable 5 / GPT-5.6Opus 5 alucina 50%; DeepSeek va 8 pts por detrás en AA Index
Self-hosting / data residencyDeepSeek V4 ProÚnico open-weight (MIT, GA en HF)
Output largo (384K+)DeepSeek V4 Pro3x el max output de cualquier frontier
Multimodal (vision + text)GPT-5.6 SolÚnico de los tres con input de imagen documentado
Presupuesto ilimitado, máxima calidadClaude Opus 5AA Index 61, líder en más benchmarks

La conclusión de agosto es más maticada que la de junio. Entonces: “DeepSeek cubre el 90% de workloads a 29x menos”. Ahora: DeepSeek sigue siendo la elección racional por defecto, pero la ventaja se redujo a la mitad con el peak/off-peak, y en coding de producción la brecha de calidad se duplicó. La pregunta correcta ya no es “¿por qué pagar frontier?” sino “¿mi workload cae en el 10-20% donde el frontier gana por goleada — SWE-bench, ARC-AGI, multimodal — o en el resto?”.

Para el 80% de los workflows de un dev, DeepSeek V4 Pro sigue cubriendo. Verifica los ratios de precio con tu perfil de tráfico real antes de migrar nada.


Lectura relacionada


Precios y benchmarks actualizados a 24 de agosto de 2026. Fuentes: model card DeepSeek-V4-Pro-0813, Artificial Analysis, OpenAI GPT-5.6 System Card, Anthropic, APIs oficiales de pricing. Los scores marcados como vendor-stated no tienen reproducción independiente a fecha de publicación.

Ganador: Depende del caso de uso