DeepSeek V4 Pro vs GPT-5.6 Sol vs Claude Opus 5: benchmark por benchmark
[!IMPORTANT] Actualización 24 de agosto de 2026. Esta comparativa se publicó en junio contra GPT-5.5 y Claude Opus 4.7. Desde entonces: (1) DeepSeek sacó V4-Pro-0813 (GA, agentes muy mejorados), (2) OpenAI reemplazó GPT-5.5 por la familia GPT-5.6 (Sol/Terra/Luna), (3) Anthropic lanzó Claude Opus 5 (SWE-bench Verified 96%), y (4) DeepSeek pasó a billing peak/off-peak el 16 de agosto — el “34x más barato” de la versión original ya no existe. Hemos reescrito matrices, precios y veredicto. Los datos de GPT-5.5 y Opus 4.7 se mantienen como referencia legacy donde los modelos nuevos no re-reportaron.
TL;DR
- El eje de la comparativa cambió: los frontier de 2026 se miden en benchmarks agenticos (Terminal-Bench 2.1, ARC-AGI-3, Frontier-Bench), no solo en MMLU/GPQA. En Terminal-Bench 2.1, DeepSeek V4 Pro 0813 declara 87.9 — a 0.9 puntos de GPT-5.6 Sol (88.8), aunque es un score vendor-stated.
- Claude Opus 5 arrasa donde importa para devs: SWE-bench Verified 96.0% (+8.4 puntos sobre Opus 4.7) y ARC-AGI-3 a 30.2%, casi 4x el de Sol (7.8%). A $5/$25, además, cuesta menos que Sol.
- El precio de DeepSeek ya no es el de junio: con billing peak/off-peak vigente desde el 16 de agosto, el output de Pro cuesta $1.98–3.96/1M. La brecha con el frontier bajó de 29x a 6-13x según la hora.
- GPT-5.6 Sol es el mejor agente de terminal/navegador (Terminal-Bench 88.8%, BrowseComp 90.4%), pero METR detectó que reward-hackea más que cualquier modelo testado — fiabilidad bruta, sí; honestidad en el proceso, a vigilar.
- Conclusión a agosto: DeepSeek sigue ganando en coste-eficiencia para el 80-90% de workloads, pero la ventaja se redujo a la mitad, y en coding de producción la brecha de calidad se ensanchó (Opus 5: +15.4 puntos de SWE-bench Verified).
Contexto
En junio publicamos esta comparativa con GPT-5.5 y Opus 4.7 como referencia. Tres meses después, los tres competidores han movido la ficha:
- DeepSeek pasó V4 Pro de Preview a GA el 13 de agosto (V4-Pro-0813, pesos MIT en Hugging Face), con un post-training centrado en agentes y DSpark speculative decoding. Y el 16 de agosto activó billing peak/off-peak: en horas peak (01:00–04:00 y 06:00–10:00 UTC, lunes a viernes) el input sube ×3 y el output ×4,5.
- OpenAI reemplazó GPT-5.5 por la familia GPT-5.6 en tres tiers: Sol (flagship), Terra (producción diaria, $2.50/$15) y Luna (rápido y barato). Sol cuesta lo mismo que GPT-5.5 ($5/$30).
- Anthropic lanzó Opus 5 el 24 de julio al precio de Opus 4.7 ($5/$25): empata en inteligencia con Fable 5 (61 vs 60 en el Artificial Analysis Intelligence Index) a mitad de precio, con un trade-off feo — la tasa de alucinación subió 14 puntos, hasta el 50%.
La pregunta de fondo sigue siendo la misma: ¿cuánto del precio del frontier compras realmente en tu workload? Pero ahora la respuesta depende también de la hora del día en que corras tus jobs. Vamos por partes.
Metodología
Fuentes de datos (agosto 2026):
- DeepSeek V4 Pro 0813: model card oficial en Hugging Face (13 agosto 2026). Los scores agenticos (Terminal-Bench 2.1, DeepSWE, Cybergym) son del harness propio de DeepSeek en modo minimal,
reasoning_effort: max— vendor-stated, sin reproducción independiente del paquete completo a fecha de esta actualización. La corroboración semi-independiente es el Artificial Analysis Intelligence Index (53). - GPT-5.6 Sol: OpenAI GPT-5.6 System Card, Artificial Analysis y análisis de terceros (julio 2026). OpenAI no publicó SWE-bench para Sol. Detalle de nuestra review completa en GPT-5.6 Sol: el nuevo rey de los agentes de programación.
- Claude Opus 5: Artificial Analysis — Opus 5 (24 julio 2026), Anthropic y ComputingForGeeks (25 julio 2026). Review completa en Claude Opus 5: inteligencia frontier a mitad de precio.
- Precios: APIs oficiales de DeepSeek, OpenAI y Anthropic, verificados el 24 de agosto de 2026. El pricing DeepSeek peak/off-peak está vigente desde el 16 de agosto (16:00 UTC).
- Benchmarks clásicos de DeepSeek (MMLU-Pro, MATH, SWE-bench Verified, LiveCodeBench): son los del Preview de abril — DeepSeek no los re-reportó para 0813. Se marcan como tales.
Resumen ejecutivo
| DeepSeek V4 Pro (0813) | GPT-5.6 Sol | Claude Opus 5 | |
|---|---|---|---|
| Tipo | Open-weight (MIT) | Propietario | Propietario |
| Parámetros | 1.6T total / 49B activos | No publicado | No publicado |
| Contexto | 1M | 1.05M | 1M |
| Max output | 384K | 128K | 128K |
| Input/1M | $0.66–1.32 (off-peak/peak) | $5.00 | $5.00 |
| Output/1M | $1.98–3.96 (off-peak/peak) | $30.00 | $25.00 |
| Self-hosting | ✅ Sí (pesos 0813 en HF) | ❌ No | ❌ No |
| AA Intelligence Index | 53 | 59 | 61 |
| Terminal-Bench 2.1 | 87.9* | 88.8 | 82.7 |
| SWE-bench Verified | 80.6 (Preview) | N/D — no publicado | 96.0 |
| ARC-AGI-3 | — | 7.8% | 30.2% |
| HLE (sin/con tools) | 42.7 / 60.0* | — | 53% (AA) |
| Multimodal | Solo texto | Texto + imagen | — |
*Vendor-stated: harness propio de DeepSeek, sin reproducción independiente.
Tres lecturas rápidas:
- La inteligencia general ordena: Opus 5 (61) > Sol (59) > DeepSeek (53). El gap de 8 puntos con DeepSeek existía también en junio; lo que cambió es el precio que pagas por cerrarlo.
- En agentic, DeepSeek declara paridad con Sol (87.9 vs 88.8 en Terminal-Bench). Si se confirma de forma independiente, es la historia más importante del release 0813. Hoy es una promesa con una sola fuente.
- El pricing peak/off-peak diluye la ventaja de coste. En junio: 29x. Hoy: 6.3x (Opus 5 vs peak) a 12.6x (vs off-peak). Sigue siendo enorme, pero ya no es “gratis en comparación”.
El landscape migró a benchmarks agenticos
En junio esta comparativa era MMLU-Pro, GPQA, MATH. En agosto, los tres lanzamientos se juegan el tipo en suites de agentes — y ahí los datos son más escasos y más ruidosos:
| Benchmark | DeepSeek V4 Pro 0813* | GPT-5.6 Sol | Claude Opus 5 | Referencia |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 87.9* | 88.8 | 82.7 | Harness DeepSeek / OpenAI / AA |
| ARC-AGI-3 | — | 7.8% | 30.2% | AA + Anthropic |
| Frontier-Bench v0.1 | — | 34.4% | 43.3% | Anthropic |
| DeepSWE | 62.7* | — | — (Fable 5: 70.0, Opus 4.8: 58.0) | Harness DeepSeek |
| Cybergym | 83.3* | — | — | Harness DeepSeek |
| BrowseComp | — | 90.4 | 85.0 | OpenAI |
| AA Intelligence Index | 53 | 59 | 61 | Artificial Analysis |
*Vendor-stated. Kimi K3, no incluido en la comparativa, declara 88.3 en Terminal-Bench según el mismo harness.
Lo que se puede afirmar y lo que no:
- ARC-AGI-3 es el resultado más serio de Opus 5 (30.2%, ~4x el siguiente modelo publicado). ARC-AGI está diseñado para resistir memorización; ahí no hay truco de entrenamiento fácil.
- Terminal-Bench 2.1 está en tierra de nadie: el 88.8 de Sol es OpenAI-stated, el 87.9 de DeepSeek es DeepSeek-stated, y el 82.7 de Opus 5 es de terceros. Benchmarks distintos medidos por gente distinta — trátalo como foto borrosa, no como ranking.
- DeepSeek no compite en ARC-AGI-3 ni en Frontier-Bench: no hay datos publicados. Si tu caso de uso depende de razonamiento abstracto medido, no hay referencia.
Benchmarks clásicos: los legacy siguen mandando
OpenAI y Anthropic no re-reportaron MMLU-Pro, MATH o GPQA para Sol y Opus 5 — la industria dejó de correr esas suites para frontier. Los números vigentes:
| Benchmark | DeepSeek V4 Pro | GPT-5.5 (legacy) | Opus 4.7 (legacy) | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| MMLU | 91.0% | 92.4% | 92.4% | — | — |
| MMLU-Pro | 87.5% | 94.2% | ~90% | — | — |
| GPQA Diamond | 90.1% | 78.3% | 94.2% | 94.6% | — |
| MATH | 95.8% | 97.4% | ~96% | — | — |
| HumanEval | 92.6% | 97.1% | 96.8% | — | — |
| SWE-bench Verified | 80.6% | 68.7% | 87.6% | no publicado | 96.0% |
| LiveCodeBench | 93.5% | N/D | ~91% | — | — |
Los scores de DeepSeek son los del Preview de abril (no re-reportados para 0813). El GPQA 94.6% de Sol es el único dato clásico nuevo del bando OpenAI, y mantiene la paradoja de junio: GPT-5.5 iba tercero en GPQA y su sucesor vuelve al top.
Pricing: el 16 de agosto lo cambió todo
La tabla de junio decía “$0.44/$0.87, 34x más barato”. Eso era verdad hasta el 16 de agosto a las 16:00 UTC. DeepSeek ahora factura por franjas:
| Modelo | Franja | Input (miss) | Input (hit) | Output |
|---|---|---|---|---|
| V4 Pro | Peak (01–04, 06–10 UTC) | $1.32 | $0.044 | $3.96 |
| V4 Pro | Off-peak | $0.66 | $0.022 | $1.98 |
| GPT-5.6 Sol | — | $5.00 | $0.50 | $30.00 |
| GPT-5.6 Terra | — | $2.50 | — | $15.00 |
| Claude Opus 5 | — | $5.00 | $0.50 | $25.00 |
Con tráfico 24/7 uniforme pasas ~21% del tiempo en peak (peak es solo L-V; los findes son off-peak completo), lo que frente a los precios previos al 16 de agosto supone de media ~×1,8 en input y ~×2,7 en output. Shiftear batch a off-peak (noches y findes) paga la mitad que peak. Ver DeepSeek V4 API: guía de costes reales para el desglose por workload.
Ratios de output contra el frontier, antes y ahora:
- Junio: Opus a $25 vs DeepSeek a $0.87 → 29x
- Agosto, off-peak: $25 vs $1.98 → 12.6x
- Agosto, peak: $25 vs $3.96 → 6.3x
- Contra Sol ($30): 7.6x (peak) a 15.2x (off-peak)
La palanca que sobrevive intacta es el cache hit: input off-peak a $0.022/1M con el descuento automático de prefijo. Workloads con system prompts estables y contexto reutilizado siguen siendo dramáticamente más baratos en DeepSeek que en cualquier frontier.
Coste por punto de precisión
Recalculado con pricing de agosto (output/1M sobre score):
Terminal-Bench 2.1 (agentic)
| Modelo | Score | Output/1M | $ por punto |
|---|---|---|---|
| DeepSeek V4 Pro (off-peak) | 87.9* | $1.98 | $0.023 |
| DeepSeek V4 Pro (peak) | 87.9* | $3.96 | $0.045 |
| GPT-5.6 Sol | 88.8 | $30.00 | $0.338 |
| Claude Opus 5 | 82.7 | $25.00 | $0.302 |
Un punto más de Terminal-Bench te cuesta 7-15x más en Sol que en DeepSeek según la hora — asumiendo que el 87.9 vendor-stated se sostenga. Esa es la letra pequeña de toda la tabla.
SWE-bench Verified (coding)
| Modelo | Score | Output/1M | $ por punto |
|---|---|---|---|
| DeepSeek V4 Pro (off-peak) | 80.6 | $1.98 | $0.025 |
| DeepSeek V4 Pro (peak) | 80.6 | $3.96 | $0.049 |
| Claude Opus 5 | 96.0 | $25.00 | $0.260 |
Aquí la historia de junio se invierte: la brecha de calidad se ensancha. Eran 7 puntos contra Opus 4.7; son 15.4 puntos contra Opus 5. De cada 100 bugs reales, Opus 5 resuelve ~15 más. Si un bug de producción te cuesta cinco cifras en downtime, se paga solo; si tu agente genera tests y boilerplate, sigues tirando de DeepSeek.
Nota honesta: el 80.6 de DeepSeek es del Preview. El 0813 no re-reportó SWE-bench Verified — su suite propia (DeepSWE: 12.8 → 62.7) sugiere una mejora enorme, pero vendor-stated.
Dónde gana DeepSeek V4 Pro
- Coste-eficiencia, incluso tras la subida. 6-13x más barato en output que el frontier según la hora; cache hit a $0.022/1M en off-peak.
- Agentes con presupuesto. Si el 87.9 de Terminal-Bench se confirma, correr agentes en DeepSeek cuesta una fracción con paridad funcional declarada.
- Self-hosting. Sigue siendo el único de los tres con pesos públicos (MIT, checkpoint 0813 en Hugging Face) — y ahora el GA, no un Preview.
- Output largo. 384K de max output; Sol y Opus 5 se quedan en 128K.
- Velocidad resuelta. DSpark speculative decoding lleva a Pro de ~37 a 62-80 tok/s medidos por terceros. Dejó de ser el cuello de botella.
Dónde pierde DeepSeek V4 Pro
- SWE-bench Verified. 80.6% vs 96.0% de Opus 5 — la brecha pasó de 7 a 15.4 puntos.
- Razonamiento abstracto. Sin datos en ARC-AGI-3 ni Frontier-Bench; Opus 5 marca 30.2% y 43.3% respectivamente.
- Inteligencia general medida. AA Intelligence Index 53 vs 61 de Opus 5 y 59 de Sol.
- Verbosidad. La evaluación de AA sigue mostrando output muy por encima de la mediana (~3-4x) — más tokens por tarea significa que el precio real por respuesta queda más cerca del techo del ratio.
- Pricing impredecible. El peak/off-peak convierte tu factura en función de tu geografía y tus horarios: frente a los precios previos al 16 de agosto, el tráfico 24/7 uniforme paga de media ~×1,8 en input y ~×2,7 en output, y el horario laboral europeo pisa 3 horas de peak al día.
- Proveedor único. Sol y Opus 5 tienen múltiples providers (Azure, AWS, GCP); DeepSeek, API propia y self-host.
- Multimodal. Solo texto. Sol acepta imágenes.
Estrategia de routing actualizada
El patrón de cascada a agosto de 2026:
Request → Router
├─ Clasificación/extracción bulk → DeepSeek V4 Pro off-peak ($0.66/$1.98)
├─ Coding sintético/tests → DeepSeek V4 Pro
├─ Agentes con presupuesto → DeepSeek V4 Pro (TB 87.9 vendor-stated)
├─ Agentic máxima fiabilidad → GPT-5.6 Sol ($5/$30) — TB 88.8, BrowseComp 90.4
├─ Coding producción crítico → Claude Opus 5 ($5/$25) — SWE-V 96.0
├─ Conocimiento factual puro → Cuidado: Opus 5 alucina 50% — Fable 5 o GPT-5.6
└─ Jobs batch → programarlos en off-peak (ahorro ~50%)
Dos matices nuevos que en junio no existían:
- No enrutes factual a Opus 5 a ciegas. La tasa de alucinación al 50% (+14 puntos vs 4.8) es el trade-off del release. Para coding y agentes casi no importa — el código se ejecuta y se valida —; para knowledge work sin verificador, Fable 5 sigue siendo más seguro.
- Sol reward-hackea. METR lo detectó a la tasa más alta de cualquier modelo testado. Si tu agente tiene libertad para “optimizar” métricas intermedias, añade verificación de resultado, no solo de proceso.
Self-hosting: la matemática en agosto
Con el pricing peak/off-peak, el umbral de self-hosting baja (la API es más cara, la GPU sigue costando lo mismo):
- 4×A100 80GB en Q8 sirven V4 Pro 0813; coste cloud GPU ~$6-8/hora.
- A $1.98/1M output (off-peak) necesitas ~3-4M tokens/hora sostenidos para amortizar.
- A $3.96 (peak), ~1.5-2M tokens/hora.
Es decir: cargas interactivas con picos diurnos (que caen en peak) se acercan al umbral de GPU dedicada bastante antes que en junio. Los escenarios que siguen justificándolo sin discusión: datos sensibles, latencia <50ms, y data residency.
Veredicto
| Caso de uso | Modelo recomendado | Por qué |
|---|---|---|
| Clasificación/extracción a escala | DeepSeek V4 Pro | Mismo rendimiento, 6-13x más barato incluso post-subida |
| Coding de producción (bugs, refactors) | Claude Opus 5 | SWE-bench Verified 96.0%, +15.4 pts sobre DeepSeek |
| Agentes de terminal/navegación | GPT-5.6 Sol | Terminal-Bench 88.8%, BrowseComp 90.4% |
| Agentes con presupuesto acotado | DeepSeek V4 Pro | TB 87.9 declarado a fracción de coste (vendor-stated) |
| Razonamiento abstracto/científico | Claude Opus 5 | ARC-AGI-3 30.2%, ~4x el siguiente |
| Conocimiento factual sin verificador | Fable 5 / GPT-5.6 | Opus 5 alucina 50%; DeepSeek va 8 pts por detrás en AA Index |
| Self-hosting / data residency | DeepSeek V4 Pro | Único open-weight (MIT, GA en HF) |
| Output largo (384K+) | DeepSeek V4 Pro | 3x el max output de cualquier frontier |
| Multimodal (vision + text) | GPT-5.6 Sol | Único de los tres con input de imagen documentado |
| Presupuesto ilimitado, máxima calidad | Claude Opus 5 | AA Index 61, líder en más benchmarks |
La conclusión de agosto es más maticada que la de junio. Entonces: “DeepSeek cubre el 90% de workloads a 29x menos”. Ahora: DeepSeek sigue siendo la elección racional por defecto, pero la ventaja se redujo a la mitad con el peak/off-peak, y en coding de producción la brecha de calidad se duplicó. La pregunta correcta ya no es “¿por qué pagar frontier?” sino “¿mi workload cae en el 10-20% donde el frontier gana por goleada — SWE-bench, ARC-AGI, multimodal — o en el resto?”.
Para el 80% de los workflows de un dev, DeepSeek V4 Pro sigue cubriendo. Verifica los ratios de precio con tu perfil de tráfico real antes de migrar nada.
Lectura relacionada
- DeepSeek V4: análisis completo de Pro y Flash
- DeepSeek V4 API: precios, límites y cuándo compensa
- Review: Claude Opus 5 — inteligencia frontier a mitad de precio
- Review: GPT-5.6 Sol — el nuevo rey de los agentes de programación
- Gemini 3.5 vs GPT-5.5 vs Claude Opus 4.7: comparativa
- Guía de modelos LLM para devs en 2026
- Guía de costes LLM: routing y proveedores
Precios y benchmarks actualizados a 24 de agosto de 2026. Fuentes: model card DeepSeek-V4-Pro-0813, Artificial Analysis, OpenAI GPT-5.6 System Card, Anthropic, APIs oficiales de pricing. Los scores marcados como vendor-stated no tienen reproducción independiente a fecha de publicación.