DeepSeek V4 API: guía completa de costes reales por workload (datos de septiembre 2026)
TL;DR
- Pricing peak/off-peak (verificado el 2-sep, sin cambios): en horas peak (01:00–04:00 y 06:00–10:00 UTC, lunes a viernes) el input sube ×3 y el output ×4,5: V4 Pro a $1.32/$3.96, Flash a $0.44/$1.32. Off-peak: Pro $0.66/$1.98, Flash $0.22/$0.66. Ya no existe precio flat — los $0.435/$0.87 y $0.14/$0.28 son historia
- Nuevo el 1 de septiembre: V4-Flash-Vision-Exp, primer modelo multimodal de la familia, ya en la API al mismo precio que Flash. Imágenes con tope de 384 tokens facturadas como input. El «para vision, Claude o Gemini» ya no aplica sin matices
- V4-Pro-0813 es el release oficial de Pro (ya no Preview). Llega con DSpark speculative decoding y gains agentic masivos: DeepSWE de 12.8 a 62.7, Terminal-Bench de 72.1 a 87.9
- La velocidad de Pro, su punto débil histórico, mejoró: ~62.9 tok/s medidos independientemente (vs ~37 del Preview). Sigue por debajo de Flash (94 tok/s) pero dejó de ser el cuello de botella
- Los cache hits reducen el input un ~97% (hit a ~1/30 del precio de miss en ambas franjas) — siguen siendo la mayor palanca de ahorro (off-peak cache hit Pro: $0.022/M)
- En workloads de agentes con tool calls múltiples, el coste real depende más de la verbosidad del modelo que del precio por token
- Para producción con SLA, un router Flash→Pro→GPT-5.4 maximiza ahorro sin sacrificar calidad — y ahora Pro es viable en tareas agentic que antes requerían modelos frontier
Contexto
DeepSeek lanzó V4 Pro y V4 Flash el 23 de abril de 2026. Pro tuvo un descuento promocional del 75% que expiró el 5 de mayo — y la sorpresa: los precios no subieron. Ese pricing flat ($0.435/$0.87 Pro, $0.14/$0.28 Flash) sobrevivió hasta el 16 de agosto, cuando DeepSeek cambió a billing peak/off-peak (ver abajo). Hoy no existe precio flat: todo se factura por franja horaria.
El 31 de julio de 2026, DeepSeek actualizó V4 Flash al checkpoint V4-Flash-0731, moviéndolo de Preview a release oficial. Y el 13 de agosto, hizo lo mismo con Pro: V4-Pro-0813 es el release oficial de Pro, superando el Preview. Lo relevante para tu factura: los precios no cambian con este release, pero el modelo sí es otro.
Y el 1 de septiembre llegó la tercera pieza: DeepSeek-V4-Flash-Vision-Exp, el primer modelo multimodal de la familia (305B parámetros, MIT, abierto en Hugging Face). No es solo un peso abierto: está disponible en la API como deepseek-v4-flash-vision-exp, al mismo precio que Flash. Para un artículo de costes esta es la noticia del mes: hasta ahora, cualquier workload con imágenes te obligaba a salir de DeepSeek hacia Claude o Gemini. Ya no.
Qué cambia con V4-Pro-0813 para tu decisión de costes:
- DSpark speculative decoding. Pro ahora tiene un módulo de speculative decoding que predice bloques enteros de tokens en un solo pase y los verifica sin pérdida. Medición independiente de AIHubMix sitúa la throughput de Pro en 62.9 tok/s — antes era ~37 tok/s. El “Pro es lento” ya no es una razón para descartarlo.
- Gains agentic masivos (vendor-stated). El release oficial trae mejoras enormes en tareas de agentes: DeepSWE de 12.8 a 62.7, Terminal-Bench 2.1 de 72.1 a 87.9, Cybergym de 52.7 a 83.3. Estos son scores del harness propio de DeepSeek — ningún laboratorio independiente los había reproducido a fecha de publicación. La única corroboración semi-independiente es Artificial Analysis Intelligence Index. Trátalos como señal direccional.
reasoning_effortcon tres niveles. Ahora soportalow,highymax. Para control de costes,lowreduce tokens de razonamiento;maxlos dispara (recomiendan max output de 384K parahigh/max).- Max output 384K tokens. Contexto sigue siendo 1M, pero el output ahora puede llegar a 384K — relevante para workloads que generan output largo (codebases, reportes).
El 24 de julio retiraron los alias legacy (deepseek-chat, deepseek-reasoner): si tu integración los usa, ya está rota.
V4 Pro es un MoE de 1.7T parámetros (49B activos) con 1M tokens de contexto, licencia MIT y benchmarks que compiten con GPT-5.4, Claude Opus 4.7 y GLM-5.2 en coding y razonamiento. Para el análisis completo de benchmarks y arquitectura, ver DeepSeek V4: análisis completo.
Este artículo se centra en lo que importa para tu factura: precios por token, costes por workload, y cuándo conviene cada modelo.
⚠️ Pricing vigente desde el 16 de agosto de 2026 (16:00 UTC): billing peak/off-peak
DeepSeek factura por franjas horarias. Respecto al pricing flat que existía antes del 16 de agosto, en horas peak (lunes a viernes) el input sube ×3 y el output ×4,5–4,7; en off-peak, ×1,5 y ×2,3:
Modelo Horas Input (miss) Input (hit) Output V4 Flash Peak $0.44 $0.014 $1.32 V4 Flash Off-peak $0.22 $0.007 $0.66 V4 Pro Peak $1.32 $0.044 $3.96 V4 Pro Off-peak $0.66 $0.022 $1.98 Flash-Vision-Exp Peak $0.44 $0.014 $1.32 Flash-Vision-Exp Off-peak $0.22 $0.007 $0.66 Peak: 01:00–04:00 y 06:00–10:00 UTC, solo lunes a viernes. Off-peak: todo lo demás — los fines de semana enteros son off-peak.
deepseek-v4-flash-vision-expcomparte franjas y precios con Flash; las imágenes se facturan como tokens de input (ver Workload 6).Implicación para tu factura: con peak limitado a L-V, el tráfico 24/7 uniforme pasa ~21% del tiempo en peak (7h × 5 días = 35h de 168). Aun así, frente a los precios flat previos al 16 de agosto eso supone de media ~×1,8 en input y ~×2,7 en output. El horario laboral europeo (09:00–17:00 CET) coincide con 3 horas de peak al día, así que el tráfico interactivo EU/US no se escapa del aumento. Si puedes shiftear trabajo batch a off-peak (noches y fines de semana), pagas la mitad que en peak.
Los cálculos por workload de este artículo usan los precios off-peak ($0.66/$1.98 Pro, $0.22/$0.66 Flash) — el escenario más favorable y el más relevante si planeas tráfico batch. Para tráfico interactivo en horas laborables, aplica los precios peak (el doble).
Precios por 1M tokens: tabla comparativa
Precios DeepSeek (vigentes, verificados el 2-sep-2026) — billing por franjas; se lista el off-peak (peak = el doble):
| Modelo | Input (miss) | Input (hit) | Output | Contexto |
|---|---|---|---|---|
| V4 Flash | $0.22 | $0.007 | $0.66 | 1M |
| V4 Flash-Vision-Exp | $0.22 | $0.007 | $0.66 | 1M |
| V4 Pro | $0.66 | $0.022 | $1.98 | 1M |
| Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | 1M |
| Gemini 3.6 Flash (promo hasta 31-dic) | $0.75 | $0.075 | $3.75 | 1M |
| GPT-5.4 mini | $0.75 | $0.075 | $4.50 | 400K |
| Gemini 3.1 Pro (≤200K) | $2.00 | $0.20 | $12.00 | 1M |
| Gemini 3.5 Flash | $1.50 | $0.15 | $9.00 | 1M |
| GPT-5.4 | $2.50 | $0.25 | $15.00 | 1.05M |
| Claude Opus 5 | $5.00 | $0.50 | $25.00 | 1M |
| GPT-5.5 | $5.00 | $0.50 | $30.00 | 1M |
Histórico DeepSeek (pricing flat vigente hasta el 16 de agosto de 2026, para referencia): V4 Flash $0.14/$0.0028/$0.28; V4 Pro $0.435/$0.003625/$0.87.
Nota sobre cache hits: DeepSeek aplica descuento automático cuando el prefijo del prompt coincide con uno anterior. No requiere configuración. Con el pricing por franjas, el cache hit queda a ~1/30 del precio de miss en ambos modelos y franjas (antes del 16 de agosto era 1/50 en Flash y 1/120 en Pro — la ratio empeoró, pero sigue siendo el descuento más agresivo del mercado). Eso hace que workloads con system prompts estables y contexto reutilizado sean dramáticamente más baratos.
Batch API: OpenAI ofrece 50% de descuento en Batch API (ejecución asíncrona en ventana de 24h). Anthropic también ofrece 50% en batch. DeepSeek no tiene batch API propio — pero sus precios base ya son menores que el batch pricing de la competencia.
Fuentes: Pricing oficial DeepSeek, Pricing OpenAI, Pricing Anthropic, Pricing Google AI.
Ratio precio/rendimiento: ¿qué obtienes por tu euro?
El precio por token es irrelevante sin contexto de calidad. V4 Flash es barato, pero ¿es suficiente para tu caso?
| Modelo | Precio output/M | MMLU-Pro | LiveCodeBench | SWE-Verified |
|---|---|---|---|---|
| V4 Flash | $0.66 | 86.2 | 91.6 | 79.0 |
| V4 Pro | $1.98 | 87.5 | 93.5 | 80.6 |
| GPT-5.4 | $15.00 | 87.5 | — | — |
| Claude Opus 4.7 | $25.00 | 89.1 | 88.8 | 80.8 |
| Gemini 3.5 Flash | $9.00 | ~88 | ~92 | — |
Precios DeepSeek off-peak; en peak se duplican. Benchmarks de Opus medidos sobre 4.7 (Opus 5 mantiene $5/$25).
Lectura: V4 Pro cuesta 7.6x menos en output que GPT-5.4 y empata en MMLU-Pro. Contra Claude Opus, cuesta 12.6x menos y pierde solo 1.6 puntos en MMLU-Pro. V4 Flash a $0.66/M output (off-peak) es un 97% más barato que Claude Opus y pierde solo 2.9 puntos en MMLU-Pro — calidad razonable para la mayoría de tareas.
Gains agentic del 0813 (vendor-stated): Con el release V4-Pro-0813, Pro reporta mejoras enormes en tareas de agentes frente al Preview. La tabla completa del harness DeepSeek, con Flash-0731 y la competencia como referencia:
| Benchmark (DeepSeek harness) | V4 Pro 0813 | V4 Flash 0731 | V4 Pro (Preview) | GLM-5.2 | Kimi K3 | Opus 4.8 |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 87.9 | 82.7 | 72.1 | 81.0 | 88.3 | 85.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 48.9 | — | 69.7 |
| Cybergym | 83.3 | 76.7 | 52.7 | — | 80.0 | 78.3 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 46.2 | 67.5 | 58.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 59.9 | 76.5 | 76.2 |
| Agents’ Last Exam | 25.7 | 25.2 | 16.5 | 23.8 | 27.6 | 25.7 |
| AutomationBench (Public) | 31.8 | 25.1 | 12.8 | 12.9 | 30.8 | 27.2 |
Estos son scores del harness propio de DeepSeek — ningún laboratorio independiente los había reproducido a fecha de publicación. La única corroboración semi-independiente es el Artificial Analysis Intelligence Index de 50-52 (#3 de 101). Trátalos como señal direccional, no como verificación. Para Pro 0813, además, LMArena coding lo sitúa en 1502 (vs 1483 de Flash 0731).
Velocidad (medida independiente AIHubMix): V4 Pro 0813 a 62.9 tok/s (TTFT 1.8s), V4 Flash 0731 a 94.0 tok/s (TTFT 1.3s). El salto de Pro desde ~37 tok/s (Preview) se debe al DSpark speculative decoding.
Para benchmarks completos, ver el análisis de V4 Pro y Flash.
Costes reales por tipo de workload
Los precios por millón de tokens no te dicen nada sobre tu factura real. Aquí van seis escenarios concretos con cálculos por mes. Los números de DeepSeek usan precios off-peak; si tu tráfico cae en horas peak laborables, multiplica la parte DeepSeek por 2.
Workload 1: Coding assistant (desarrollador individual)
Supuestos: 50 prompts/día, 2K tokens input, 1.5K tokens output, 22 días laborables, 65% cache hit ratio.
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash | $0.18 | $1.09 | $1.27 |
| V4 Pro | $0.54 | $3.27 | $3.81 |
| Gemini 3.6 Flash (promo) | $0.68 | $6.19 | $6.87 |
| GPT-5.4 mini | $0.68 | $7.42 | $8.11 |
| Claude Sonnet 5 | $1.83 | $16.50 | $18.33 |
| Gemini 3.5 Flash | $1.37 | $14.85 | $16.22 |
| GPT-5.4 | $2.28 | $24.75 | $27.03 |
| Claude Opus 5 | $4.57 | $41.25 | $45.81 |
| GPT-5.5 | $4.57 | $49.50 | $54.06 |
Lectura: Un desarrollador individual paga ~$3.80/mes con V4 Pro o ~$1.30/mes con Flash (off-peak; el doble en peak). Con GPT-5.4 son $27/mes. La diferencia no es marginal — es 7x (Pro) o 21x (Flash). La era del pricing flat ($1.78/mes con Pro) se acabó el 16 de agosto, pero sigue siendo órdenes de magnitud más barato.
Workload 2: RAG pipeline (análisis de documentos)
Supuestos: 100 documentos/día, 8K tokens input (doc + chunks), 1K tokens output (resumen), 22 días, 80% cache hit ratio (alto reuso de chunks).
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash | $0.87 | $1.45 | $2.32 |
| V4 Pro | $2.63 | $4.36 | $6.99 |
| Gemini 3.6 Flash (promo) | $3.70 | $8.25 | $11.95 |
| GPT-5.4 mini | $3.70 | $9.90 | $13.60 |
| Claude Sonnet 5 | $9.86 | $22.00 | $31.86 |
| Gemini 3.5 Flash | $7.39 | $19.80 | $27.19 |
| GPT-5.4 | $12.32 | $33.00 | $45.32 |
| Gemini 3.1 Pro | $9.86 | $26.40 | $36.26 |
| Claude Opus 5 | $24.64 | $55.00 | $79.64 |
Lectura: El alto cache hit (80%) beneficia enormemente a DeepSeek porque sus cache hits son ~30x más baratos que el miss. V4 Pro cuesta $7/mes vs $45/mes con GPT-5.4. V4 Flash a $2.32/mes es prácticamente gratuito.
Workload 3: Agente con tool calls (pipeline multi-step)
Supuestos: 5,000 tareas/día, cada tarea implica 8 tool calls (avg 500 tokens input + 400 tokens output por call), 30 días, 50% cache hit ratio.
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash | $68.10 | $316.80 | $384.90 |
| V4 Pro | $204.60 | $950.40 | $1,155.00 |
| GPT-5.4 | $825.00 | $7,200.00 | $8,025.00 |
| Claude Opus 5 | $1,650.00 | $12,000.00 | $13,650.00 |
Lectura: Este es el escenario donde la verbosidad importa. V4 Pro genera ~4.4x más tokens que la media de su categoría según Artificial Analysis. Eso significa que el coste real de output puede ser hasta 4x superior a lo que sugiere el precio por token. Aun así, $1,155/mes vs $8,025/mes con GPT-5.4 sigue siendo 6.9x más barato — y si concentras el tráfico en off-peak, ese número es el definitivo (en peak se reduce a ~3.5x).
Advertencia: Si usas V4 Pro con un coding agent (Claude Code, OpenCode, etc.), DeepSeek auto-escala el reasoning_effort a max sin avisarte. Eso dispara el consumo de tokens. Si controlas costes, setea reasoning_effort explícitamente.
Workload 4: Batch de procesamiento masivo (nocturno)
Supuestos: 500M tokens input + 50M tokens output por noche, 0% cache hit (datos únicos cada noche), 20 noches/mes. Trabajo nocturno = off-peak siempre.
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash | $2,200 | $660 | $2,860 |
| V4 Pro | $6,600 | $1,980 | $8,580 |
| GPT-5.4 (batch 50%) | $12,500 | $7,500 | $20,000 |
| Claude Opus 5 (batch 50%) | $25,000 | $12,500 | $37,500 |
Lectura: En batch masivo sin cache, V4 Flash arrasa a $2,860/mes. V4 Pro a $8,580 es 2.3x más barato que GPT-5.4 incluso contando su batch del 50% — la ventaja del 74x de la era flat se comprimió, pero sigue ahí. Nota honesta: en la versión de agosto, los números de la competencia en esta tabla tenían un error de cálculo (output batch sobrevalorado ×50); los correctos son estos.
Workload 5: Chatbot B2C (alto volumen)
Supuestos: 100K usuarios/mes, 5 interacciones/usuario, 300 tokens input + 200 tokens output por interacción, 30% cache hit.
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash | $23.41 | $66.00 | $89.41 |
| V4 Pro | $70.29 | $198.00 | $268.29 |
| Gemini 3.6 Flash (promo) | $82.12 | $375.00 | $457.12 |
| Gemini 3.5 Flash | $164.25 | $900.00 | $1,064.25 |
| GPT-5.4 | $273.75 | $1,500.00 | $1,773.75 |
| Claude Opus 5 | $547.50 | $2,500.00 | $3,047.50 |
Lectura: Para chatbots de alto volumen donde la calidad no necesita ser frontier, V4 Flash a $89/mes es la opción más rentable. Si necesitas más calidad, V4 Pro ($268/mes) cuesta 6.6x menos que GPT-5.4 ($1,774/mes).
Workload 6: Workload con imágenes (screenshots, charts, documentos)
Nuevo desde el 1 de septiembre. deepseek-v4-flash-vision-exp acepta imágenes junto a texto: JPEG, PNG, GIF y WebP, hasta 600 imágenes por request, 1M de contexto. La regla de facturación: cada imagen se redimensiona automáticamente a ~800×800 y se convierte en máximo 384 tokens, que se facturan como input junto al texto. Es un tope — una imagen 2000×2000 y una 5000×5000 cuestan lo mismo.
Supuestos: 100K screenshots/día para un pipeline de extracción (1 imagen + 200 tokens de texto de input, 150 tokens de output), 30 días, 0% cache hit.
| Modelo | Input/mes | Output/mes | Total/mes |
|---|---|---|---|
| V4 Flash-Vision-Exp | $385.44 | $297.00 | $682.44 |
| Gemini 3.6 Flash (promo) | $1,314.00 | $1,687.50 | $3,001.50 |
| Claude Sonnet 5 | $3,504.00 | $4,500.00 | $8,004.00 |
Lectura: Vision a precio Flash. El mismo pipeline con Claude Sonnet 5 cuesta 11.7x más; con el promo de Gemini 3.6 Flash, 4.4x más. Si tu workload mezcla texto + imágenes, el «DeepSeek no tiene vision» dejó de ser razón para descartarlo — con una salvedad: es un modelo experimental (Exp), 305B parámetros, y sus benchmarks multimodales (ApexBench 36.5, ZeroBench 35.0) siguen por debajo de Opus 4.8 (39.4/34.0 en los mismos harness). Para OCR de alto volumen donde no necesitas el SOTA, el precio manda.
Detalles técnicos que importan a tu factura: las imágenes solo van en mensajes user (en system/assistant devuelven 400), hasta 600 por request con límite de 64 MiB, y puedes pasarlas como base64 (límite 48 MiB por body), URL externa (máx 32 MiB, 60s de descarga) o Files API (hasta 64 MiB por imagen). El resto de modelos V4 siguen rechazando imágenes con un 400.
Metodología
Los cálculos anteriores se basan en:
- Pricing oficial de DeepSeek V4 Pro, Flash y Flash-Vision-Exp, verificado el 2 de septiembre de 2026 contra la página de pricing oficial [1] — billing peak/off-peak sin cambios;
deepseek-v4-flash-vision-explistado a precio Flash - Pricing oficial de OpenAI (GPT-5.4, GPT-5.5, GPT-5.4 mini), Anthropic (Claude Opus 5, Sonnet 5), y Google (Gemini 3.1 Pro, 3.5/3.6 Flash), verificado el 2 de septiembre de 2026 [2][3][4]
- Cache hit ratios estimados: 30% (chatbot B2C), 50% (agentes), 65% (coding), 80% (RAG). Consistentes con datos de producción reportados por equipos usando prompt caching
- Fórmula de coste de input:
(tokens_miss × precio_miss + tokens_hit × precio_hit) / 1M. El output siempre se factura a precio completo (no hay cache de output) - Precios DeepSeek en workloads: off-peak. El pricing por franjas no tiene precio flat; para tráfico en horas peak laborables, los montos DeepSeek se duplican
- Workload 6 (imágenes): regla oficial de conversión: cada imagen se redimensiona a ~800×800 y se factura como input con tope de 384 tokens por imagen
- Supuestos de verbosidad: V4 Pro genera ~4.4x más tokens que la media del sector (190M tokens en evaluaciones de Artificial Analysis vs 43M de media). Esto infla el coste real de output
- Batch pricing: OpenAI y Anthropic ofrecen 50% en batch asíncrono. DeepSeek no tiene batch API propio
Optimización de costes: tácticas concretas
1. Cache hits con prefijos estables
El mayor ahorro con DeepSeek viene de los cache hits. Si tu system prompt es de 2K tokens y lo incluyes en cada petición, esos tokens pasan de $0.22/M a $0.007/M en V4 Flash off-peak — un 97% de descuento automático (en peak, de $0.44 a $0.014).
Táctica: estructura tus prompts con un prefijo fijo largo (instrucciones del sistema, ejemplos few-shot, formato de salida) antes del contenido variable. DeepSeek cachea automáticamente cuando el prefijo coincide con peticiones anteriores.
Impacto real: en el workload de RAG (80% cache hit), el ahorro por cache representa la mayor parte del coste total de input. Sin cache, ese mismo workload cuesta varias veces más.
2. Prompt compression
Reducir el tamaño del prompt baja directamente el coste de input. Tres enfoques:
- System prompt comprimido: reescribe instrucciones verbosas en formato conciso. Un system prompt de 1K tokens puede reducirse a 300 tokens manteniendo las mismas instrucciones clave — ahorro del 70% en input.
- LLMLingua / contexto dinámico: herramientas como LLMLingua comprimen documentos de contexto eliminando tokens de baja información. En tests reportados, la compresión alcanza 2-6x con pérdida de calidad menor al 2%.
- Context window right-sizing: no envíes 100K tokens si el modelo solo necesita los 5K últimos. Trunca o usa retrieval para enviar solo lo relevante.
Impacto estimado: reducir el prompt promedio de 4K a 1.5K tokens supone un ahorro significativo en cualquier volumen alto, especialmente con V4 Pro.
3. Control de verbosidad en output
V4 Pro genera ~4.4x más tokens que la media del sector. Controlar esto es la palanca de ahorro más grande para output:
- Añade
"max_tokens": 1024(o el límite que necesites) en cada llamada - Incluye instrucciones explícitas como “Responde en máximo 3 párrafos” o “Formato: JSON sin explicación”
- Usa
reasoning_effort: "low"para tareas donde no necesitas razonamiento extenso. El 0813 soporta tres niveles (low,high,max) —maxdispara el consumo y recomiendan max output de 384K, así que resérvalo para tareas que lo justifiquen
4. Router con degradación
El patrón Flash→Pro→frontier descrito más abajo no solo optimiza calidad, también optimiza coste. Routea el 80% del tráfico al modelo más barato y solo escala cuando la confianza es baja.
5. Imágenes con detail: "low" (solo Flash-Vision-Exp)
Si tu pipeline de vision no necesita detalle fino, fuerza el downscale a 512×512 con "detail": "low". Como la facturación ya tiene tope de 384 tokens por imagen, el ahorro directo en tokens es acotado, pero reduce cómputo y latencia en pipelines de alto volumen. Y si reutilizas las mismas imágenes entre requests, súbelas una vez por la Files API en vez de re-enviar base64 — menos payload, mismas tokens facturadas.
Decisiones: cuándo usar cada modelo
Usa V4 Flash cuando
- Alto volumen, tareas generales (QA, resúmenes, clasificación, code review básico)
- El budget es el factor decisivo
- Ejecutas fleets de agentes en paralelo — 2,500 concurrency vs 500 de Pro
- La latencia importa — Flash a 94 tok/s sigue siendo 1.5x más rápido que Pro 0813 (62.9 tok/s)
- Quieres gains agentic sin pagar Pro (Terminal-Bench 2.1: 82.7, Toolathlon: 70.3 — vendor-stated)
- Tu workload incluye imágenes y no necesitas el SOTA visual — Flash-Vision-Exp cuesta lo mismo que Flash (384 tokens tope por imagen)
Usa V4 Pro cuando
- Coding pesado (refactoring multi-fichero, debugging complejo, SWE-bench level)
- RAG con alto reuso de contexto (el cache hit es tu mayor aliado)
- Agentes con tool calls donde la calidad de razonamiento importa — el 0813 trae el salto agentic más grande de la familia (DeepSWE: 12.8→62.7)
- Necesitas 1M tokens de contexto sin sobrecoste
- Puedes tolerar verbosidad (4.4x media del sector) — pero ya no velocidad: Pro 0813 a 62.9 tok/s es competente
Busca alternativas cuando
- Necesitas el SOTA en vision/multimodal → Flash-Vision-Exp existe y cuesta como Flash, pero es experimental y sus benchmarks multimodales quedan bajo Opus 4.8. Si la calidad visual es crítica, Claude Opus 5 o Gemini siguen delante; si el volumen manda, el precio de DeepSeek gana
- Necesitas el percentil superior de razonamiento → Kimi K3 empata o supera a Pro 0813 en varios benchmarks agentic (Terminal-Bench 88.3, DeepSWE 67.5, Toolathlon 76.5). Fable-5 con fallback también supera a Pro en HLE y DeepSWE
- Necesitas provider diversity → combina Claude + GPT como fallback
- Factual recall de alta precisión → Gemini 3.1 Pro (SimpleQA 75.6 vs 57.9 de V4 Pro)
- SLA de disponibilidad → DeepSeek es un solo provider; si su API cae, no hay fallback
- Presupuesto mínimo absoluto → mira Gemini 3.6 Flash: su promo de $0.75/$3.75 hasta fin de año compite directamente con V4 Flash en off-peak ($0.22/$0.66 sigue siendo menor, pero la distancia se acorta)
El patrón más inteligente: router Flash→Pro→frontier
Para producción con SLA, el patrón que más equipos están adoptando:
- Route 80% de tráfico a V4 Flash — tareas generales, clasificación, extracción
- Route 15% a V4 Pro — razonamiento complejo, coding, multi-step
- Route 5% a GPT-5.4/Claude — edge cases donde la calidad es innegociable
Esto reduce la factura un 60-80% respecto a usar un solo modelo frontier, manteniendo calidad aceptable en el 95% de las peticiones. Para más sobre routing multi-modelo, ver Routing multi-modelo en 2026.
Conclusión
DeepSeek V4 sigue siendo varias veces más barato en output que los modelos frontier de OpenAI, Anthropic y Google, pero desde el 16 de agosto el billing peak/off-peak modula esa ventaja por franja, y la competencia ha movido ficha: Claude Sonnet 5 bajó a $2/$10 y Gemini 3.6 Flash está de promo a $0.75/$3.75 hasta fin de año. En off-peak ($1.98/M output de Pro) la ventaja se mantiene holgada (6-7x); en peak ($3.96/M) se comprime. La era de las ratios 15-74x de los cálculos con precio flat se acabó — los números honestos de septiembre son 7x contra GPT-5.4 en workloads interactivos y 2.3x en batch contra su pricing con 50% de descuento. Si tu tráfico cae en horas peak, recalcula antes de migrar; si puedes concentrarlo en noches y findes, la ventaja se agranda.
El release V4-Pro-0813 cambió el equilibrio de la familia: Pro ya no es el modelo lento. Con DSpark speculative decoding subió a ~63 tok/s (medida independiente), y sus gains agentic (DeepSWE 12.8→62.7, Terminal-Bench 72.1→87.9) lo hacen competitivo en tareas de agentes que antes requerían modelos frontier. Eso significa que el router Flash→Pro→frontier ahora cubre más casos sin escalar al tier caro.
Y la noticia de septiembre: V4-Flash-Vision-Exp rompe la última excusa técnica para descartar DeepSeek — la falta de vision. A precio Flash, con tope de 384 tokens por imagen, workloads de OCR/extracción que antes pagaban 11.7x más con Claude ahora pueden quedarse en casa. Es experimental y no iguala a Opus en benchmarks multimodales, pero para la mayoría de pipelines de extracción el precio manda.
V4 Flash a $0.22/M input (off-peak) sigue siendo probablemente el modelo con mejor ratio calidad/precio del mercado. Es rápido (94 tok/s) y competitivo en tareas agentic. Para la mayoría de workloads donde no necesitas la máxima calidad, es la opción por defecto.
El trade-off: ahorro significativo a cambio de un solo provider, un modelo de vision aún experimental, verbosidad que infla el coste real de Pro, y pricing variable según franja horaria. Si puedes vivir con eso — y sobre todo si puedes shiftear trabajo a horas off-peak — los números hablan solos.
Calcula tu volumen, estima tu cache hit ratio, revisa en qué franja horaria cae tu tráfico, y decide. Los datos están sobre la mesa.
Fuentes: [1] Pricing oficial DeepSeek V4 (verificado 2 sep 2026; incluye deepseek-v4-flash-vision-exp a precio Flash), [2] Pricing OpenAI, [3] Pricing Anthropic Claude (Opus 5 $5/$25, Sonnet 5 $2/$10, verificado 2 sep 2026), [4] Pricing Google Gemini (3.1 Pro $2/$12 ≤200K; 3.6 Flash promo $0.75/$3.75 hasta 31-dic-2026, verificado 2 sep 2026), [5] DeepSeek V4: análisis completo (benchmarks y arquitectura), [6] Model card V4-Pro-0813 (Hugging Face), [7] Mediciones independientes de throughput — AIHubMix, [8] Model card V4-Flash-Vision-Exp (Hugging Face), [9] Vision: token usage — DeepSeek API Docs