Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

DeepSeek V4 Pro

Lanzamiento: 2026-04-24

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

DeepSeek V4 Pro es el buque insignia de la serie de código abierto DeepSeek-V4: un modelo Mixture-of-Experts con 1,6T de parámetros totales y 49B activados, preentrenado con más de 32T tokens.

Entrada
texto $1.32/M
Salida
texto $3.96/M
Lectura de caché
$0.132/M
Contexto
1M
vs GPT-4o
~74% más barato

Benchmarks

Sobre la media4 / 10
DeepSeek V4 Pro otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro
59%
CoWorkBench max
66.3%
Humanity's Last Exam no tools
37.7%
MCP-Mark
57.1%

Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1.32/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$3.96/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.132/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 393.216

Caché de prompts

Modo automático
Duración sin TTL fijo (se borra cuando deja de usarse)

Razonamiento

Parámetro del proveedor thinking.type + reasoning_effort
Valores admitidos thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Valor por defecto enabled, con reasoning_effort high; algunas solicitudes de agente complejas se fijan automáticamente en max se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content y, en un turno en el que el modelo llamó a una herramienta, debe devolverse en todos los turnos posteriores; en caso contrario se ignora. El modo de pensamiento también ignora en silencio temperature, top_p, presence_penalty y frequency_penalty. DeepSeek publica este valor por defecto para su propia API; otras plataformas que alojan el modelo documentan valores por defecto distintos, así que confírmelo con la plataforma a la que se le enrute.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
Parámetros 1.6T totales · 49B activos MoE
Licencia MIT
  • Buque insignia MoE de 1,6T con 49B activos, contexto de 1M, modos Thinking y Non-Thinking
  • la atención dispersa híbrida reduce los FLOPs por token al 27% y la caché KV al 10% frente a V3.2 con contexto de 1M

según documentación oficial de DeepSeek ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

DeepSeek V4 Pro superado · 3 sentences

Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.

salida 641 tok (+545 pensamiento) latencia 11.5 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

DeepSeek V4 Pro superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]

salida 2418 tok (+2131 pensamiento) latencia 35.6 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

DeepSeek V4 Pro superado · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }

salida 1204 tok (+1153 pensamiento) latencia 19.9 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

DeepSeek V4 Pro sin respuesta para evaluar · no answer text within 16,384 tokens (all of it went to thinking)

El modelo no devolvió texto de respuesta - todo el presupuesto de tokens se destinó al pensamiento oculto.

salida 8193 tok (+8192 pensamiento) latencia 106.2 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use DeepSeek V4 Pro en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de DeepSeek V4 Pro

  • Admite una ventana de contexto de 1M tokens y modos duales de pensamiento y sin pensamiento, y DeepSeek destaca una sólida codificación agéntica, un amplio conocimiento del mundo y razonamiento en matemáticas, STEM y programación.
  • La tarjeta del modelo nombra las piezas que hay detrás: una pila de atención híbrida que combina Compressed Sparse Attention con Heavily Compressed Attention, Manifold-Constrained Hyper-Connections y el optimizador Muon, con los pesos de los expertos MoE en FP4 y la mayoría de los demás parámetros en FP8.
  • Los nuevos diseños de atención dispersa reducen los FLOPs de inferencia de contexto largo y la caché KV a una fracción de los de DeepSeek-V3.2.
  • El pensamiento es un parámetro de la solicitud y no un nombre de modelo aparte: un objeto thinking lo activa o lo desactiva, un ajuste reasoning_effort selecciona los comportamientos documentados Non-think, Think High y Think Max, y la cadena de pensamiento vuelve en reasoning_content junto a la respuesta.
  • La guía de DeepSeek añade una regla que conviene programar: en cualquier turno en el que el modelo haya llamado a una herramienta, el reasoning_content de ese turno debe devolverse en los turnos posteriores.
  • La llamada a funciones y la salida JSON funcionan con el pensamiento activado, la salida llega a 384K tokens y la caché de prefijo es automática.
  • Los pesos se publican abiertamente bajo la MIT License.
  • En Synthorai, DeepSeek V4 Pro está disponible a través del endpoint de chat completions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de DeepSeek V4 Pro?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.32/M por tokens de entrada, solo ese crédito cubre aproximadamente 94 solicitudes de ~8K tokens contra DeepSeek V4 Pro.

¿En qué destaca DeepSeek V4 Pro?

MoE de 1,6T parámetros con 49B activados; preentrenado con más de 32T tokens; 1M de contexto con modos duales de pensamiento. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta DeepSeek V4 Pro?

DeepSeek V4 Pro cuesta $1.32 por millón de tokens de entrada y $3.96 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.132/M.

¿DeepSeek V4 Pro admite caché de prompts?

Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.132/M frente a $1.32/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →

¿Cómo obtengo acceso a DeepSeek V4 Pro?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4-pro" y listo. Una sola clave API cubre todos los modelos del gateway.

¿DeepSeek V4 Pro es open source?

Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →