DeepSeek V4 Pro es el buque insignia de la serie de código abierto DeepSeek-V4: un modelo Mixture-of-Experts con 1,6T de parámetros totales y 49B activados, preentrenado con más de 32T tokens.
- Entrada
- texto $1.32/M
- Salida
- texto $3.96/M
- Lectura de caché
- $0.132/M
- Contexto
- 1M
- vs GPT-4o
- ~74% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 393.216 |
Caché de prompts
| Modo | automático |
|---|---|
| Duración | sin TTL fijo (se borra cuando deja de usarse) |
Razonamiento
| Parámetro del proveedor | thinking.type + reasoning_effort |
|---|---|
| Valores admitidos | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valor por defecto | enabled, con reasoning_effort high; algunas solicitudes de agente complejas se fijan automáticamente en max se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content y, en un turno en el que el modelo llamó a una herramienta, debe devolverse en todos los turnos posteriores; en caso contrario se ignora. El modo de pensamiento también ignora en silencio temperature, top_p, presence_penalty y frequency_penalty. DeepSeek publica este valor por defecto para su propia API; otras plataformas que alojan el modelo documentan valores por defecto distintos, así que confírmelo con la plataforma a la que se le enrute. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 1.6T totales · 49B activos MoE |
| Licencia | MIT |
- Buque insignia MoE de 1,6T con 49B activos, contexto de 1M, modos Thinking y Non-Thinking
- la atención dispersa híbrida reduce los FLOPs por token al 27% y la caché KV al 10% frente a V3.2 con contexto de 1M
Un prompt, medido a través del gateway
DeepSeek V4 Pro superado · 3 sentences
Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.
salida 641 tok (+545 pensamiento) latencia 11.5 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
DeepSeek V4 Pro superado · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]
salida 2418 tok (+2131 pensamiento) latencia 35.6 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
DeepSeek V4 Pro superado · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }
salida 1204 tok (+1153 pensamiento) latencia 19.9 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
DeepSeek V4 Pro sin respuesta para evaluar · no answer text within 16,384 tokens (all of it went to thinking)
El modelo no devolvió texto de respuesta - todo el presupuesto de tokens se destinó al pensamiento oculto.
salida 8193 tok (+8192 pensamiento) latencia 106.2 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use DeepSeek V4 Pro en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de DeepSeek V4 Pro
- Admite una ventana de contexto de 1M tokens y modos duales de pensamiento y sin pensamiento, y DeepSeek destaca una sólida codificación agéntica, un amplio conocimiento del mundo y razonamiento en matemáticas, STEM y programación.
- La tarjeta del modelo nombra las piezas que hay detrás: una pila de atención híbrida que combina Compressed Sparse Attention con Heavily Compressed Attention, Manifold-Constrained Hyper-Connections y el optimizador Muon, con los pesos de los expertos MoE en FP4 y la mayoría de los demás parámetros en FP8.
- Los nuevos diseños de atención dispersa reducen los FLOPs de inferencia de contexto largo y la caché KV a una fracción de los de DeepSeek-V3.2.
- El pensamiento es un parámetro de la solicitud y no un nombre de modelo aparte: un objeto thinking lo activa o lo desactiva, un ajuste reasoning_effort selecciona los comportamientos documentados Non-think, Think High y Think Max, y la cadena de pensamiento vuelve en reasoning_content junto a la respuesta.
- La guía de DeepSeek añade una regla que conviene programar: en cualquier turno en el que el modelo haya llamado a una herramienta, el reasoning_content de ese turno debe devolverse en los turnos posteriores.
- La llamada a funciones y la salida JSON funcionan con el pensamiento activado, la salida llega a 384K tokens y la caché de prefijo es automática.
- Los pesos se publican abiertamente bajo la MIT License.
- En Synthorai, DeepSeek V4 Pro está disponible a través del endpoint de chat completions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de DeepSeek V4 Pro?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.32/M por tokens de entrada, solo ese crédito cubre aproximadamente 94 solicitudes de ~8K tokens contra DeepSeek V4 Pro.
¿En qué destaca DeepSeek V4 Pro?
MoE de 1,6T parámetros con 49B activados; preentrenado con más de 32T tokens; 1M de contexto con modos duales de pensamiento. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta DeepSeek V4 Pro?
DeepSeek V4 Pro cuesta $1.32 por millón de tokens de entrada y $3.96 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.132/M.
¿DeepSeek V4 Pro admite caché de prompts?
Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.132/M frente a $1.32/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →
¿Cómo obtengo acceso a DeepSeek V4 Pro?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4-pro" y listo. Una sola clave API cubre todos los modelos del gateway.
¿DeepSeek V4 Pro es open source?
Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.