DeepSeek V4 Pro 0813 es la versión de agosto de 2026 de la gama insignia V4 Pro de DeepSeek, y la ficha del modelo la presenta como sustituta de la versión preliminar y no como una variante situada junto a ella.
- Entrada
- texto $1.32/M
- Salida
- texto $3.96/M
- Lectura de caché
- $0.132/M
- Contexto
- 1M
- vs GPT-4o
- ~74% más barato
Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing. Precio de entrada efectivo con una tasa de aciertos de caché del 70%:$0.4884/M. Caché de prefijos KV en disco automática: los aciertos de caché se facturan a la tarifa de lectura en caché con descuento, sin activación y sin tarifa de escritura. Esa tarifa de lectura en caché se publica como una cifra por millón propia. Sin cargo aparte por una escritura en caché.
Precio · posición entre 62 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 393.216 |
Caché de prompts
| Modo | automático |
|---|---|
| Duración | sin TTL fijo (se borra cuando deja de usarse) |
Razonamiento
| Parámetro del proveedor | reasoning_effort |
|---|---|
| Valores admitidos | the model card documents low · high · max |
| Comportamiento del razonamiento | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway — aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Licencia | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
Un prompt, medido a través del gateway
DeepSeek V4 Pro (0813) superado · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
salida 308 tok (+226 pensamiento) latencia 5.1 s
Seguimiento de la instrucción (exactamente tres frases — contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
DeepSeek V4 Pro (0813) superado · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
salida 1315 tok (+1130 pensamiento) latencia 16.9 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
DeepSeek V4 Pro (0813) superado · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
salida 2155 tok (+2121 pensamiento) latencia 26.0 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
DeepSeek V4 Pro (0813) superado · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
salida 2845 tok (+2694 pensamiento) latencia 25.5 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use DeepSeek V4 Pro (0813) en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de DeepSeek V4 Pro (0813)
- DeepSeek atribuye el cambio a unas capacidades agénticas notablemente reforzadas y a mejoras de rendimiento que describe como especialmente marcadas en producción; la versión incorpora además un módulo de decodificación especulativa DSpark.
- La ficha es excepcionalmente parca en especificaciones: no indica ni el número de parámetros ni la arquitectura, de modo que cualquier cifra heredada de la V4 Pro anterior debe considerarse no confirmada para esta versión.
- Lo que sí precisa es el marco de funcionamiento: pesos con licencia MIT, una longitud máxima de salida recomendada de 384K tokens en los niveles altos de esfuerzo de razonamiento y un parámetro reasoning_effort documentado en tres niveles, low, high y max.
- Lo que conviene planificar es el razonamiento.
- La traza vuelve en reasoning_content y, con indicaciones cortas, puede suponer la gran mayoría de los tokens de salida, por lo que un presupuesto de max_tokens demasiado ajustado devolverá una respuesta vacía que aun así se factura íntegramente por los tokens dedicados a pensar.
- Reserve ese margen, o baje el nivel de esfuerzo, antes de conectarlo a una ruta sensible a la latencia.
- El coste del esfuerzo no se limita a la salida: subir de nivel alarga el preámbulo del que parte el modelo, de manera que un mismo mensaje factura más tokens de entrada con un ajuste alto que con uno bajo.
- El modelo es solo de texto tanto en la entrada como en la salida; no admite entrada de imagen, así que combínelo con un modelo de visión en lugar de enviar mensajes multimodales.
- Como tanto la versión fechada como el nombre continuo siguen siendo invocables, fije el id con fecha cuando necesite un comportamiento reproducible y cuente con que el nombre sin fecha avance con el tiempo.
- Synthorai lo sirve a través del endpoint chat completions compatible con OpenAI, sin cambios en el cliente.
Preguntas frecuentes
¿Se puede probar gratis la API de DeepSeek V4 Pro (0813)?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.32/M por tokens de entrada, solo ese crédito cubre aproximadamente 94 solicitudes de ~8K tokens contra DeepSeek V4 Pro (0813).
¿En qué destaca DeepSeek V4 Pro (0813)?
Sustituye a la versión preliminar de V4 Pro; licencia MIT, salida máxima recomendada de 384K; reasoning_effort documentado en low, high y max. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta DeepSeek V4 Pro (0813)?
DeepSeek V4 Pro (0813) cuesta $1.32 por millón de tokens de entrada y $3.96 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.132/M.
¿DeepSeek V4 Pro (0813) admite caché de prompts?
Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.132/M frente a $1.32/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →
¿Cómo obtengo acceso a DeepSeek V4 Pro (0813)?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4-pro-0813" y listo. Una sola clave API cubre todos los modelos del gateway.
¿DeepSeek V4 Pro (0813) es open source?
Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.