DeepSeek V4 Flash es el miembro rápido y económico de la serie de código abierto DeepSeek-V4: un modelo Mixture-of-Experts con 284B de parámetros totales y 13B activados, preentrenado como su hermano mayor con más de 32T tokens.
- Entrada
- texto $0.138/M
- Salida
- texto $0.275/M
- Lectura de caché
- $0.0028/M
- Contexto
- 1M
- vs GPT-4o
- ~97% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) DeepSeek Google
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 393.216 |
Caché de prompts
| Modo | automático |
|---|---|
| Duración | sin TTL fijo (se borra cuando deja de usarse) |
Razonamiento
| Parámetro del proveedor | thinking.type + reasoning_effort |
|---|---|
| Valores admitidos | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valor por defecto | enabled, con reasoning_effort high; algunas solicitudes de agente complejas se fijan automáticamente en max se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content y, en un turno en el que el modelo llamó a una herramienta, debe devolverse en todos los turnos posteriores; en caso contrario se ignora. El modo de pensamiento también ignora en silencio temperature, top_p, presence_penalty y frequency_penalty. DeepSeek publica este valor por defecto para su propia API; otras plataformas que alojan el modelo documentan valores por defecto distintos, así que confírmelo con la plataforma a la que se le enrute. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 284B totales · 13B activos MoE |
| Licencia | MIT |
- MoE de 284B con 13B activos, contexto de 1M, modos Thinking y Non-Thinking
- atención dispersa híbrida, precisión mixta FP4+FP8
- la variante V4 rápida y económica
Un prompt, medido a través del gateway
DeepSeek V4 Flash superado · 3 sentences
When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.
salida 154 tok (+85 pensamiento) latencia 3.1 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
DeepSeek V4 Flash superado · 8/8 cases
The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]
salida 2494 tok (+2227 pensamiento) latencia 19.4 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
DeepSeek V4 Flash superado · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }
salida 1101 tok (+1054 pensamiento) latencia 10.2 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
DeepSeek V4 Flash superado · 119 words, 0 banned, 1 question
We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.
salida 2039 tok (+1887 pensamiento) latencia 15.6 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use DeepSeek V4 Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de DeepSeek V4 Flash
- Lleva de serie la ventana de contexto de 1M tokens de la serie, alcanza un máximo de 384K tokens de salida y admite modos sin pensamiento y con pensamiento, incluidos ajustes de esfuerzo de razonamiento más altos.
- DeepSeek destaca innovaciones de atención dispersa híbrida que recortan drásticamente el cómputo de inferencia de contexto largo y el coste de la caché KV frente a DeepSeek-V3.2, con un rendimiento de razonamiento que se acerca al de V4 Pro con menor precio y latencia; las notas de lanzamiento van más allá y afirman que Flash rinde a la par de Pro en tareas de agente simples, que es la línea que hay que leer al elegir entre ambos: Pro para el trabajo intensivo en conocimiento y el trabajo agéntico difícil, Flash para todo lo que sea de alto volumen.
- Es además el miembro del par con mayor concurrencia.
- Mecánicamente, integrar uno u otro es idéntico: el mismo objeto thinking y los mismos niveles de reasoning_effort, el mismo campo reasoning_content que transporta la cadena de pensamiento, el mismo requisito de devolver ese campo en los turnos que llamaron a una herramienta, la misma llamada a herramientas de 128 funciones, la misma salida JSON y caché de prefijo automática, y el mismo empaquetado de precisión mixta FP4/FP8.
- Los pesos tienen licencia MIT y se publican en el propio hub de modelos de DeepSeek.
- Synthorai sirve DeepSeek V4 Flash a través de su endpoint compatible con OpenAI sin necesidad de cambios en el cliente.
Preguntas frecuentes
¿Se puede probar gratis la API de DeepSeek V4 Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.138/M por tokens de entrada, solo ese crédito cubre aproximadamente 905 solicitudes de ~8K tokens contra DeepSeek V4 Flash.
¿En qué destaca DeepSeek V4 Flash?
MoE de 284B parámetros con 13B activados; la atención dispersa híbrida reduce los costes de contexto largo; pesos con licencia MIT y contexto de 1M tokens. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta DeepSeek V4 Flash?
DeepSeek V4 Flash cuesta $0.138 por millón de tokens de entrada y $0.275 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.0028/M.
¿DeepSeek V4 Flash admite caché de prompts?
Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.0028/M frente a $0.138/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →
¿Cómo obtengo acceso a DeepSeek V4 Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
¿DeepSeek V4 Flash es open source?
Sí: los pesos se publican bajo MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.