Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

DeepSeek V4 Flash

Lanzamiento: 2026-04-24

chatCódigoLlamada a herramientasRazonamientoCaché de prompts

DeepSeek V4 Flash es el miembro rápido y económico de la serie de código abierto DeepSeek-V4: un modelo Mixture-of-Experts con 284B de parámetros totales y 13B activados, preentrenado como su hermano mayor con más de 32T tokens.

Entrada
texto $0.138/M
Salida
texto $0.275/M
Lectura de caché
$0.0028/M
Contexto
1M
vs GPT-4o
~97% más barato

Benchmarks

Sobre la mediasolo 2 comparables
DeepSeek V4 Flash otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro max
52.6%
GPQA Diamond max
88.1%
APEX-Agents high
19.1%

Publicado por los proveedores: Alibaba (Qwen) DeepSeek Google

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$0.138/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$0.275/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.0028/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 393.216

Caché de prompts

Modo automático
Duración sin TTL fijo (se borra cuando deja de usarse)

Razonamiento

Parámetro del proveedor thinking.type + reasoning_effort
Valores admitidos thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Valor por defecto enabled, con reasoning_effort high; algunas solicitudes de agente complejas se fijan automáticamente en max se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content y, en un turno en el que el modelo llamó a una herramienta, debe devolverse en todos los turnos posteriores; en caso contrario se ignora. El modo de pensamiento también ignora en silencio temperature, top_p, presence_penalty y frequency_penalty. DeepSeek publica este valor por defecto para su propia API; otras plataformas que alojan el modelo documentan valores por defecto distintos, así que confírmelo con la plataforma a la que se le enrute.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
Parámetros 284B totales · 13B activos MoE
Licencia MIT
  • MoE de 284B con 13B activos, contexto de 1M, modos Thinking y Non-Thinking
  • atención dispersa híbrida, precisión mixta FP4+FP8
  • la variante V4 rápida y económica

según documentación oficial de DeepSeek ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

DeepSeek V4 Flash superado · 3 sentences

When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.

salida 154 tok (+85 pensamiento) latencia 3.1 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

DeepSeek V4 Flash superado · 8/8 cases

The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]

salida 2494 tok (+2227 pensamiento) latencia 19.4 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

DeepSeek V4 Flash superado · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }

salida 1101 tok (+1054 pensamiento) latencia 10.2 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

DeepSeek V4 Flash superado · 119 words, 0 banned, 1 question

We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.

salida 2039 tok (+1887 pensamiento) latencia 15.6 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use DeepSeek V4 Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Acerca de DeepSeek V4 Flash

  • Lleva de serie la ventana de contexto de 1M tokens de la serie, alcanza un máximo de 384K tokens de salida y admite modos sin pensamiento y con pensamiento, incluidos ajustes de esfuerzo de razonamiento más altos.
  • DeepSeek destaca innovaciones de atención dispersa híbrida que recortan drásticamente el cómputo de inferencia de contexto largo y el coste de la caché KV frente a DeepSeek-V3.2, con un rendimiento de razonamiento que se acerca al de V4 Pro con menor precio y latencia; las notas de lanzamiento van más allá y afirman que Flash rinde a la par de Pro en tareas de agente simples, que es la línea que hay que leer al elegir entre ambos: Pro para el trabajo intensivo en conocimiento y el trabajo agéntico difícil, Flash para todo lo que sea de alto volumen.
  • Es además el miembro del par con mayor concurrencia.
  • Mecánicamente, integrar uno u otro es idéntico: el mismo objeto thinking y los mismos niveles de reasoning_effort, el mismo campo reasoning_content que transporta la cadena de pensamiento, el mismo requisito de devolver ese campo en los turnos que llamaron a una herramienta, la misma llamada a herramientas de 128 funciones, la misma salida JSON y caché de prefijo automática, y el mismo empaquetado de precisión mixta FP4/FP8.
  • Los pesos tienen licencia MIT y se publican en el propio hub de modelos de DeepSeek.
  • Synthorai sirve DeepSeek V4 Flash a través de su endpoint compatible con OpenAI sin necesidad de cambios en el cliente.

Preguntas frecuentes

¿Se puede probar gratis la API de DeepSeek V4 Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.138/M por tokens de entrada, solo ese crédito cubre aproximadamente 905 solicitudes de ~8K tokens contra DeepSeek V4 Flash.

¿En qué destaca DeepSeek V4 Flash?

MoE de 284B parámetros con 13B activados; la atención dispersa híbrida reduce los costes de contexto largo; pesos con licencia MIT y contexto de 1M tokens. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta DeepSeek V4 Flash?

DeepSeek V4 Flash cuesta $0.138 por millón de tokens de entrada y $0.275 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.0028/M.

¿DeepSeek V4 Flash admite caché de prompts?

Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.0028/M frente a $0.138/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →

¿Cómo obtengo acceso a DeepSeek V4 Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

¿DeepSeek V4 Flash es open source?

Sí: los pesos se publican bajo MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →