Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

DeepSeek V4.1 Flash

Lanzamiento: 2026-09-10

chatVisiónCódigoRazonamientoLlamada a herramientasCaché de prompts

DeepSeek V4.1 Flash es la siguiente entrega de la línea V4 Flash de DeepSeek, rápida y económica, y el cambio principal es que es multimodal de forma nativa: la tarjeta del modelo describe que procesa imágenes y texto de manera nativa y genera texto de forma autorregresiva, de modo que la entrada visual ya no exige acompañarlo de un modelo de visión aparte.

Entrada
texto imagen $0.3/M
Salida
texto $1.2/M
Lectura de caché
$0.03/M
Contexto
1M
vs GPT-4o
~94% más barato

Benchmarks

Sobre la mediaNinguno mejor16 / 194 / 19
DeepSeek V4.1 Flash otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
NL2Repo
64%
Cybergym
ningún otro modelo puntuó más alto 88.1%
GPQA Diamond
90.9%
Agents' Last Exam
31.8%
BabyVision with tools
89.6%

Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 65 modelos comparables

Entrada$0.3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$1.2/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.03/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 393.216

Caché de prompts

Modo automático
Duración sin TTL fijo (se borra cuando deja de usarse)

Razonamiento

Parámetro reasoning_effort
Valores minimal · low · medium · high el conjunto aceptado es del proveedor

Modelo

Modalidades texto + imagen → texto
Parámetros 552B totales · 8B prefill / 16B decode activos MoE, Causal Encoder-Decoder
Licencia MIT

Natively multimodal successor to the V4 Flash line: a 552B-parameter MoE on a Causal Encoder-Decoder stack activating 8B parameters per token at prefill and 16B at decode, with the model card recommending a maximum output of at least 256K tokens.

según documentación oficial de DeepSeek ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

DeepSeek V4.1 Flash superado · 3 sentences

Enabling reasoning changed the unit economics: the model now spends extra billable tokens internally to “think” before producing the answer, and those reasoning tokens are charged like output tokens even though users never see them. That added token generation—plus longer contexts and occasional retries on harder prompts—roughly doubled our cost per request. We can control this by capping reasoning depth, routing only complex queries to reasoning models, and caching common prompts to bring the bill back down.

salida 423 tok (+327 pensamiento) latencia 14.6 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

DeepSeek V4.1 Flash superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` is counting equal adjacent pairs, not elements in the current run: every time `xs[i] == xs[i - 1]`, the run length increases by one element, but the first element of the run was never counted, so all runs are undercounted by one. Also, `best` starts at `0`, so single-element inputs return `0` instead of `1`, and a one-element run ending at the last index is missed entirely.

salida 918 tok (+733 pensamiento) latencia 11.4 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

DeepSeek V4.1 Flash superado · 5/5 fields, guidance "withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":"withheld pending the Q4 close"}

salida 1707 tok (+1667 pensamiento) latencia 15.1 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

DeepSeek V4.1 Flash superado · 116 words, 0 banned, 1 question

Today we're launching Cross-Provider Prompt Cache for our API gateway. It stores identical prompt requests and their responses across supported model providers, then serves cached results when a match is found. Teams can cut duplicate inference costs, reduce latency, and keep behavior consistent during provider failover. The cache works with configurable TTLs, per-route rules, and cache-key controls, so you decide what is reusable and what must stay fresh. Does your application send the same prompts to multiple providers? Now your gateway can answer many of those calls without another upstream request. Existing observability dashboards show hit rates, saved tokens, and estimated spend reduction. Enable it in the gateway console, set your policy, and start caching today.

salida 917 tok (+770 pensamiento) latencia 9.0 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use DeepSeek V4.1 Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de DeepSeek V4.1 Flash

  • El diseño es una ruptura real y no un reajuste.
  • DeepSeek describe una arquitectura Causal Encoder-Decoder - un Transformer de 40 capas organizado como un codificador causal de 20 capas seguido de un decodificador de 20 capas - sobre un backbone Mixture-of-Experts de 552B parámetros que activa solo 8B parámetros por token durante el prefill y 16B durante el decode, un reparto dirigido de lleno a cargas agénticas intensivas en entrada.
  • La memoria sigue la misma línea: Compressed Sparse Attention 2 junto con el almacenamiento en caché KV principal en FP4 reduce la huella global de caché KV a 890 bytes por token, aproximadamente una cuarta parte de DeepSeek V4 Flash, mientras que SWA Bounded Replay recorta la huella KV persistente a cerca de una octava parte.
  • La ventana de contexto llega a 1M tokens, los pesos están bajo licencia MIT y se admiten las llamadas a herramientas.
  • Lo que conviene presupuestar es el razonamiento: la traza vuelve separada de la respuesta y en prompts cortos puede suponer casi la totalidad de los tokens de salida, así que un max_tokens ajustado devolverá una respuesta vacía que aun así se factura íntegra por los tokens dedicados a pensar.
  • El esfuerzo de razonamiento es ajustable, y la tarjeta del modelo lo documenta como un control continuo en lugar de un puñado de niveles con nombre.
  • Synthorai lo sirve a través del endpoint de chat completions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de DeepSeek V4.1 Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.3/M por tokens de entrada, solo ese crédito cubre aproximadamente 416 solicitudes de ~8K tokens contra DeepSeek V4.1 Flash.

¿En qué destaca DeepSeek V4.1 Flash?

Multimodal nativo: entrada de imágenes y texto; MoE de 552B, 8B activos en el prefill; contexto de 1M con pesos bajo licencia MIT. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash cuesta $0.3 por millón de tokens de entrada y $1.2 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.03/M.

¿DeepSeek V4.1 Flash admite caché de prompts?

Sí, automáticamente: los prompts servidos por DeepSeek se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.03/M frente a $0.3/M sin caché (TTL sin TTL fijo (se borra cuando deja de usarse)). Guía de caché de prompts →

¿Cómo obtengo acceso a DeepSeek V4.1 Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="deepseek-v4.1-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

¿DeepSeek V4.1 Flash es open source?

Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →