🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
DeepSeek V4 Flash: thinking corrompe JSON estrito

DeepSeek V4 Flash: thinking corrompe JSON estrito

Conteúdo
  1. Como as três versões V4 se comparam na especificação e na medição?
  2. O modo thinking corrompe a saída estruturada no V4 Flash?
  3. Quais controles de thinking a API aceita?
  4. De quanto thinking a matemática com duas etapas realmente precisa?
  5. O que o cache implícito entrega?
  6. Os limites de contexto de 1 milhão e de saída de 384 mil são reais?
  7. Preview, 0731 e Pro: qual versão atende suas chamadas?
  8. Perguntas frequentes

O DeepSeek V4 Flash custa $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída, com cache hits a $0.0028. A versão 0731 retreinada, agora distribuída com esse nome, tem um defeito que exige contorno no roteamento: com thinking ativado, que é o padrão, e um json_schema estrito, campos inteiros vieram corrompidos em 8 de 13 execuções com thinking padrão, por dois caminhos de requisição independentes. Desativar thinking corrigiu todas as execuções e reduziu a extração para um sétimo dos tokens. Medimos o deepseek-v4-flash-0731 no primeiro dia: a corrupção, a queda mais acentuada ao desativar thinking introduzida pelo retreinamento, o orçamento mínimo que recupera o desempenho, as páginas de cache de 1.024 tokens e o que ainda diferencia a versão preview e o V4 Pro.

TL;DR

  • Com thinking padrão e json_schema estrito, o deepseek-v4-flash-0731 corrompeu campos inteiros em 8 de 13 execuções por dois caminhos de requisição; o V4 Pro corrompeu 2 de 4, e apenas a versão preview não apresentou erros.
  • O retreinamento 0731 acentuou a queda ao desativar thinking: a matemática com 2 etapas caiu de 6/6 para 0/6.
  • O cache entrega páginas de 1.024 tokens a partir de um mínimo aproximado de 1,1 mil tokens, produz hits 0,3 segundo após o priming e mantém as entradas por mais de 45 minutos.
  • enable_thinking: false corrigiu todas as execuções estruturadas usando um sétimo dos tokens; para matemática com 2 etapas, o orçamento seguro de thinking é 256.

Como as três versões V4 se comparam na especificação e na medição?

Mesmo tokenizer, mesmo cache e o mesmo mecanismo de thinking; preços e modos de falha diferentes. Todas as medições abaixo vêm de testes idênticos executados nas três versões. Um traço indica que a célula não foi testada. As análises publicadas no primeiro dia se concentram em benchmarks, portanto esta é a parte operacional da comparação:

Flash 0731Flash previewV4 Pro
Preço de tabela, entrada/saída por 1 milhão$0.14 / $0.28$0.14 / $0.28$0.435 / $0.87
Entrada com cache hit por 1 milhão$0.0028$0.0028$0.003625
Thinking padrãoativadoativadoativado
JSON estrito com thinking ativado5/5 corrompidas (nosso caminho)4/4 corretas2/4 corrompidas
Matemática com 2 etapas e thinking desativado0/62/64/4
thinking_budgetexato por tokenexato por tokenrespeitado (4/4 com 16)
Páginas de cache1.024 tokens, hit em 0,3 sigualigual
Tokenizer e overhead do promptidênticos, 5 tokensigualigual
Recall de needle testado até838 mil tokens--

O modo thinking corrompe a saída estruturada no V4 Flash?

Na versão 0731, sim. A falha é silenciosa o bastante para chegar à produção. Uma extração de fatura com quatro campos sob json_schema estrito — fornecedor, data, total e quantidade de itens — retornou JSON válido pelo schema, mas com números errados. O campo line_items retornou -1, 1, -1 e -19 para um documento que lista claramente três itens. Nenhuma das 5 execuções com thinking padrão foi correta em nosso gateway. Limitar o orçamento não evita o problema: uma execução com orçamento de 64 tokens apresentou a mesma corrupção e, mesmo com 256 tokens, 1 de 3 execuções retornou 670 como quantidade de itens. A corrupção depende da presença de thinking, não do seu tamanho. Em um segundo caminho de requisição independente, o mesmo teste apresentou corrupção em 3 de 8 execuções, divididas em dois lotes. Em uma delas, retornou um total de 519.95 para um documento com $520.00; em outra, informou 22 itens. Esse caminho manteve o reasoning ativado mesmo após receber a instrução para desativá-lo, portanto a correção descrita abaixo foi confirmada no caminho principal. O JSON sempre pode ser interpretado e sempre passa na validação do schema; apenas os valores estão errados. Esse é o pior modo de falha para um pipeline que confia na validação.

A correção exige uma linha: enable_thinking: false produziu JSON correto e válido em todas as execuções, usando cerca de 44 tokens de completion, contra 328 no padrão. A diferença dentro da família é significativa. Testada da mesma forma com thinking ativado, a versão preview acertou 4/4, enquanto o V4 Pro corrompeu 2 de 4. A falha atravessa a linha V4 com thinking e atinge com mais força a versão flash retreinada. Também não é o bug conhecido da combinação entre thinking e schema: em abril, o vLLM corrigiu um problema de integração no qual o JSON do DeepSeek era colocado no campo de reasoning e o conteúdo ficava vazio. Aqui, a integração funciona e os valores estão errados, uma falha bem mais grave. Até que a DeepSeek corrija o defeito, trate thinking e saída estruturada estrita como incompatíveis nesses modelos. Isso não aumenta o custo: extrações de uma única etapa são exatamente o tipo de carga em que desativar thinking é seguro e 7 vezes mais barato.

Quais controles de thinking a API aceita?

Há duas formas de desativar thinking, um orçamento exato e um seletor de esforço sem opção de desligamento. A interface que medimos aceita os valores low, medium, high, xhigh e max em reasoning_effort. Ao contrário do Qwen 3.8 Max, none e minimal são rejeitados, então esse seletor sozinho não consegue silenciar o modelo. Para desativar thinking, use enable_thinking: false ou thinking: {"type": "disabled"}. As duas formas se comportam de maneira idêntica, com respostas de 9 tokens para uma pergunta trivial. thinking_budget é respeitado token por token, exatamente como medimos no Qwen 3.8: ao solicitar 16, o medidor registra 16. A cadeia de pensamento completa é retornada em reasoning_content, e o overhead fixo do prompt é de apenas 5 tokens por chamada.

O seletor de esforço não produziu nenhum efeito mensurável. Em uma tarefa intensiva de contagem de números primos, low e high consumiram 31.374 e 31.370 tokens de reasoning, contra 26.897 no padrão. As três respostas estavam corretas: variação normal, sem qualquer sinal de limite. Os níveis do Qwen 3.8 são limites de orçamento ocultos que entram em ação em tarefas intensivas, mas os níveis do V4 Flash não alteraram nada em nenhuma profundidade testada. Neste modelo, os controles relevantes são a desativação e thinking_budget; considere o seletor apenas decorativo. Há uma ironia nisso: o model card da própria DeepSeek fixa os benchmarks de agentes em “max reasoning effort”, uma configuração que, na interface medida, não produziu nada que pudesse ser distinguido do padrão.

De quanto thinking a matemática com duas etapas realmente precisa?

Mais do que antes do retreinamento, invertendo a recomendação de modo econômico que demos para outros modelos. Em nosso lote reproduzível de aritmética com 2 etapas — 1.850 caixas com 24 peças cada, 75% enviadas e 3.120 entregues —, as três versões V4 se comportam como três modelos diferentes:

Configuração0731Flash previewV4 Pro
padrão (thinking ativado)6/66/64/4
thinking desativado0/62/64/4
thinking_budget: 162/65/64/4
thinking_budget: 645/6--
thinking_budget: 2566/6--

Duas conclusões. Primeiro, o retreinamento para agentes deslocou a aritmética para o canal de thinking: a versão preview ainda acerta algumas com thinking desativado, a 0731 falha por completo e o Pro não é afetado. Segundo, o orçamento mínimo varia por modelo. No mesmo lote, 16 tokens de thinking recuperam totalmente o Qwen 3.8 Max, mas a versão 0731 precisa de 256. Nesse ponto, ela atinge 100% de acerto e ainda custa menos que a configuração padrão, com totais de completion entre 53 e 188, contra 100 a 200 no padrão. Ao portar uma configuração de thinking budget entre modelos, execute novamente o teste de precisão. O mecanismo é universal; o limite, não.

O que o cache implícito entrega?

Páginas de 1.024 tokens, com um mínimo baixo, servidas rapidamente e mantidas por bastante tempo. Pares de prefixos com salt produziram hits exatos de 1.024, 2.048, 4.096 e 7.168 tokens conforme o prompt crescia: quantização em páginas de 1.024. O mínimo fica pouco acima de uma página. Um prompt de 704 tokens nunca gerou hit; outro de 1.166 tokens gerou um hit de 1.024. Um hit chegou 0,3 segundo depois do priming, portanto não há atraso de construção que exija tratamento na arquitetura. A entrada continuava sendo servida após 45 minutos, a maior duração observada em um cache implícito nessa faixa. A entrada do Qwen 3.8 Max expirou entre 15 e 45 minutos, e o mínimo fica perto de 4,3 mil tokens. A DeepSeek cobra $0.0028 por milhão de tokens de entrada com cache hit, 2% do preço sem cache, sem custo adicional de escrita. A disciplina usual de organização em camadas continua válida: primeiro o prefixo estável, depois o conteúdo volátil.

Os limites de contexto de 1 milhão e de saída de 384 mil são reais?

A janela funcionou em todos os pontos testados. Códigos de override inseridos no prompt foram reproduzidos literalmente com 137.638, 465.238 e 838.198 tokens de entrada, em 7 a 20 segundos. Foi o recall de contexto longo mais rápido que medimos nessa faixa de preço. O limite de saída é menos rígido do que a documentação indica. A DeepSeek publica uma saída máxima de 384 mil tokens, mas requisições com max_tokens de 393.217 e até 524.288 foram aceitas tanto com thinking quanto sem ele. O limite não é aplicado no recebimento da requisição, e um orçamento acima do máximo não falhará de forma explícita. Defina seu próprio teto se depender de um.

Preview, 0731 e Pro: qual versão atende suas chamadas?

A página de preços da DeepSeek agora lista um único SKU: deepseek-v4-flash, com DeepSeek-V4-Flash-0731 como versão do modelo e preços inalterados. Na prática, a versão preview ainda é atendida pelo próprio nome em algumas rotas. Apesar de compartilharem o mesmo tokenizer — com contagens idênticas em corpora de inglês, chinês e código, o que permite portar orçamentos —, é fácil distingui-las externamente. O teste mais claro é desativar thinking. Em nossos lotes de matemática com 2 etapas, a versão preview acerta cerca de 2/6 e a 0731, 0/6. A preview também é a única que passou sem erros no teste de saída estruturada: 4/4 corretas, contra 5/5 corrompidas na 0731 e 2/4 no Pro. Se o tráfego depender de qualquer um desses comportamentos, teste o endpoint realmente chamado em vez de confiar no nome. O V4 Pro ($0.435/$0.87) não sofreu a queda em matemática, mas apresentou o mesmo problema de saída estruturada.

Um ponto para planejamento: o tokenizer compartilhado pelos três modelos usa cerca de 6% a 9% mais tokens que o Qwen 3.8 nos mesmos corpora. Comparações de orçamento entre fornecedores precisam considerar os dados de densidade por idioma, não apenas a tabela de preços.

Perguntas frequentes

A saída estruturada é segura no DeepSeek V4 Flash?

Com thinking desativado, sim: o json_schema estrito foi aplicado e todas as extrações do lote estavam corretas. Com thinking padrão ativado na versão 0731, campos inteiros vieram corrompidos em 8 de 13 execuções por dois caminhos de requisição, embora todas passassem na validação do schema. O V4 Pro corrompeu 2 de 4 execuções do mesmo teste; apenas a versão preview não apresentou erros. Fixe enable_thinking: false nas rotas de saída estruturada até que o defeito seja corrigido.

É possível desativar thinking no DeepSeek V4 Flash?

Sim, de duas formas: enable_thinking: false ou thinking: {"type": "disabled"}. Porém, o retreinamento 0731 tornou o estado sem thinking frágil em tarefas com várias etapas, com 0/6 em matemática de 2 etapas. Use thinking_budget de 256 como mínimo para qualquer tarefa além de consultas de uma única etapa. Essa configuração atingiu 100% de acerto e custou menos que o padrão.

Qual é o tamanho mínimo de prompt para o cache do V4 Flash?

Pouco mais de 1.024 tokens: um prompt de 704 tokens nunca entrou no cache, enquanto outro de 1.166 tokens gerou um hit exato de 1.024. Os hits são quantizados em páginas de 1.024 tokens, aparecem 0,3 segundo após o priming e duram mais de 45 minutos. A entrada com cache hit custa $0.0028 por milhão, 2% do preço sem cache.

Os preços mudaram com o lançamento da versão 0731?

Não. A DeepSeek manteve $0.14 por milhão de tokens de entrada sem cache, $0.0028 com cache hit e $0.28 por milhão de tokens de saída. A versão 0731 foi incorporada ao nome existente deepseek-v4-flash como versão atual do modelo. O que mudou foi o comportamento, não o preço: maior dependência de thinking e o defeito de saída estruturada descrito acima.

Medições realizadas em 2026-08-04 pelo gateway da Synthorai com deepseek-v4-flash-0731, usando como comparação a preview de deepseek-v4-flash e deepseek-v4-pro: lotes de extração com schema estrito e registro do payload de cada execução, verificados em um segundo caminho de requisição independente; testes dos valores aceitos pelo seletor e de valores inválidos; lote de precisão com 2 etapas (n=4-6 por grupo, com salt) e uma sequência crescente de thinking budgets para recuperação; pares de cache com salt em intervalos de 2,5 segundos, incluindo testes de mínimo, página, atraso e intervalo; testes dos limites de max_tokens nos dois modos; e contagens idênticas do tokenizer em três corpora para os três modelos, além do Qwen 3.8 Max. Os valores em dólares são os preços de tabela publicados pela DeepSeek na data de publicação; confira o medidor do seu próprio provedor. O comportamento pode mudar conforme a DeepSeek atualiza a versão 0731.

← Voltar ao blog