
Neste artigo (4)
Análise do DeepSeek V4 Flash 0731: nota 50, 60% mais barato
Principais conclusões
- Compare modelos pelo custo total da tarefa, não apenas pela pontuação em benchmarks, especialmente para cargas de trabalho repetidas com contexto longo.
- Teste as taxas de acerto de cache nos seus próprios prompts, porque a vantagem de preço da DeepSeek depende muito da economia de cache.
- Aguarde pesos completos e dados independentes de latência antes de comprometer cargas de trabalho de produção.
A Artificial Analysis diz que o DeepSeek ganhou 10 pontos no Índice de Inteligência enquanto reduziu o custo de uma tarefa comparável do Luna por meio de preços agressivos de cache.
A Artificial Analysis diz que a DeepSeek ganhou 10 pontos no Índice de Inteligência, ao mesmo tempo em que reduziu o custo de uma tarefa Luna comparável por meio de uma estratégia agressiva de preços de cache.
A coisa mais engraçada sobre benchmarks de IA é que o número que todo mundo tira print muitas vezes não é o número que aparece na sua fatura da nuvem. O DeepSeek V4 Flash 0731 acabou de nos dar os dois números, o que é falta de consideração com os vendedores de hype, mas útil para quem implanta coisas de propósito. A Artificial Analysis informa que o modelo marca 50 em seu Índice de Inteligência, um salto de 10 pontos em relação ao DeepSeek V4 Flash de abril de 2026, enquanto o Custo por Tarefa na API própria da DeepSeek fica cerca de 60% menor que o do GPT-5.6 Luna. Em algum lugar, uma planilha acabou de pigarrear.
A Artificial Analysis coloca o Flash 0731 perto do Luna
A Artificial Analysis diz que o DeepSeek V4 Flash 0731 marca 50 em seu Índice de Inteligência, acima dos 40 do DeepSeek V4 Flash anterior, lançado em abril de 2026. Isso também o coloca 6 pontos à frente do DeepSeek V4 Pro, segundo o mesmo relatório da Artificial Analysis.
A parte interessante não é só o salto, porque benchmarks são confete se não estiverem ligados à realidade de implantação. É que a Artificial Analysis coloca o modelo apenas um ponto no Índice de Inteligência atrás do GPT-5.6 Luna, que marca 51, perto o bastante para que equipes de compras comecem a se comportar como guaxinins em uma caçamba de preços.
A Artificial Analysis também posiciona o modelo em relação a concorrentes próximos: GLM-5.2 com 51, Gemini 3.6 Flash com 50, Muse Spark 1.1 com 51 e Kimi K3 com 57 como a fronteira dos pesos abertos. Esse contexto importa porque uma pontuação de 50 não vence toda a competição de levantamento de peso, mas de repente está na mesma plataforma que modelos que muitos construtores considerariam para cargas de trabalho sérias de agentes, programação e raciocínio.
O relatório diz que o DeepSeek V4 Flash 0731 mantém uma janela de contexto de 1 milhão de tokens, e que seu tamanho permanece inalterado em relação ao DeepSeek V4 Flash. Em bom português: isso parece menos uma criatura nova e gigante e mais a mesma criatura depois de um fim de semana muito produtivo com pós-treinamento.
A história do preço é, na verdade, uma
história de cache A Artificial Analysis diz que o DeepSeek V4 Flash 0731 compartilha arquitetura e preços idênticos aos do DeepSeek V4 Flash anterior, ao mesmo tempo em que entra em sua fronteira de Pareto para Inteligência versus Custo por Tarefa. O mesmo relatório diz que, mesmo após o corte de 80% nos preços da OpenAI para o GPT-5.6 Luna, o Custo por Tarefa do DeepSeek V4 Flash 0731 na API própria da DeepSeek é cerca de 60% menor que o do GPT-5.6 Luna.
Esse é o tipo de frase que faz gráficos de benchmark parecerem menos conversa de esporte e mais uma fatura com opiniões. Se dois modelos são mais ou menos comparáveis em um conjunto de tarefas, o mais barato não precisa vencer todos os gráficos de barras para ganhar uma vaga na implantação.
O ingrediente secreto, segundo a Artificial Analysis, é o desconto de aproximadamente 98% da DeepSeek para acertos de cache em sua API própria, em comparação com o desconto de 90% para acertos de cache oferecido pela maior parte do setor. É aqui que a precificação de IA deixa de ser uma simples conta de cardápio e vira empilhamento de cupons em um supermercado administrado por álgebra linear.
Entrada em cache pode importar muito para apps com prompts repetidos, instruções de sistema, estruturas de recuperação, reutilização de contexto longo ou loops de agentes que continuam arrastando a mesma mochila de tokens por aí. Os dados de provedores da Artificial Analysis listam a DeepSeek como o provedor disponível para o DeepSeek V4 Flash 0731 e mostram um preço combinado de US$ 0,06 por 1 milhão de tokens, ao mesmo tempo em que observam que benchmarks de provedor, como velocidade de saída e tempo de resposta de ponta a ponta, não estão disponíveis nessa página.
A DeepSeek diz que o caminho da
API continua chato, o que é bom O registro de alterações da API da DeepSeek diz que a API oficial DeepSeek-V4-Flash entrou em beta público em 31/07/2026, e que o método de chamada permanece inalterado: defina o nome do modelo como deepseek-v4-flash para usar a versão mais recente. Compatibilidade chata é subestimada. Todo mundo quer magia até a camada de orquestração começar a gritar porque um fornecedor renomeou o grimório.
O mesmo registro de alterações da DeepSeek informa resultados de benchmarks de agentes para o lançamento oficial, incluindo Terminal Bench 2.1 em 82,7, NL2Repo em 54,2, Cybergym em 76,7, DeepSWE em 54,4, Toolathlon verificado em 70,3, Agent Last Exam em 25,2, Automation Bench Public em 25,1, DSBench-FullStack em 68,7 e DSBench-Hard em 59,6.
A DeepSeek diz que o V4-Flash oficial oferece suporte nativo ao formato da Responses API e é especificamente adaptado para o Codex. Ela também diz que o DeepSeek-V4-Flash-0731 mantém a mesma arquitetura e o mesmo tamanho de modelo do DeepSeek-V4-Flash-Preview, e foi apenas pós-treinado novamente. Essa última cláusula é o verdadeiro doce nerd: nem toda melhoria significativa de modelo exige deixar a coisa maior, mais quente e mais cara, como um rack de GPUs fantasiado de forno de pizza.
O que construtores devem testar a seguir A Artificial Analysis diz
que se espera que a DeepSeek lance os pesos completos do modelo nas próximas semanas, então avaliações locais e auto-hospedadas podem se tornar mais relevantes se isso acontecer. Até lá, o movimento prático é testar sua própria carga de trabalho tanto em relação à qualidade quanto ao comportamento de cache.
Um modelo que parece barato em uma calculadora genérica pode ficar caro se seus prompts forem todos flocos de neve únicos, e um modelo mais caro pode se tornar aceitável se sua qualidade evitar novas tentativas. Cache de tokens não é um enfeite aqui; é o molho, o prato e possivelmente o garçom.
Para construtores, o DeepSeek V4 Flash 0731 é um lembrete de que a competição entre modelos de fronteira tem cada vez mais a ver com o custo total da tarefa, não apenas com quem consegue levantar o benchmark mais alto no supino. Observe dados de latência, desempenho real em programação e agentes, taxas de acerto de cache e se o lançamento esperado dos pesos muda as opções de implantação. O placar ficou mais apertado, mas é na fatura que a trama aprendeu a programar.