
Neste artigo (4)
Preços do DeepSeek V4 Pro: análise de pico e fora de pico quatro vezes maior
Principais conclusões
- Orçamentos de APIs de modelos precisam de acompanhamento em nível de tokens, não de estimativas mensais.
- Tarifas de pico e fora de pico podem direcionar a demanda sem bloquear usuários.
- Acertos de cache, falhas de cache e extensão da saída agora são insumos de design de produto.
A mudança do V4 Pro mostra como o acesso barato à IA pode evoluir para uma precificação consciente dos recursos quando o uso encontra computação escassa.
A mudança do V4 Pro mostra como o acesso barato à IA pode evoluir para uma precificação consciente dos recursos quando o uso passa a depender de computação escassa.
Preços baratos de API são uma tática maravilhosa de aquisição de clientes até a fatura começar a soar como um alarme de fumaça. O DeepSeek V4 Pro chegou àquele momento adulto meio desconfortável: a API não está mais sendo vendida apenas como acesso barato a um modelo capaz; ela está sendo precificada como infraestrutura compartilhada em horário de pico. O aumento de quatro vezes é a manchete. A divisão entre horário de pico e fora de pico é a lição de produto.
O lançamento é uma arquitetura de preços
A Reuters informou que a DeepSeek aumentou os preços de API para seus modelos V4, e o Channel Insider descreveu o aumento da API V4 como superior a quatro vezes. Segundo a DeepSeek API Docs, os preços do V4 Pro agora são divididos entre tarifas fora de pico e de pico, com os horários fora de pico custando metade do preço do horário de pico. A DeepSeek lista o V4 Pro a US$ 0,022 para entrada com acerto de cache, US$ 0,66 para entrada com erro de cache e US$ 1,98 para saída por 1 milhão de tokens em preços fora de pico, subindo para US$ 0,044, US$ 1,32 e US$ 3,96 em preços de pico. O V4 Flash segue a mesma estrutura, a US$ 0,007, US$ 0,22 e US$ 0,66 fora de pico, depois US$ 0,014, US$ 0,44 e US$ 1,32 no pico.
A DeepSeek API Docs também nomeia dois modelos de API V4: deepseek-v4-flash, que serve o DeepSeek-V4-Flash-0731, e deepseek-v4-pro, que serve o DeepSeek-V4-Pro-0813. Ambos usam um comprimento de contexto de 1 milhão e uma saída máxima de 384 mil, segundo a mesma documentação. A divisão interessante é a concorrência: a DeepSeek lista um limite de concorrência de 2500 para o V4 Flash e 500 para o V4 Pro. Essa é a linha de produtos em miniatura: uma faixa para vazão, outra para capacidade mais pesada.
Essa diferença de concorrência é a pista. Páginas de preços geralmente fingem ser documentos contábeis, mas as boas são sistemas de controle de tráfego. Esta diz aos desenvolvedores que a capacidade premium não é infinita e que a empresa quer deslocar o uso para horários mais baratos quando possível.
Por que o V4 Pro pode cobrar mais
A Artificial Analysis descreve o DeepSeek V4 Pro (Reasoning, Max Effort) como um modelo de pesos abertos lançado em abril de 2026. O modelo marcou 45 no Artificial Analysis Intelligence Index, em comparação com uma mediana de 26 entre modelos comparáveis, e o site diz que ele oferece suporte a entrada de texto, saída de texto e uma janela de contexto de 1 milhão de tokens. Isso ajuda a explicar por que a DeepSeek consegue testar um teto de preço mais alto sem abandonar totalmente sua postura de desafiante.
Se o modelo é materialmente mais forte, a conversa sobre preços muda de token mais barato para token útil. O problema é a verbosidade. A Artificial Analysis diz que o DeepSeek V4 Pro gerou 180 milhões de tokens em sua avaliação do Intelligence Index, em comparação com uma mediana de 99 milhões, e classifica o modelo como muito verboso. Na economia de APIs, isso não é uma nota de rodapé; é o medidor girando. Um modelo que raciocina bem, mas fala muito, pode transformar limites generosos de saída em uma surpresa de custo para clientes que não instrumentam prompts, conclusões e tentativas.
O efeito de segunda ordem é comportamental
A DeepSeek API Docs diz que a cobrança se baseia no número total de tokens de entrada e saída, com a entrada dividida em categorias de acerto de cache e erro de cache. Essa distinção importa mais na nova estrutura porque o caminho caro não é apenas usar o V4 Pro; é usar o V4 Pro no pico, sem acerto de cache e gerando respostas longas. Esta página de preços é um “Escolha Sua Própria Aventura” em que os finais caros começam com prompts sem cache e saídas verbosas.
A jogada inteligente para quem cria produtos é tratar cache e tamanho de resposta como requisitos de produto, não como tarefas de limpeza. Preços de pico e fora de pico também mudam a conversa com o cliente. Um preço fixo de API convida as equipes a perguntar se um modelo é barato o suficiente. Um preço baseado em horário pergunta se a carga de trabalho é urgente o suficiente. Avaliações em lote, análises internas e tarefas não interativas muitas vezes podem ser movidas para janelas mais baratas, enquanto fluxos voltados ao usuário podem justificar tarifas de pico se a latência importa. Esse é um modelo mais honesto para infraestrutura escassa do que fingir que todo token chega com o mesmo perfil de custo.
O que builders devem copiar, e
o que clientes devem observar A Reuters e o Channel Insider enquadram a mudança como um aumento de preços, o que é verdade, mas a leitura mais útil é que a DeepSeek está saindo de preços de adoção para preços conscientes de recursos. Para founders e líderes de produto, a lição é simples: se o preço baixo é sua ponta de entrada, decida cedo o que acontece quando o uso se torna real. Se a resposta for um choque repentino de fatura quatro vezes maior, os clientes vão se sentir pegos de surpresa. Se a resposta for uma escada visível de controles de cache, timing e saída, os clientes conseguem se planejar.
Para os clientes, o próximo sprint deve incluir observabilidade de custos em nível de token. Acompanhe taxas de acerto de cache, taxas de erro de cache, tamanho de saída, uso em horário de pico e quais recursos realmente precisam do V4 Pro em vez do V4 Flash. O próximo movimento lógico da DeepSeek não é necessariamente outra mudança de preço. Observe se a documentação oficial evolui para controles de orçamento mais claros, orientação sobre cache e padrões de agendamento que tornem a nova arquitetura de preços mais fácil de operacionalizar.