Todos os dias - Tecnologia e Cultura Nerd
IA

DeepSeek V4 chega com novos preços — e usar IA fora do horário de pico pode custar metade

A DeepSeek está preparando uma mudança importante nos preços de sua API com a chegada oficial da nova família DeepSeek V4. E, desta vez, a empresa resolveu adicionar uma variável que normalmente associamos a companhias aéreas, aplicativos de transporte e contas de energia elétrica: o horário em que você usa o serviço.

A partir das 16h UTC (13h no Brasil) de 16 de agosto de 2026, a DeepSeek passará a adotar um sistema de preços baseado em horário de pico e fora de pico.

Na prática, utilizar os modelos durante o período de menor demanda poderá custar metade do preço cobrado nos horários de pico.

Para quem roda aplicações com grande volume de requisições, a diferença pode ser bastante relevante.

DeepSeek V4 terá preços diferentes dependendo do horário

A nova estrutura será aplicada aos dois modelos da família V4 anunciados pela empresa: DeepSeek V4 Flash e DeepSeek V4 Pro.

O princípio é simples: durante o horário de menor demanda, os preços ficam 50% abaixo daqueles cobrados no período de pico.

No caso do V4 Flash, por exemplo, o custo de entrada com cache será de US$ 0,007 por milhão de tokens fora do horário de pico. Durante o período de maior demanda, o mesmo volume passa a custar US$ 0,014.

Ou seja: exatamente o dobro.

A mesma lógica vale para tokens de entrada sem cache e para a geração de tokens.

DeepSeek V4 Flash

TipoFora do picoHorário de pico
Input — cache hitUS$ 0,007US$ 0,014
Input — cache missUS$ 0,22US$ 0,44
OutputUS$ 0,66US$ 1,32

O modelo Flash, como o próprio nome sugere, é a opção mais barata da nova família e tende a ser particularmente interessante para aplicações que precisam processar grandes volumes de requisições.

Mas é no V4 Pro que os números começam a ficar mais interessantes.

DeepSeek V4 Pro

TipoFora do picoHorário de pico
Input — cache hitUS$ 0,022US$ 0,044
Input — cache missUS$ 0,66US$ 1,32
OutputUS$ 1,98US$ 3,96

No período de pico, um milhão de tokens de saída do V4 Pro custará US$ 3,96.

Fora dele, o mesmo milhão de tokens sai por US$ 1,98.

Para uma utilização casual, provavelmente não fará muita diferença.

Para uma aplicação que gera milhões ou bilhões de tokens, pode fazer uma diferença bastante grande na conta do fim do mês.

A DeepSeek quer que você escolha quando gastar

A justificativa apresentada pela empresa é relativamente direta: distribuir melhor os recursos disponíveis.

Em vez de cobrar um preço único independentemente da demanda, a DeepSeek quer incentivar os usuários a deslocarem tarefas menos urgentes para períodos de menor utilização.

É uma estratégia bastante conhecida em outros setores.

Quando a demanda está alta, paga-se mais.

Quando a demanda cai, paga-se menos.

A novidade é ver esse modelo chegando com mais força ao mercado de APIs de inteligência artificial.

E faz sentido.

Data centers não funcionam exatamente como um restaurante em que simplesmente colocamos mais mesas quando chegam clientes. Computação é limitada, e grandes modelos de IA podem consumir uma quantidade considerável de infraestrutura para atender milhares de requisições simultaneamente.

Se a DeepSeek conseguir convencer desenvolvedores a agendar tarefas menos urgentes para os períodos mais baratos, consegue distribuir melhor a carga.

E o usuário, em troca, ganha um desconto.

Mas o que exatamente é horário de pico?

Aqui está uma informação que desenvolvedores provavelmente vão querer saber antes de começar a reprogramar seus sistemas: o anúncio informa os preços de pico e fora de pico, mas não detalha, no comunicado fornecido, quais são exatamente as janelas de horário correspondentes a cada período.

Isso é importante.

A mudança entra em vigor às 16h UTC de 16 de agosto, mas isso não significa necessariamente que 16h UTC seja o início diário do horário de pico.

A DeepSeek está introduzindo uma estrutura dinâmica de cobrança, e os horários específicos precisam ser observados na documentação e no painel da API.

Para quem pretende otimizar custos, essa será uma informação tão importante quanto o próprio preço.

O cache continua sendo seu melhor amigo

Existe outro detalhe na tabela que merece atenção: a diferença entre cache hit e cache miss.

Quando a API consegue reutilizar uma parte previamente processada do contexto, o custo de entrada é muito menor.

No V4 Flash, por exemplo, um milhão de tokens de entrada com cache durante o horário de pico custa US$ 0,014.

Sem cache, o mesmo milhão custa US$ 0,44.

É uma diferença de mais de 30 vezes.

No V4 Pro, a diferença é ainda maior em termos absolutos: US$ 0,044 por milhão de tokens com cache contra US$ 1,32 sem cache durante o pico.

Isso significa que, para desenvolvedores construindo aplicações sobre a API da DeepSeek, otimizar o uso de contexto e aproveitar o cache pode ser tão importante quanto escolher o modelo correto.

Não adianta economizar alguns centavos escolhendo o modelo mais barato se sua aplicação está enviando o mesmo contexto gigantesco a cada requisição.

A matemática eventualmente aparece para cobrar a conta.

V4 Flash ou V4 Pro?

A diferença de preço entre os dois modelos é significativa.

O V4 Flash é claramente voltado para aplicações em que custo e velocidade precisam andar juntos. Chatbots, automações, classificação, processamento de grandes volumes de texto e outras tarefas que não exigem necessariamente o modelo mais poderoso podem se beneficiar dessa opção.

O V4 Pro, por outro lado, custa três vezes mais na geração de tokens fora do pico: US$ 1,98 contra US$ 0,66.

Durante o pico, a diferença permanece proporcional: US$ 3,96 contra US$ 1,32.

Isso não significa que o Pro seja simplesmente “três vezes melhor”.

Em modelos de IA, desempenho depende muito da tarefa. Para algumas aplicações, a diferença de capacidade pode justificar o custo adicional. Para outras, o Flash pode fazer exatamente o que precisa por uma fração do preço.

É aí que entram os testes reais.

Para quem desenvolve, o horário pode virar parte da arquitetura

Essa talvez seja a consequência mais interessante da mudança.

Até agora, ao projetar uma aplicação baseada em LLM, normalmente pensamos em coisas como:

  • qual modelo utilizar;
  • quantos tokens enviar;
  • quanto contexto manter;
  • como aproveitar o cache;
  • quanto custa cada requisição.

Agora será necessário acrescentar mais uma pergunta:

“Essa tarefa precisa acontecer agora?”

Imagine uma aplicação que gera milhares de artigos automaticamente durante a madrugada.

Ou um sistema que processa documentos enviados pelos usuários e pode esperar algumas horas.

Ou ainda uma rotina que analisa grandes quantidades de dados todos os dias.

Em vez de executar tudo imediatamente, o sistema poderia colocar tarefas de baixa prioridade em uma fila e processá-las quando o preço estiver mais baixo.

Isso transforma o preço da API em uma variável de arquitetura.

E, para quem trabalha com sistemas de alto volume, isso pode ser bastante interessante.

A conta pode cair bastante — se você puder esperar

Imagine uma aplicação que consuma 100 milhões de tokens de saída do V4 Pro.

No horário de pico, isso representaria aproximadamente US$ 396.

Fora do pico, seriam US$ 198.

A tarefa é exatamente a mesma.

O modelo é exatamente o mesmo.

A quantidade de tokens também.

A única diferença é quando você manda a IA trabalhar.

Para aplicações em tempo real, obviamente, não existe muita escolha. Se o usuário está esperando uma resposta na tela, dificilmente você vai dizer:

“Sua resposta estará disponível às 3h17, quando a DeepSeek estiver mais barata.”

Mas para processamento assíncrono, a história muda completamente.

Uma mudança que pode virar tendência

Cobrança variável por horário não é exatamente uma novidade na tecnologia.

Serviços de nuvem já utilizam diferentes mecanismos para otimizar capacidade e preço, e a ideia de deslocar workloads para períodos de menor demanda faz bastante sentido em infraestrutura.

A diferença é que agora estamos começando a enxergar esse conceito diretamente na camada dos modelos de IA.

E isso pode ser apenas o começo.

À medida que os modelos ficam maiores e a demanda por inferência cresce, os provedores terão cada vez mais motivos para tentar distribuir essa demanda ao longo do dia.

Para os desenvolvedores, isso pode significar uma mudança de mentalidade.

Em vez de pensar apenas em quanto custa um milhão de tokens, será necessário pensar em quanto custa um milhão de tokens neste horário.

DeepSeek V4 chega com uma proposta interessante para desenvolvedores

A nova estrutura de preços mostra que a DeepSeek está tentando fazer mais do que simplesmente lançar uma nova geração de modelos.

A empresa também está mexendo na forma como o acesso à capacidade computacional é vendido.

Com o V4 Flash começando em apenas US$ 0,007 por milhão de tokens de entrada com cache e US$ 0,66 por milhão de tokens de saída fora do pico, a opção continua bastante agressiva para aplicações de alto volume.

O V4 Pro sobe o nível de capacidade — e também o preço — mas ainda oferece uma tarifa significativamente menor quando utilizado fora do horário de pico.

Para desenvolvedores, a mensagem parece clara:

se você não precisa que a IA trabalhe agora, talvez seja melhor não fazê-la trabalhar agora.

A partir de 16 de agosto, pelo menos na DeepSeek, o relógio também fará parte da conta.

E aparentemente até a inteligência artificial terá horário comercial.

Deixe um comentário

Seu e-mail não será publicado. Campos obrigatórios estão marcados com *.