O modelo V4-Pro do DeepSeek passou para um território prático de planejamento de API. A documentação atual de preços de API da empresa lista DeepSeek-V4-Pro junto com DeepSeek-V4-Flash, exposto por meio de um URL base no formato OpenAI e um URL base separado no formato Antrópico. Postagens da comunidade citando o changelog do DeepSeek dizem que a versão V4-Pro 0813 foi lançada para usuários de aplicativos, web e API em 13 de agosto.
A lista de modelos é notável por mais do que disponibilidade. DeepSeek-V4-Pro é anunciado com um comprimento de contexto de 1 milhão de tokens e uma saída máxima de 384 mil tokens, além de saída JSON, chamadas de ferramenta, conclusão de prefixo de bate-papo beta e conclusão FIM beta no modo sem pensamento. Para desenvolvedores que criam agentes, ferramentas de código, fluxos de trabalho de documentos longos ou sistemas de recuperação pesada, esses limites colocam o V4-Pro na categoria de modelos que podem remodelar a arquitetura de prompt em vez de simplesmente substituir um modelo de chat menor.
O preço, no entanto, é a verdadeira história operacional. A página do DeepSeek lista o V4-Pro a US$ 0,003625 por 1 milhão de tokens de entrada de acerto de cache, US$ 0,435 por 1 milhão de tokens de entrada de falha de cache e US$ 0,87 por 1 milhão de tokens de saída. Essa propagação significa que o custo de uma solicitação depende muito de o contexto repetido estar realmente atingindo o cache do provedor. Uma carga de trabalho que parece barata sob suposições otimistas de cache pode se tornar muito mais cara se os prompts forem altamente variáveis, mal segmentados ou roteados por meio de ferramentas que impedem a reutilização de cache.
O que mudou para os usuários da API
A documentação do DeepSeek agora apresenta o V4-Pro como um modelo de API de primeira classe com duas superfícies de compatibilidade: um endpoint de estilo OpenAI no URL base principal da API DeepSeek e um endpoint de estilo Antrópico em um caminho separado. Isso é importante porque reduz a barreira de integração para equipes que já usam clientes compatíveis com OpenAI, ao mesmo tempo que oferece aos clientes estilo Claude uma opção de formato mais direta.
Para um gateway de API de IA, o trabalho imediato é mundano, mas importante: atualizar o catálogo de modelos, atualizar a janela de contexto e os metadados de saída máxima, marcar os recursos suportados e decidir como representar os dois formatos de API. Tratar as superfícies do formato OpenAI e do formato Anthropic como a mesma coisa pode ser conveniente para páginas de marketing, mas pode criar confusão em SDKs, logs e controles de políticas. Os desenvolvedores precisam saber qual esquema de solicitação, comportamento de chamada de ferramenta e suposições de streaming se aplicam.
O grande limite de saída anunciado também merece atenção. Uma saída máxima de 384 mil tokens não é simplesmente um número maior em uma tabela. Ele altera os modos de falha. As equipes podem precisar de limites de resposta mais rígidos, alertas de cobrança e proteções no nível do aplicativo para evitar que gerações descontroladas ou despejos acidentais de formato longo transformem uma única etapa do agente em um evento de custo material.
Por que a precificação por acerto de cache agora é mais importante
O DeepSeek há muito tempo é associado por muitos desenvolvedores a preços agressivos de API. O V4-Pro complica essa percepção. O preço de entrada de cache-hit listado é extremamente baixo comparado ao preço de entrada de cache-miss, mas essa diferença só ajuda se uma carga de trabalho for projetada para reutilização de cache.
Na prática, a eficiência do cache depende da estabilidade imediata. Prompts de sistema longos, bloqueios de políticas, pacotes de documentação e contexto de repositório podem ser beneficiados quando reutilizados de forma consistente. Mas os sistemas de agente geralmente alteram os prompts a cada etapa: adicionando logs, saídas de ferramentas, carimbos de data/hora, planos intermediários e estados específicos do usuário. Se essas alterações alterarem os limites do cache ou causarem a perda de grandes prefixos, o custo efetivo poderá se aproximar da taxa de perda de cache.
É por isso que as políticas de roteamento não devem classificar V4-Pro por um único preço de entrada combinado. A simulação de custos deve separar os tokens de entrada e saída de cache-hit, cache-miss de entrada e saída e, em seguida, testar cargas de trabalho representativas. Um agente de codificação que reutiliza um grande resumo de repositório pode se comportar de maneira muito diferente de um assistente de suporte ao cliente que injeta um novo estado de conta em cada solicitação.
É também aqui que o Model Gate e camadas de roteamento multimodelo semelhantes têm uma função prática. Gateways que rastreiam o uso de tokens por modelo, equipe e chave de API podem ajudar os operadores a ver se uma rota supostamente barata é realmente barata na produção. A métrica relevante não é mais apenas tokens por solicitação; é a combinação de entrada de acesso ao cache, entrada não armazenada em cache e saída gerada em tráfego real.
Quem é afetado
Os desenvolvedores que usam o DeepSeek diretamente devem verificar os identificadores de modelo, o formato do endpoint e os sinalizadores de capacidade antes de alternar o tráfego de produção. A saída JSON e as chamadas de ferramentas estão listadas, mas o comportamento do aplicativo ainda precisa de testes, especialmente se o código existente depende do tratamento de casos extremos de outro provedor.
Os operadores de gateway e as equipes de plataforma têm uma lista de verificação mais ampla.Eles precisam de tabelas de preços atualizadas, limites de contexto, limites máximos de produção, metadados de recursos por modelo, controles de orçamento e documentação para acesso compatível com OpenAI e compatível com Anthropic. Se exporem o V4-Pro como um modelo drop-in, eles ainda deverão alertar os clientes de que a sintaxe de solicitação equivalente não garante comportamento ou custo equivalente.
As empresas que executam automação de alto volume devem rever as suposições do modelo padrão. Um modelo com uma janela de contexto de 1 milhão de tokens pode ser atraente para revisão jurídica, síntese de pesquisas, análise de base de código e agentes de longa duração. Mas os modelos de contexto longo tendem a encorajar prompts maiores, e prompts maiores ampliam cada erro no design do cache e no controle de saída.
O que permanece incerto
A página de preços fornece as taxas e capacidades listadas atualmente, mas ainda há incerteza em torno de futuras alterações de preços relatadas. Postagens na comunidade dizem que DeepSeek alertou sobre um aumento significativo no preço da API e que novos preços de pico e fora de pico podem entrar em vigor em 16 de agosto. Essas afirmações são relevantes para o planeamento orçamental, mas a tabela tarifária futura não foi verificada a partir de um aviso oficial diretamente acessível durante a investigação.
Essa incerteza deve tornar as equipas cautelosas em vez de congeladas. A resposta sensata é adicionar o V4-Pro aos pools de avaliação, testar cargas de trabalho reais, medir o comportamento do cache e evitar codificá-lo como o padrão permanente de menor custo até que o preço seja confirmado. Para algumas cargas de trabalho, o V4-Pro pode ser uma excelente opção de contexto longo. Para outros, especialmente agentes com grande produção ou prompts com baixa reutilização de cache, a economia pode ser menos favorável do que sugere a taxa de acertos de cache.
A lição mais ampla é que a disponibilidade do modelo é agora apenas a primeira questão de roteamento. As questões mais difíceis são sobre compatibilidade de formato, confiabilidade de recursos, mecânica de cache, limites de saída e observabilidade de custos. O DeepSeek V4-Pro oferece aos desenvolvedores outra opção de API poderosa, mas também deixa claro que “barato” se tornou uma conclusão específica da carga de trabalho, e não um rótulo do fornecedor.