Els preus de l'API V4 de DeepSeek han passat d'una pregunta senzilla de selecció de model a una pregunta de temps.

La pàgina oficial de preus de l'API de l'empresa ara inclou DeepSeek V4 Flash i DeepSeek V4 Pro amb grans finestres de context d'1 milió de testimonis, categories de base en format OpenAI i antròpic, i URL d'entrada de cache-misst de sortida de cache-hit per separat fitxes. Els informes agregats per Techmeme el 13 d'agost van dir que DeepSeek apujava els preus del model V4 i introduïa la facturació dinàmica de punta i baixa, i el nou preu entrarà en vigor a les 16:00 UTC del 16 d'agost de 2026.

Això fa que el canvi sigui més que una actualització rutinària de la taula de preus. Per als equips que executen agents de recuperació pesats, assistents de codificació de context llarg, treballs d'anàlisi per lots o productes d'IA orientats al client, el cost d'una sol·licitud de DeepSeek ara pot dependre no només del model escollit, sinó també de quan s'enviï la sol·licitud i de la quantitat de sol·licitud que es pot servir des de la memòria cau.

Què ha canviat a la facturació de DeepSeek V4>DeepSeek V4 actual. Flash i V4 Pro disponibles a través dels formats d'API d'estil OpenAI i d'estil antròpic. Això importa perquè molts desenvolupadors ja encaminen DeepSeek juntament amb altres proveïdors a través de capes de compatibilitat en lloc d'escriure codi d'aplicació específic del proveïdor.

L'estructura de facturació notable és la separació entre l'entrada de la memòria cau, l'entrada i la sortida de la memòria cau. A la pràctica, això significa que els prefixos de sol·licituds repetits, les instruccions del sistema, els esquemes d'eines o els blocs de context llargs reutilitzables poden tenir un perfil de cost diferent del text de sol·licitud que s'ha enviat recentment. Aquesta ja era una part important de la història de costos de DeepSeek V4-Pro. La nova capa màxima/fora de màxima afegeix una altra variable: la mateixa càrrega de treball pot tenir un preu diferent segons quan s'executi.

Els informes secundaris apunten a un augment del preu del material per als models V4 i una programació dinàmica a partir del 16 d'agost. Alguns càlculs de la comunitat reclamen augments percentuals molt grans per a casos específics amb molta quantitat de memòria cau, especialment quan els preus de la memòria cau han canviat bruscament. Aquestes xifres s'han de tractar amb precaució fins que es comprovi amb les factures actuals o la taula de facturació actual de DeepSeek. La direcció del viatge, però, és prou clara: els consumidors de l'API ja no poden avaluar DeepSeek V4 només per la capacitat del model de títol i les tarifes nominals per testimoni.

Per què són importants els preus punta i baixa

Els preus punta i baixa són habituals als mercats d'infraestructures, però encara és un patró relativament nou per a l'API LLM principal. Crea incentius que són familiars als equips de núvol i dades: treu el treball flexible fora de finestres cares, reserva temps addicional per a les sol·licituds dirigides als usuaris i fa que els treballs per lots esperen quan la latència no és crítica.

Per a les aplicacions d'IA, això té diversos efectes pràctics. Normalment, un bot d'assistència en temps real no pot retardar la resposta del client fins a una finestra més barata. Un treball d'anàlisi de base de codis nocturn, un pipeline d'enriquiment de documents o una avaluació sovint ho poden fer. Els sistemes d'agent es troben en algun lloc al mig: algunes trucades d'eines són interactives, mentre que d'altres es poden posar a la cua, tornar a provar o programar-se.

Això canvia el problema d'encaminament. Una passarel·la que triï entre models basats en la qualitat, la latència i el preu del token ara ha de tenir en compte el temps. Si DeepSeek V4 Pro és rendible durant les hores punta, però és car durant les hores punta, una aplicació pot preferir un altre model durant el dia i tornar a DeepSeek més tard. Si V4 Flash continua sent atractiu per a tasques ràpides, però l'economia de la memòria cau empitjora per als prefixos compartits durant molt de temps, és possible que l'arquitectura de sol·licitud en si mateixa necessiti una revisió.

Per als equips que utilitzen una passarel·la d'API d'IA, la funció més útil pot no ser un altre model alternatiu. Pot ser una política: enviar sol·licituds interactives immediatament, posar en cua treballs no urgents, avisar quan una sol·licitud entra en una finestra de cost més elevat o aplicar pressupostos a nivell d'equip abans que comenci l'execució per lots. Això és directament rellevant per a la infraestructura d'estil Model Gate perquè la facturació unificada, l'anàlisi d'ús i els controls d'encaminament es tornen més valuosos quan els preus dels proveïdors són dinàmics en lloc de estàtics.

Qui està més exposat

És probable que l'impacte més gran recaigui en els desenvolupadors de gran volum i les empreses amb càrregues de treball previsibles. Els productes de xat de consumidors, les plataformes d'agents de codificació, les eines de recerca, els serveis de neteja de dades i els equips d'automatització interna poden enviar un gran nombre de sol·licituds similars. Aquests sistemes sovint es beneficien de la memòria cau ràpida, però també són sensibles a petits canvis per testimoni multiplicats per milions o milers de milions de testimonis.

Els equips que utilitzen DeepSeek mitjançant interfícies compatibles amb OpenAI no haurien d'assumir que la compatibilitat els protegeix dels canvis de facturació. La sol·licitud pot semblar familiar, però la factura encara segueix les regles de preus específiques del model de DeepSeek.L'accés en format antròpic crea el mateix problema des de l'altra direcció: una integració més fàcil no elimina la necessitat d'entendre les categories de facturació dels proveïdors.

Els desenvolupadors que mantenen calculadores de preus, taulers de distribuïdors o eines internes de retrocàrrec haurien d'actualitzar les hipòtesis ràpidament. Si la taula de preus d'un producte encara tracta DeepSeek V4 com un únic cost fix per testimoni, pot subestimar o exagerar l'ús real. Això pot distorsionar els marges dels clients, els pressupostos dels equips i les decisions de selecció de models.

Els equips de contractació i finances també haurien de prestar atenció. Els preus de l'API dinàmica dificulten les previsions mensuals. Una càrrega de treball que era assequible en les proves pot comportar-se de manera diferent a la producció si el trànsit d'usuaris es concentra a les finestres màximes. El mateix risc s'aplica a les demostracions, avaluacions i benchmarks d'agents: una comparació de models executada en un moment del dia pot no representar l'economia d'executar el mateix flux de treball contínuament.

Què haurien de fer els equips ara

El pas immediat és separar la migració tècnica de la validació financera. És possible que no calgui cap canvi de codi si les aplicacions ja truquen a DeepSeek V4 Flash o V4 Pro mitjançant formats d'API compatibles. Però els supòsits de facturació, les alertes i els taulers de control necessiten una revisió.

Els equips d'enginyeria haurien d'identificar quines càrregues de treball de DeepSeek són interactives i quines es poden ajornar. El resum per lots, l'enriquiment adjacent a la incrustació, l'anàlisi de dipòsits, la generació de dades sintètiques i les suites d'avaluació són candidats per a la programació fora de punta si els requisits del producte ho permeten. Els marcs d'agent no només haurien de registrar el recompte de testimonis i els ID de model, sinó també el temps de sol·licitud, el comportament de la memòria cau i el volum de sortida.

Els equips també haurien de tornar a comprovar l'estratègia d'emmagatzematge a la memòria cau d'indicadors. Si els blocs de context reutilitzables encara són més barats que l'entrada sense memòria cau, la memòria cau continua sent valuosa. Si els preus de la memòria cau han augmentat substancialment per a un model i una finestra de temps específics, pot ser que valgui la pena escurçar les indicacions del sistema, dividir els fluxos de treball o comparar un altre proveïdor per a tasques repetides de context llarg.

El que segueix sent incert és l'impacte exacte del preu en directe per a cada càrrega de treball. La documentació oficial de DeepSeek confirma els formats del model, la finestra de context i les categories de facturació visibles a la pàgina de preus, mentre que els informes secundaris descriuen l'activació i els augments de preus màxims/fores del 16 d'agost. El delta de cost precís depèn de la taula actual, del temps que s'envien les sol·licituds, del comportament de la memòria cau i de la durada de la sortida.

La lliçó més àmplia és menys incerta. Els preus de LLM s'estan posant en funcionament. L'elecció del model, el temps de sol·licitud, el disseny de la memòria cau i la política pressupostària estan enllaçats. Per als desenvolupadors i les empreses, el control de costos de l'API d'IA ja no és només un exercici de full de càlcul després del desplegament; forma part de com s'han d'encaminar els sistemes d'IA de producció.