Cene API-ja DeepSeek V4 so se premaknile s preprostega vprašanja izbire modela na vprašanje o času.

Na uradni strani API-ja podjetja sta zdaj navedena DeepSeek V4 Flash in DeepSeek V4 Pro z velikimi kontekstnimi okni z 1 milijonom žetonov, osnovnimi URL-ji v formatu OpenAI in formatu Anthropic ter ločenimi kategorijami zaračunavanja za vhodne zadetke v predpomnilniku, vhode in izhode v predpomnilniku. žetoni. Poročila, ki jih je 13. avgusta zbral Techmeme, so povedala, da je DeepSeek zvišal cene modelov V4 in uvedel dinamično zaračunavanje med konicami in izven konic, nove cene pa bodo začele veljati ob 16:00 UTC 16. avgusta 2026.

Zaradi tega je sprememba več kot le rutinska posodobitev cenovne tabele. Za ekipe, ki izvajajo agente, ki so zahtevni za iskanje, pomočnike za kodiranje z dolgim kontekstom, opravila paketne analize ali izdelke umetne inteligence, usmerjene k strankam, bodo stroški zahteve DeepSeek zdaj morda odvisni ne samo od tega, kateri model je izbran, ampak tudi od tega, kdaj je zahteva poslana in koliko poziva je mogoče poslati iz predpomnilnika.

Kaj se je spremenilo pri obračunavanju DeepSeek V4

Trenutna dokumentacija API-ja DeepSeek predstavlja V4 Flash in V4 Pro kot na voljo prek formatov API v slogu OpenAI in Anthropic. To je pomembno, ker mnogi razvijalci že usmerjajo DeepSeek skupaj z drugimi ponudniki prek združljivostnih plasti, namesto da bi pisali aplikacijsko kodo, specifično za ponudnika.

Pomembna struktura zaračunavanja je ločevanje med vnosom zadetka predpomnilnika, vhodom napake predpomnilnika in izhodom. V praksi to pomeni, da imajo lahko ponavljajoče se predpone poziva, sistemska navodila, sheme orodij ali dolgi kontekstni bloki, ki jih je mogoče ponovno uporabiti, drugačen stroškovni profil od na novo predloženega besedila poziva. To je že bil pomemben del zgodbe o stroških DeepSeek V4-Pro. Nova plast med obremenitvijo in izven obremenitve doda še eno spremenljivko: enaka delovna obremenitev se lahko razlikuje glede na to, kdaj se izvaja.

Sekundarno poročanje kaže na zvišanje cene materiala za modele V4 in dinamični urnik, ki se začne 16. avgusta. Nekateri izračuni skupnosti navajajo zelo velika odstotna povečanja za posebne primere z veliko predpomnilnika, zlasti kjer se je cena zadetkov v predpomnilniku močno spremenila. S temi številkami je treba ravnati previdno, dokler jih ne preverite glede na račune v živo ali trenutno obračunsko tabelo DeepSeek. Smer potovanja pa je dovolj jasna: uporabniki API-jev ne morejo več oceniti DeepSeek V4 samo glede na zmožnost glavnega modela in nominalne cene na žeton.

Zakaj so cene v konicah in izven obremenitev pomembne

Cene v konicah/izven obremenitev so običajne na infrastrukturnih trgih, vendar je še vedno razmeroma nov vzorec za glavne API-je LLM. Ustvarja spodbude, ki jih poznajo ekipe v oblaku in podatkih: premaknite prilagodljivo delo iz dragih oken, rezervirajte vrhunski čas za zahteve uporabnikov in naredite, da paketna opravila čakajo, ko zakasnitev ni kritična.

Za aplikacije AI ima to več praktičnih učinkov. Bot za podporo v realnem času običajno ne more odložiti odziva stranke do cenejšega okna. Pogosto lahko opravi nočna analiza kodne baze, cevovod za obogatitev dokumentov ali ocenjevanje. Agentski sistemi se nahajajo nekje na sredini: nekateri klici orodij so interaktivni, druge pa je mogoče postaviti v čakalno vrsto, jih znova poskusiti ali razporediti.

To spremeni težavo z usmerjanjem. Prehod, ki izbira med modeli na podlagi kakovosti, zakasnitve in cene žetona, mora zdaj upoštevati čas. Če je DeepSeek V4 Pro stroškovno učinkovit izven največje obremenitve, a drag v času največje obremenitve, lahko aplikacija čez dan izbere drug model in se pozneje vrne na DeepSeek. Če V4 Flash ostane privlačen za hitra opravila, vendar se ekonomičnost predpomnilnika poslabša za dolge predpone v skupni rabi, bo morda treba pregledati samo arhitekturo hitrega odziva.

Za ekipe, ki uporabljajo prehod AI API, najbolj uporabna funkcija morda ni drug preklopni model. Morda je pravilnik: takoj pošljite interaktivne zahteve, postavite v čakalno vrsto nenujna opravila, opozorite, ko zahteva vstopa v okno z višjimi stroški, ali uporabite proračune na ravni ekipe, preden se začne paketno izvajanje. To je neposredno pomembno za infrastrukturo v slogu Model Gate, ker poenoteno zaračunavanje, analitika uporabe in nadzor usmerjanja postanejo bolj dragoceni, ko so cene ponudnikov dinamične in ne statične.

Kdo je najbolj izpostavljen

Največji vpliv bodo verjetno imeli razvijalci velikega obsega in podjetja s predvidljivimi delovnimi obremenitvami. Izdelki za potrošniške klepete, platforme kodirnih agentov, raziskovalna orodja, storitve čiščenja podatkov in interne ekipe za avtomatizacijo lahko pošljejo veliko število podobnih zahtev. Ti sistemi imajo pogosto koristi od takojšnjega predpomnjenja, vendar so tudi občutljivi na majhne spremembe na žeton, pomnožene z milijoni ali milijardami žetonov.

Ekipe, ki uporabljajo DeepSeek prek vmesnikov, združljivih z OpenAI, ne bi smele domnevati, da jih združljivost ščiti pred spremembami zaračunavanja. Zahteva se morda zdi znana, vendar račun še vedno sledi DeepSeek-ovim pravilom o cenah za posamezne modele.Dostop v antropičnem formatu povzroča isto težavo iz druge smeri: lažja integracija ne odpravi potrebe po razumevanju kategorij zaračunavanja ponudnika.

Razvijalci, ki vzdržujejo kalkulatorje cen, nadzorne plošče preprodajalcev ali interna orodja za povratne bremenitve, bi morali hitro posodobiti predpostavke. Če tabela cen v izdelku še vedno obravnava DeepSeek V4 kot enoten pavšalni strošek na žeton, je lahko podcenjena ali precenjena dejanska uporaba. To lahko izkrivlja marže strank, proračun skupine in odločitve o izbiri modela.

Pozorni bi morali biti tudi oddelki za nabavo in finance. Zaradi dinamičnega določanja cen API-ja je mesečno napovedovanje težje. Delovna obremenitev, ki je bila pri testiranju cenovno dostopna, se lahko v proizvodnji obnaša drugače, če se promet uporabnikov koncentrira v obdobjih največje porabe. Enako tveganje velja za predstavitve, ocene in primerjalne vrednosti agentov: primerjava modelov, ki se izvaja ob istem času dneva, morda ne predstavlja ekonomičnosti neprekinjenega izvajanja istega delovnega toka.

Kaj morajo ekipe storiti zdaj

Takojšnji korak je ločiti tehnično migracijo od finančne validacije. Sprememba kode morda ne bo potrebna, če aplikacije že kličejo DeepSeek V4 Flash ali V4 Pro prek podprtih formatov API. Toda predpostavke zaračunavanja, opozorila in nadzorne plošče potrebujejo pregled.

Inženirske ekipe bi morale ugotoviti, katere delovne obremenitve DeepSeek so interaktivne in katere je mogoče odložiti. Paketno povzemanje, obogatitev ob vdelavi, analiza repozitorija, generiranje sintetičnih podatkov in paketi eval so kandidati za načrtovanje izven obremenitve, če to dopuščajo zahteve izdelka. Agentska ogrodja ne bi smela beležiti le števila žetonov in ID-jev modelov, temveč tudi čas zahteve, vedenje zadetkov v predpomnilniku in obseg izhoda.

Ekipe bi morale prav tako znova preveriti strategijo hitrega predpomnjenja. Če so kontekstni bloki za večkratno uporabo še vedno cenejši od nepredpomnjenega vnosa, predpomnjenje ostaja dragoceno. Če se je cena zadetkov v predpomnilniku bistveno povečala za določen model in časovno okno, bi bilo morda vredno skrajšati sistemske pozive, razdeliti poteke dela ali primerjati drugega ponudnika za ponavljajoče se naloge z dolgim ​​kontekstom.

Kar ostaja negotovo, je natančen vpliv cene v živo za vsako delovno obremenitev. Uradna dokumentacija DeepSeeka potrjuje oblike modelov, kontekstno okno in kategorije zaračunavanja, ki so vidne na strani s cenami, medtem ko sekundarna poročila opisujejo 16. avgust aktivacijo med največjo/izven konice in zvišanja cen. Natančna delta stroškov je odvisna od trenutne tabele v živo, časa poslanih zahtev, obnašanja predpomnilnika in dolžine izhoda.

Širša lekcija je manj negotova. Cene LLM postajajo operativne. Izbira modela, časovni razpored zahtev, zasnova predpomnilnika in proračunska politika so zdaj povezani. Za razvijalce in podjetja nadzor stroškov AI API po uvedbi ni več le preglednica; je del tega, kako je treba usmerjati produkcijske sisteme AI.