Cijene DeepSeek V4 API-ja pomaknule su se s jednostavnog pitanja o odabiru modela na pitanje o vremenu.
Tvrtkina službena stranica s cijenama API-ja sada navodi DeepSeek V4 Flash i DeepSeek V4 Pro s velikim kontekstnim prozorima od 1 milijun tokena, osnovnim URL-ovima u formatu OpenAI i formatu Anthropic i zasebnim kategorijama naplate za unos hitova u predmemoriju, ulaz i izlaz u predmemoriju. žetoni. Izvještaji koje je Techmeme prikupio 13. kolovoza govore da DeepSeek podiže cijene V4 modela i uvodi dinamičku naplatu u špici/izvan špice, a nove cijene stupaju na snagu u 16:00 UTC 16. kolovoza 2026.
To čini promjenu više od rutinskog ažuriranja tablice cijena. Za timove koji pokreću agente koji su zahtjevni za dohvaćanje, pomoćnike kodiranja dugog konteksta, poslove skupne analize ili AI proizvode okrenute klijentima, trošak DeepSeek zahtjeva sada može ovisiti ne samo o tome koji je model odabran, već i kada je zahtjev poslan i koliko se upita može poslužiti iz predmemorije.
Što se promijenilo u DeepSeek V4 naplati
DeepSeek-ova trenutna API dokumentacija predstavlja V4 Flash i V4 Pro kao dostupne kroz API formate OpenAI i Anthropic stila. To je važno jer mnogi razvojni programeri već usmjeravaju DeepSeek zajedno s drugim pružateljima kroz slojeve kompatibilnosti umjesto pisanja koda aplikacije specifičnog za pružatelja usluga.
Važna struktura naplate je razdvajanje između unosa hita u predmemoriju, unosa promašaja u predmemoriju i izlaza. U praksi to znači da ponovljeni prefiksi upita, upute sustava, sheme alata ili dugi blokovi konteksta za višekratnu upotrebu mogu imati drugačiji profil troškova od novopodnesenog teksta upita. Ovo je već bio važan dio priče o troškovima DeepSeek V4-Pro. Novi peak/off peak sloj dodaje još jednu varijablu: isto radno opterećenje može imati različitu cijenu ovisno o tome kada se izvodi.
Sekundarno izvješćivanje ukazuje na povećanje cijene materijala za V4 modele i dinamički raspored koji počinje 16. kolovoza. Neki izračuni zajednice govore o vrlo velikim postotcima povećanja za specifične slučajeve s velikom količinom predmemorije, posebno kada se cijena pogotka predmemorije naglo promijenila. S tim brojkama treba postupati oprezno dok se ne usporede s aktivnim fakturama ili DeepSeek-ovom trenutnom tablicom naplate. Smjer putovanja je, međutim, dovoljno jasan: korisnici API-ja više ne mogu procijeniti DeepSeek V4 samo prema mogućnostima glavnog modela i nominalnim stopama po tokenu.
Zašto su cijene u vršnoj i izvan vršne sezone važne
Cijene u vršnoj/nevršnoj sezoni uobičajene su na infrastrukturnim tržištima, ali je još uvijek relativno nov obrazac za mainstream LLM API-je. Stvara poticaje koji su poznati timovima u oblaku i podacima: premjestite fleksibilan rad iz skupih prozora, rezervirajte vrhunsko vrijeme za zahtjeve upućene korisnicima i neka skupni poslovi čekaju kada latencija nije kritična.
Za AI aplikacije to ima nekoliko praktičnih učinaka. Bot za podršku u stvarnom vremenu obično ne može odgoditi odgovor korisnika do jeftinijeg prozora. Noćni posao analize baze koda, proces obogaćivanja dokumenata ili procjena često mogu. Agentski sustavi nalaze se negdje u sredini: neki pozivi alata su interaktivni, dok se drugi mogu staviti u red čekanja, ponovno pokušati ili rasporediti.
Ovo mijenja problem usmjeravanja. Pristupnik koji bira između modela na temelju kvalitete, latencije i cijene tokena sada mora uzeti u obzir vrijeme. Ako je DeepSeek V4 Pro isplativ izvan špice, ali skup tijekom vršnih sati, aplikacija može preferirati drugi model tijekom dana i kasnije se vratiti na DeepSeek. Ako V4 Flash ostane privlačan za brze zadatke, ali se ekonomija predmemorije pogoršava za duge dijeljene prefikse, možda će trebati revizija same brze arhitekture.
Za timove koji koriste AI API pristupnik, najkorisnija značajka možda neće biti još jedan prekidač modela. To može biti pravilo: odmah pošaljite interaktivne zahtjeve, stavite u red čekanja poslove koji nisu hitni, upozorite kada zahtjev ulazi u vremenski okvir s višim troškovima ili primijenite proračune na razini tima prije nego započne serijski rad. To je izravno relevantno za infrastrukturu u stilu Model Gate-a jer objedinjena naplata, analitika upotrebe i kontrole usmjeravanja postaju vrjedniji kada su cijene pružatelja dinamične, a ne statične.
Tko je najviše izložen
Najveći utjecaj vjerojatno će imati programeri s velikom količinom usluga i tvrtke s predvidljivim opterećenjima. Potrošački proizvodi za chat, platforme agenata za kodiranje, alati za istraživanje, usluge čišćenja podataka i interni timovi za automatizaciju mogu poslati veliki broj sličnih zahtjeva. Ti sustavi često imaju koristi od brzog predmemoriranja, ali su također osjetljivi na male promjene po tokenu umnožene na milijune ili milijarde tokena.
Timovi koji koriste DeepSeek kroz sučelja kompatibilna s OpenAI-om ne bi trebali pretpostaviti da ih kompatibilnost štiti od promjena naplate. Zahtjev može izgledati poznato, ali faktura i dalje slijedi DeepSeekova pravila cijena za pojedini model.Pristup u antropskom formatu stvara isti problem iz drugog smjera: lakša integracija ne uklanja potrebu za razumijevanjem kategorija naplate pružatelja usluga.
Razvojni programeri koji održavaju kalkulatore cijena, nadzorne ploče prodavača ili interne alate za storniranje trebaju brzo ažurirati pretpostavke. Ako tablica s cijenama u proizvodu još uvijek tretira DeepSeek V4 kao jedinstveni fiksni trošak po tokenu, može biti podcijenjena ili precijenjena stvarna upotreba. To može iskriviti marže kupaca, timske proračune i odluke o odabiru modela.
Timovi za nabavu i financije također bi trebali obratiti pozornost. Dinamičko određivanje cijena API-ja otežava mjesečno predviđanje. Radno opterećenje koje je bilo pristupačno u testiranju može se ponašati drugačije u proizvodnji ako se korisnički promet koncentrira u vršnim prozorima. Isti se rizik odnosi na demonstracije, procjene i referentne vrijednosti agenata: usporedba modela koja se izvodi u isto doba dana možda neće predstavljati ekonomiju kontinuiranog vođenja istog tijeka rada.
Što bi timovi sada trebali učiniti
Neposredni korak je odvojiti tehničku migraciju od financijske validacije. Možda neće biti potrebna promjena koda ako aplikacije već pozivaju DeepSeek V4 Flash ili V4 Pro putem podržanih API formata. Ali pretpostavke naplate, upozorenja i nadzorne ploče trebaju reviziju.
Inženjerski timovi trebali bi identificirati koja su DeepSeek radna opterećenja interaktivna, a koja se mogu odgoditi. Skupno sažimanje, obogaćivanje uz ugradnju, analiza repozitorija, generiranje sintetičkih podataka i eval paketi kandidati su za planiranje izvan vršnog opterećenja ako zahtjevi proizvoda to dopuštaju. Agentski okviri trebaju bilježiti ne samo brojeve tokena i ID-ove modela, već i vrijeme zahtjeva, ponašanje pogodaka predmemorije i izlaznu količinu.
Timovi bi također trebali ponovno provjeriti strategiju brzog predmemoriranja. Ako su blokovi konteksta koji se mogu višekratno koristiti još uvijek jeftiniji od ulaza bez predmemoriranja, predmemoriranje ostaje vrijedno. Ako je cijena učitavanja predmemorije značajno porasla za određeni model i vremenski okvir, možda bi bilo vrijedno skratiti sistemske upite, podijeliti tijekove rada ili usporediti drugog pružatelja za ponovljene zadatke dugog konteksta.
Ono što ostaje neizvjesno je točan utjecaj na živu cijenu za svako radno opterećenje. Službena dokumentacija DeepSeeka potvrđuje formate modela, kontekstni prozor i kategorije naplate vidljive na stranici s cijenama, dok sekundarna izvješća opisuju aktivaciju 16. kolovoza na vrhuncu/izvan špice i povećanja cijena. Precizna delta troškova ovisi o trenutnoj tablici uživo, vremenu slanja zahtjeva, ponašanju predmemorije i duljini izlaza.
Šira lekcija manje je neizvjesna. LLM cijene postaju operativne. Izbor modela, vrijeme zahtjeva, dizajn predmemorije i proračunska politika sada su povezani. Za programere i tvrtke, AI API kontrola troškova više nije samo vježba proračunske tablice nakon implementacije; to je dio načina na koji se proizvodni AI sustavi trebaju usmjeravati.