DeepSeekov V4-Pro model prešao je na praktično područje planiranja API-ja. Tvrtkina trenutna dokumentacija o cijenama API-ja navodi DeepSeek-V4-Pro uz DeepSeek-V4-Flash, izložene kroz osnovni URL u formatu OpenAI i zasebni osnovni URL u formatu Anthropic. Objave zajednice koje citiraju DeepSeekov dnevnik promjena kažu da je izdanje V4-Pro 0813 uvedeno za korisnike aplikacija, weba i API-ja 13. kolovoza.

Popis modela je poznat po više od dostupnosti. DeepSeek-V4-Pro se oglašava s duljinom konteksta od 1M tokena i maksimalnim izlazom od 384K tokena, plus JSON izlaz, pozivi alata, beta dovršetak prefiksa chata i beta dovršetak FIM-a u načinu rada bez razmišljanja. Za programere koji grade agente, alate za kodiranje, tijekove rada s dugim dokumentima ili sustave s teškim dohvaćanjem, ta ograničenja stavljaju V4-Pro u kategoriju modela koji mogu preoblikovati brzu arhitekturu, a ne samo zamijeniti manji model chata.

Cijena je, međutim, stvarna operativna priča. DeepSeekova stranica navodi V4-Pro po cijeni od 0,003625 USD po 1M ulaznih tokena za pogotke u predmemoriju, 0,435 USD po 1M ulaznih tokena za promašaj u predmemoriji i 0,87 USD po 1M izlaznih tokena. To širenje znači da cijena zahtjeva uvelike ovisi o tome dolazi li ponovljeni kontekst doista u predmemoriju pružatelja. Radno opterećenje koje izgleda jeftino pod optimističnim pretpostavkama predmemorije može postati mnogo skuplje ako su promptovi vrlo varijabilni, slabo segmentirani ili usmjereni kroz alate koji sprječavaju ponovnu upotrebu predmemorije.

Što se promijenilo za korisnike API-ja

DeepSeekova dokumentacija sada predstavlja V4-Pro kao prvoklasni API model s dvije kompatibilne površine: krajnjom točkom u stilu OpenAI-a na glavnoj DeepSeek API osnovni URL i krajnja točka u stilu Anthropic pod zasebnom stazom. To je važno jer smanjuje integracijsku barijeru za timove koji već koriste klijente kompatibilne s OpenAI-om, a istovremeno klijentima u stilu Claude daje mogućnost izravnijeg formata.

Za pristupnik AI API-ja trenutni je posao običan, ali važan: osvježite katalog modela, ažurirajte kontekstni prozor i metapodatke o maksimalnom izlazu, označite podržane mogućnosti i odlučite kako predstaviti dva API formata. Tretiranje površina OpenAI-formata i Anthropic-formata kao iste stvari može biti zgodno za marketinške stranice, ali može stvoriti zabunu u SDK-ovima, zapisima i kontrolama pravila. Programeri moraju znati koja se shema zahtjeva, ponašanje pozivanja alata i pretpostavke o strujanju primjenjuju.

Vrlo veliko ograničenje oglašenog izlaza također zaslužuje pozornost. Maksimalni izlaz od 384K-tokena nije samo veći broj u tablici. Mijenja načine kvara. Timovi će možda trebati stroža ograničenja odgovora, upozorenja o naplati i zaštitne ograde na razini aplikacije kako bi se spriječilo da odbjegle generacije ili slučajni ispisi dugog oblika jedan korak agenta pretvore u događaj materijalnog troška.

Zašto je sada važnija cijena pogotka u predmemoriju

Mnogi programeri već dugo povezuju DeepSeek s agresivnim cijenama API-ja. V4-Pro komplicira tu percepciju. Navedena ulazna cijena pogotka u predmemoriju iznimno je niska u usporedbi s cijenom unosa u predmemoriju, ali ta razlika pomaže samo ako je radno opterećenje dizajnirano za ponovnu upotrebu predmemorije.

U praksi, učinkovitost predmemorije ovisi o brzoj stabilnosti. Dugi sistemski odzivnici, blokovi pravila, paketi dokumentacije i kontekst repozitorija mogu imati koristi kada se ponovno dosljedno koriste. Ali agentski sustavi često mijenjaju upite na svakom koraku: dodavanjem zapisa, izlaza alata, vremenskih oznaka, međuplanova i stanja specifičnog za korisnika. Ako te promjene pomiču granice predmemorije ili prouzrokuju promašaje velikih prefiksa, stvarni trošak može se približiti stopi promašaja predmemorije.

Zbog toga politike usmjeravanja ne bi trebale rangirati V4-Pro prema jednoj mješovitoj ulaznoj cijeni. Simulacija troškova trebala bi razdvojiti cache-hit input, cache-miss input i output tokene, zatim testirati reprezentativna radna opterećenja. Agent za kodiranje koji ponovno koristi veliki sažetak repozitorija može se ponašati vrlo drugačije od pomoćnika korisničke podrške koji ubacuje novo stanje računa u svaki zahtjev.

Ovdje je također mjesto gdje Model Gate i slični slojevi usmjeravanja s više modela imaju praktičnu ulogu. Gatewayi koji prate korištenje tokena prema modelu, timu i API ključu mogu pomoći operaterima da vide je li navodno jeftina ruta zapravo jeftina u proizvodnji. Relevantna metrika više nije samo tokeni po zahtjevu; to je mješavina cache-hit inputa, uncache inputa i generiranog izlaza kroz stvarni promet.

Tko je pogođen

Razvojni programeri koji izravno koriste DeepSeek trebali bi provjeriti identifikatore modela, format krajnje točke i oznake mogućnosti prije prebacivanja proizvodnog prometa. JSON izlaz i pozivi alata navedeni su, ali ponašanje aplikacije i dalje treba testirati, posebno ako se postojeći kod oslanja na rukovanje rubnim slučajevima drugog pružatelja.

Operateri pristupnika i timovi platformi imaju širi popis za provjeru.Potrebne su im ažurirane tablice cijena, ograničenja konteksta, ograničenja maksimalnog izlaza, metapodaci značajki po modelu, proračunske kontrole i dokumentacija za pristup kompatibilan s OpenAI-jem i Anthropic-om. Ako izlože V4-Pro kao drop-in model, svejedno bi trebali upozoriti kupce da ekvivalentna sintaksa zahtjeva ne jamči ekvivalentno ponašanje ili cijenu.

Poduzeća koja provode automatizaciju velike količine trebaju ponovno razmotriti pretpostavke zadanog modela. Model s kontekstnim prozorom od 1M tokena može biti privlačan za pravni pregled, sintezu istraživanja, analizu baze koda i dugotrajne agente. Ali modeli dugog konteksta obično potiču veće upite, a veći upiti povećavaju svaku pogrešku u dizajnu predmemorije i kontroli izlaza.

Ono što ostaje neizvjesno

Stranica s cijenama pruža trenutačno navedene cijene i mogućnosti, ali još uvijek postoji neizvjesnost oko prijavljenih budućih promjena cijena. Objave zajednice kažu da je DeepSeek upozorio na značajno povećanje cijena API-ja i da bi nove cijene u vršnim i izvan vršnih cijena mogle stupiti na snagu 16. kolovoza. Te su tvrdnje relevantne za planiranje proračuna, ali buduća tarifna tablica nije provjerena iz izravno dostupne službene obavijesti tijekom istraživanja.

Ta bi nesigurnost timove trebala natjerati na oprez, a ne na zamrzavanje. Razuman odgovor je dodati V4-Pro u skupove za procjenu, testirati stvarna radna opterećenja, izmjeriti ponašanje predmemorije i izbjeći njegovo tvrdo kodiranje kao trajnu zadanu najnižu cijenu dok se cijena ne potvrdi. Za neka radna opterećenja V4-Pro može biti izvrsna opcija dugog konteksta. Za druge, posebno agente koji imaju veliku količinu izlaza ili upite s lošom ponovnom upotrebom predmemorije, ekonomija može biti manje povoljna nego što to sugerira stopa pogodaka naslovne predmemorije.

Šira lekcija je da je dostupnost modela sada samo prvo pitanje usmjeravanja. Teža su pitanja o kompatibilnosti formata, pouzdanosti značajki, mehanici predmemorije, izlaznim ograničenjima i vidljivosti troškova. DeepSeek V4-Pro daje programerima još jednu moćnu API opciju, ali također jasno pokazuje da je "jeftino" postalo zaključak specifičan za radno opterećenje, a ne oznaka pružatelja.