Prețul API-ului DeepSeek V4 a trecut de la o întrebare simplă de selecție a modelului la o întrebare de sincronizare.
Pagina oficială de prețuri API a companiei listează acum DeepSeek V4 Flash și DeepSeek V4 Pro cu ferestre mari de context de 1 milion de simboluri, categorii de bază în format OpenAI și antropic și adrese URL de intrare de bază pentru cache-cheche-hit, precum și adrese URL de intrare separate pentru facturare cache-misst. jetoane. Rapoartele agregate de Techmeme pe 13 august spuneau că DeepSeek crește prețurile modelului V4 și introduce facturarea dinamică de vârf/în afara vârfului, noul preț intrând în vigoare la ora 16:00 UTC pe 16 august 2026.
Aceasta face ca schimbarea să fie mai mult decât o actualizare de rutină a tabelului de prețuri. Pentru echipele care rulează agenți grei de recuperare, asistenți de codare în context lung, lucrări de analiză a loturilor sau produse AI orientate către clienți, costul unei solicitări DeepSeek poate depinde acum nu numai de modelul ales, ci și de momentul în care cererea este trimisă și cât de mult din prompt poate fi servit din cache.
Ce s-a schimbat în DeepSeek V4 documentația actuală DeepSeek V4. Flash și V4 Pro sunt disponibile atât prin formatele API în stil OpenAI, cât și în stil antropic.
Acest lucru contează deoarece mulți dezvoltatori direcționează deja DeepSeek alături de alți furnizori prin straturi de compatibilitate, mai degrabă decât să scrie cod de aplicație specific furnizorului.
Structura notabilă de facturare este separarea dintre intrarea cache-hit, intrarea și ieșirea cache-miss. În practică, aceasta înseamnă că prefixele repetate de prompt, instrucțiunile de sistem, schemele de instrumente sau blocurile de context lungi reutilizabile pot avea un profil de cost diferit față de textul prompt nou trimis. Aceasta a fost deja o parte importantă din povestea costurilor DeepSeek V4-Pro. Noul strat de vârf/în afara vârfului adaugă o altă variabilă: aceeași sarcină de lucru poate avea un preț diferit în funcție de momentul în care rulează.
Raportarea secundară indică o creștere a prețului material pentru modelele V4 și un program dinamic începând cu 16 august. Unele calcule ale comunității susțin creșteri procentuale foarte mari pentru cazuri specifice cu o cantitate mare de memorie cache, în special în cazul în care prețurile pentru accesarea cache-ului s-au schimbat brusc. Aceste cifre ar trebui tratate cu prudență până când sunt verificate cu facturile live sau cu tabelul de facturare actual al DeepSeek. Direcția de deplasare, totuși, este suficient de clară: consumatorii de API nu mai pot evalua DeepSeek V4 doar după capacitatea modelului principal și ratele nominale pe token.
De ce contează prețurile de vârf și în afara vârfului
Prețurile de vârf/în afara vârfului sunt obișnuite pe piețele de infrastructură, dar este încă un model relativ nou pentru API-ul LLM mainstream. Acesta creează stimulente familiare pentru echipele de cloud și de date: mutați munca flexibilă din ferestre scumpe, rezervați timp premium pentru solicitările adresate utilizatorilor și faceți sarcinile în lot să aștepte atunci când latența nu este critică.
Pentru aplicațiile AI, acest lucru are mai multe efecte practice. De obicei, un bot de asistență în timp real nu poate întârzia răspunsul clientului până la o fereastră mai ieftină. O lucrare de analiză a bazei de cod pe noapte, o conductă de îmbogățire a documentelor sau o rulare de evaluare adesea poate. Sistemele de agenți se află undeva la mijloc: unele apeluri de instrumente sunt interactive, în timp ce altele pot fi puse în coadă, reîncercate sau programate.
Acest lucru schimbă problema de rutare. O poartă de acces care alege între modele bazate pe calitate, latență și prețul simbolului trebuie acum să ia în considerare timpul. Dacă DeepSeek V4 Pro este rentabil în afara orelor de vârf, dar este scump în timpul orelor de vârf, o aplicație poate prefera un alt model în timpul zilei și poate reveni la DeepSeek mai târziu. Dacă V4 Flash rămâne atractiv pentru sarcini rapide, dar economia cache-ului se înrăutățește pentru prefixele partajate de lungă durată, arhitectura promptă în sine ar putea avea nevoie de revizuire.
Pentru echipele care folosesc un gateway AI API, cea mai utilă caracteristică poate să nu fie un alt model de comutare. Poate fi o politică: trimiteți imediat solicitări interactive, puneți în coadă joburi care nu sunt urgente, avertizați când o solicitare intră într-o fereastră cu costuri mai mari sau aplicați bugete la nivel de echipă înainte de a începe o execuție a lotului. Acest lucru este direct relevant pentru infrastructura în stil Model Gate, deoarece facturarea unificată, analiza utilizării și controalele de rutare devin mai valoroase atunci când prețurile furnizorilor sunt mai degrabă dinamice decât statice.
Cine este cel mai expus
Cel mai mare impact este probabil să cadă asupra dezvoltatorilor cu volum mare și a companiilor cu sarcini de lucru previzibile. Produsele de chat pentru consumatori, platformele agent de codificare, instrumentele de cercetare, serviciile de curățare a datelor și echipele interne de automatizare pot trimite un număr mare de solicitări similare. Acele sisteme beneficiază adesea de memorarea în cache promptă, dar sunt, de asemenea, sensibile la modificările mici pe token multiplicate în milioane sau miliarde de token-uri.
Echipele care folosesc DeepSeek prin interfețe compatibile cu OpenAI nu ar trebui să presupună că compatibilitatea îi protejează de modificările de facturare. Solicitarea poate părea familiară, dar factura respectă în continuare regulile de prețuri specifice modelului DeepSeek.Accesul în format antropic creează aceeași problemă din cealaltă direcție: integrarea mai ușoară nu înlătură nevoia de a înțelege categoriile de facturare a furnizorilor.
Dezvoltatorii care întrețin calculatoare de prețuri, tablouri de bord ale resellerilor sau instrumente interne de rambursare ar trebui să actualizeze rapid ipotezele. Dacă tabelul de prețuri dintr-un produs tratează în continuare DeepSeek V4 ca un singur cost fix pe token, acesta poate subestima sau supraevaluează utilizarea reală. Acest lucru poate distorsiona marjele clienților, bugetele echipelor și deciziile de selectare a modelelor.
Echipele de achiziții și finanțe ar trebui să acorde, de asemenea, atenție. Prețurile API dinamice îngreunează prognoza lunară. O sarcină de lucru care a fost accesibilă la testare se poate comporta diferit în producție dacă traficul utilizatorilor se concentrează în ferestrele de vârf. Același risc se aplică demo-urilor, evaluărilor și benchmark-urilor agenților: o comparație de model executată la un moment al zilei poate să nu reprezinte economia de a rula același flux de lucru în mod continuu.
Ce ar trebui să facă echipele acum
Pasul imediat este separarea migrației tehnice de validarea financiară. Este posibil să nu fie necesară modificarea codului dacă aplicațiile apelează deja DeepSeek V4 Flash sau V4 Pro prin formatele API acceptate. Dar ipotezele de facturare, alertele și tablourile de bord au nevoie de o revizuire.
Echipele de ingineri ar trebui să identifice sarcinile de lucru DeepSeek interactive și care pot fi amânate. Rezumarea loturilor, îmbogățirea adiacentă încorporarii, analiza depozitului, generarea de date sintetice și suitele de evaluare sunt candidate pentru programarea în afara orelor de vârf, dacă cerințele produsului permit acest lucru. Cadrele de agenți ar trebui să înregistreze nu numai numărul de simboluri și ID-urile modelului, ci și timpul de solicitare, comportamentul accesării cache-ului și volumul de ieșire.
De asemenea, echipele ar trebui să verifice din nou strategia de stocare în cache promptă. Dacă blocurile de context reutilizabile sunt încă mai ieftine decât intrarea necache, stocarea în cache rămâne valoroasă. Dacă prețurile pentru accesarea în cache au crescut semnificativ pentru un anumit model și o fereastră de timp, ar putea merita să scurtați solicitările de sistem, să divizați fluxurile de lucru sau să comparați alt furnizor pentru sarcini repetate în context lung.
Ceea ce rămâne incert este impactul exact al prețului în timp real pentru fiecare volum de lucru. Documentația oficială DeepSeek confirmă formatele modelului, fereastra de context și categoriile de facturare vizibile în pagina de prețuri, în timp ce rapoartele secundare descriu activarea de vârf/în afara vârfului din 16 august și creșterile de preț. Delta exactă a costurilor depinde de tabelul live actual, de timpul în care sunt trimise solicitările, de comportamentul cache-ului și de lungimea ieșirii.
Lecția mai largă este mai puțin incertă. Tarifarea LLM devine operațională. Alegerea modelului, momentul solicitării, designul cache-ului și politica bugetară sunt acum legate. Pentru dezvoltatori și companii, controlul costurilor AI API nu mai este doar un exercițiu de calcul după implementare; face parte din modul în care sistemele AI de producție trebuie direcționate.