Ceny API DeepSeek V4 zostały przeniesione z prostego pytania dotyczącego wyboru modelu na pytanie dotyczące czasu.

Na oficjalnej stronie firmy z cenami interfejsów API znajdują się teraz DeepSeek V4 Flash i DeepSeek V4 Pro z dużymi oknami kontekstowymi na 1 milion tokenów, podstawowymi adresami URL w formacie OpenAI i Anthropic oraz oddzielnymi kategoriami rozliczeniowymi dla danych wejściowych trafionych do pamięci podręcznej, tokenów wejściowych i wyjściowych związanych z brakiem pamięci podręcznej. Z raportów zebranych przez Techmeme 13 sierpnia wynika, że ​​DeepSeek podnosi ceny modeli V4 i wprowadza dynamiczne rozliczenia w godzinach szczytu/poza szczytem, ​​przy czym nowe ceny zaczną obowiązywać o godzinie 16:00 UTC 16 sierpnia 2026 r.

To sprawia, że ​​zmiana jest czymś więcej niż rutynową aktualizacją tabeli cen. W przypadku zespołów obsługujących agenty wymagające dużej liczby operacji pobierania, asystentów kodowania o długim kontekście, zadania analizy wsadowej lub produkty AI skierowane do klienta koszt żądania DeepSeek może teraz zależeć nie tylko od wybranego modelu, ale także od tego, kiedy żądanie zostanie wysłane i jaka część podpowiedzi może zostać obsłużona z pamięci podręcznej.

Co zmieniło się w rozliczeniach DeepSeek V4

Aktualna dokumentacja API DeepSeek przedstawia wersje V4 Flash i V4 Pro jako dostępne w obu wersjach w stylu OpenAI i formaty API w stylu antropicznym. Ma to znaczenie, ponieważ wielu programistów kieruje już DeepSeek wraz z innymi dostawcami przez warstwy kompatybilności, zamiast pisać kod aplikacji specyficzny dla dostawcy.

Warto zwrócić uwagę na strukturę rozliczeń polegającą na oddzieleniu danych wejściowych dotyczących trafień w pamięci podręcznej, danych wejściowych i wyjściowych związanych z brakiem pamięci podręcznej. W praktyce oznacza to, że powtarzające się przedrostki podpowiedzi, instrukcje systemowe, schematy narzędzi lub długie bloki kontekstowe wielokrotnego użytku mogą mieć inny profil kosztów niż nowo przesłany tekst podpowiedzi. To już była ważna część historii kosztów DeepSeek V4-Pro. Nowa warstwa szczytowa/poza szczytem dodaje kolejną zmienną: cena tego samego obciążenia może się różnić w zależności od daty jego uruchomienia.

Dodatkowe raporty wskazują na wzrost cen materiałów w przypadku modeli V4 i dynamiczny harmonogram rozpoczynający się 16 sierpnia. Niektóre obliczenia społeczności wskazują na bardzo duży procentowy wzrost w konkretnych przypadkach wymagających dużej ilości pamięci podręcznej, zwłaszcza gdy ceny trafień w pamięci podręcznej gwałtownie się zmieniły. Liczby te należy traktować ostrożnie, dopóki nie zostaną porównane z bieżącymi fakturami lub aktualną tabelą rozliczeniową DeepSeek. Kierunek rozwoju jest jednak wystarczająco jasny: konsumenci API nie mogą już oceniać DeepSeek V4 jedynie na podstawie możliwości modelu głównego i nominalnych stawek za token.

Dlaczego ceny w godzinach szczytu i poza szczytem mają znaczenie

Ceny w godzinach szczytu/poza szczytem są powszechne na rynkach infrastruktury, ale wciąż jest to stosunkowo nowy wzorzec w przypadku głównych interfejsów API LLM. Tworzy zachęty znane zespołom zajmującym się chmurą i danymi: przenieś elastyczną pracę z drogich okien, zarezerwuj czas premium na żądania kierowane do użytkownika i pozwól, aby zadania wsadowe czekały, gdy opóźnienie nie jest krytyczne.

W przypadku aplikacji AI ma to kilka praktycznych skutków. Bot wsparcia w czasie rzeczywistym zwykle nie może opóźniać reakcji klienta do tańszego okna. Często może to pomóc w wieczornej analizie bazy kodu, procesie wzbogacania dokumentów lub przeprowadzaniu oceny. Systemy agentów znajdują się gdzieś pośrodku: niektóre wywołania narzędzi są interaktywne, podczas gdy inne można umieszczać w kolejce, ponawiać lub planować.

Zmienia to problem routingu. Brama wybierająca pomiędzy modelami w oparciu o jakość, opóźnienie i cenę tokena musi teraz uwzględniać czas. Jeśli DeepSeek V4 Pro jest opłacalny poza szczytem, ​​ale drogi w godzinach szczytu, aplikacja może preferować inny model w ciągu dnia i wrócić do DeepSeek później. Jeśli V4 Flash pozostanie atrakcyjny w przypadku szybkich zadań, ale ekonomia pamięci podręcznej pogorszy się w przypadku długich współdzielonych prefiksów, sama architektura podpowiedzi może wymagać przeglądu.

W przypadku zespołów korzystających z bramy AI API najbardziej przydatną funkcją może nie być przełączanie innego modelu. Może to być zasada: natychmiastowe wysyłanie interaktywnych żądań, kolejkowanie niepilnych zadań, ostrzeganie, gdy żądanie wchodzi w okres wyższych kosztów lub stosowanie budżetów na poziomie zespołu przed rozpoczęciem wykonywania wsadu. Ma to bezpośrednie zastosowanie w infrastrukturze typu Model Gate, ponieważ ujednolicone rozliczenia, analityka użytkowania i kontrola routingu stają się bardziej wartościowe, gdy ceny dostawców są dynamiczne, a nie statyczne.

Kto jest najbardziej narażony

Największy wpływ prawdopodobnie będzie dotyczył dużych programistów i firm o przewidywalnym obciążeniu. Produkty do czatów konsumenckich, platformy agentów kodujących, narzędzia badawcze, usługi czyszczenia danych i wewnętrzne zespoły automatyzujące mogą wysyłać dużą liczbę podobnych żądań. Systemy te często korzystają z szybkiego buforowania, ale są również wrażliwe na małe zmiany w tokenie pomnożone w milionach lub miliardach tokenów.

Zespoły korzystające z DeepSeek za pośrednictwem interfejsów kompatybilnych z OpenAI nie powinny zakładać, że zgodność chroni je przed zmianami w rozliczeniach. Żądanie może wyglądać znajomo, ale faktura nadal jest zgodna z zasadami cenowymi DeepSeek dotyczącymi konkretnego modelu.Dostęp w formacie antropicznym stwarza ten sam problem z drugiej strony: łatwiejsza integracja nie eliminuje potrzeby zrozumienia kategorii rozliczeniowych dostawcy.

Programiści obsługujący kalkulatory cen, pulpity nawigacyjne sprzedawców lub wewnętrzne narzędzia do rozliczania zwrotów powinni szybko aktualizować założenia. Jeśli tabela cen produktu nadal traktuje DeepSeek V4 jako pojedynczy, stały koszt za token, może to zaniżać lub zawyżać rzeczywiste wykorzystanie. Może to zniekształcić marże klientów, budżety zespołów i decyzje dotyczące wyboru modelu.

Zespoły ds. zakupów i finansów również powinny zwrócić uwagę. Dynamiczne ceny API utrudniają prognozowanie miesięczne. Obciążenie, które było przystępne w testach, może zachowywać się inaczej w środowisku produkcyjnym, jeśli ruch użytkowników koncentruje się w okresach szczytu. To samo ryzyko dotyczy wersji demonstracyjnych, ocen i testów porównawczych agentów: porównanie modeli przeprowadzane o tej samej porze dnia może nie odzwierciedlać opłacalności ciągłego wykonywania tego samego przepływu pracy.

Co zespoły powinny teraz zrobić

Natychmiastowym krokiem jest oddzielenie migracji technicznej od walidacji finansowej. Zmiana kodu może nie być wymagana, jeśli aplikacje wywołują już DeepSeek V4 Flash lub V4 Pro za pośrednictwem obsługiwanych formatów API. Jednak założenia dotyczące rozliczeń, alerty i pulpity nawigacyjne wymagają przeglądu.

Zespoły inżynieryjne powinny określić, które zadania DeepSeek są interaktywne, a które można odroczyć. Podsumowanie wsadowe, wzbogacanie poprzez osadzanie, analiza repozytoriów, generowanie danych syntetycznych i zestawy ewaluacyjne są kandydatami do planowania poza szczytem, ​​jeśli pozwalają na to wymagania produktu. Struktury agentów powinny rejestrować nie tylko liczbę tokenów i identyfikatory modeli, ale także czas żądania, zachowanie trafień w pamięci podręcznej i liczbę danych wyjściowych.

Zespoły powinny również ponownie sprawdzić strategię szybkiego buforowania. Jeśli bloki kontekstu wielokrotnego użytku są nadal tańsze niż dane wejściowe niezapisane w pamięci podręcznej, buforowanie pozostaje cenne. Jeśli ceny trafień w pamięci podręcznej znacząco wzrosły w przypadku określonego modelu i okna czasowego, warto skrócić monity systemowe, podzielić przepływy pracy lub porównać innego dostawcę w przypadku powtarzalnych zadań o długim kontekście.

Niepewne pozostaje dokładny wpływ ceny w czasie rzeczywistym dla każdego obciążenia. Oficjalna dokumentacja DeepSeek potwierdza formaty modeli, okno kontekstowe i kategorie rozliczeniowe widoczne na stronie z cenami, natomiast raporty dodatkowe opisują aktywację w godzinach szczytu/poza szczytem 16 sierpnia oraz wzrost cen. Dokładna delta kosztów zależy od aktualnej tabeli na żywo, czasu wysyłania żądań, zachowania pamięci podręcznej i długości danych wyjściowych.

Szersza lekcja jest mniej niepewna. Ceny LLM zaczynają obowiązywać. Wybór modelu, termin składania wniosków, projekt pamięci podręcznej i polityka budżetowa są teraz powiązane. Dla programistów i firm kontrola kosztów interfejsu API AI nie jest już tylko ćwiczeniem w arkuszu kalkulacyjnym po wdrożeniu; jest to część sposobu, w jaki należy kierować produkcyjne systemy AI.