Моделът V4-Pro на DeepSeek се премести в практическа територия за планиране на API. Текущата документация за цените на API на компанията изброява DeepSeek-V4-Pro заедно с DeepSeek-V4-Flash, изложени чрез основен URL адрес във формат OpenAI и отделен основен URL адрес във формат Anthropic. Публикации в общността, цитиращи регистъра на промените на DeepSeek, казват, че изданието V4-Pro 0813 е пуснато за потребители на приложения, уеб и API на 13 август.

Списъкът с модели се отличава с повече от наличност. DeepSeek-V4-Pro се рекламира с дължина на контекста от 1M-токен и максимален изход от 384K токена, плюс JSON изход, извиквания на инструменти, бета версия на завършване на префикс за чат и бета версия на завършване на FIM в режим без мислене. За разработчиците, които изграждат агенти, инструменти за кодиране, работни потоци с дълги документи или системи с голямо извличане, тези ограничения поставят V4-Pro в категорията на моделите, които могат да променят архитектурата на бързото, вместо просто да заменят по-малък модел за чат.

Цената обаче е истинската оперативна история. Страницата на DeepSeek изброява V4-Pro на $0,003625 за 1M кеширани входни токени, $0,435 за 1M кеширани входни токени и $0,87 за 1M изходни токени. Това разпространение означава, че цената на заявката зависи силно от това дали повтарящият се контекст действително удря кеша на доставчика. Работно натоварване, което изглежда евтино при оптимистични предположения за кеша, може да стане много по-скъпо, ако подканите са силно променливи, слабо сегментирани или маршрутизирани чрез инструменти, които предотвратяват повторното използване на кеша.

Какво се промени за потребителите на API

Документацията на DeepSeek сега представя V4-Pro като първокласен API модел с две повърхности за съвместимост: крайна точка в стил OpenAI в основната Основен URL адрес на API на DeepSeek и крайна точка в стил Anthropic под отделен път. Това има значение, защото намалява бариерата за интеграция за екипи, които вече използват OpenAI-съвместими клиенти, като същевременно дава на клиентите в стил Claude по-директна опция за форматиране.

За AI API шлюз непосредствената работа е обикновена, но важна: обновете моделния каталог, актуализирайте контекстния прозорец и метаданните за максимален изход, маркирайте поддържаните възможности и решете как да представите двата API формата. Третирането на OpenAI-формат и Anthropic-формат повърхности като едно и също нещо може да е удобно за маркетингови страници, но може да създаде объркване в SDK, регистрационни файлове и правила за контрол. Разработчиците трябва да знаят коя схема на заявка, поведение при извикване на инструменти и предположения за поточно предаване се прилагат.

Много голямото рекламирано ограничение на изхода също заслужава внимание. Максимален изход от 384K-токен не е просто по-голямо число в таблица. Той променя режимите на отказ. Екипите може да се нуждаят от по-строги лимити за отговор, предупреждения за фактуриране и предпазни огради на ниво приложение, за да предотвратят избягалите поколения или случайни изхвърляния на дълга форма от превръщането на една стъпка на агент в събитие с съществени разходи.

Защо ценообразуването на кеширане сега има по-голямо значение

DeepSeek отдавна се свързва от много разработчици с агресивно ценообразуване на API. V4-Pro усложнява това възприятие. Посочената входна цена за попадение в кеша е изключително ниска в сравнение с неговата цена за пропуск в кеша, но тази разлика помага само ако работното натоварване е проектирано за повторно използване на кеша.

На практика ефективността на кеша зависи от стабилността на бързата информация. Дългите системни подкани, блоковете с политики, пакетите от документация и контекстът на хранилището могат да бъдат от полза, когато се използват повторно последователно. Но агентните системи често променят подканите на всяка стъпка: добавяне на регистрационни файлове, резултати от инструменти, времеви отпечатъци, междинни планове и специфично за потребителя състояние. Ако тези промени изместват границите на кеша или причиняват пропуски на големи префикси, ефективната цена може да се приближи до процента на пропуски в кеша.

Ето защо политиките за маршрутизиране не трябва да класират V4-Pro по цена на единичен смесен вход. Симулацията на разходите трябва да разделя токените за попадение в кеша, входа и изхода при пропуск в кеша, след което да тества представителни натоварвания. Кодиращ агент, който използва повторно голямо резюме на хранилище, може да се държи много различно от асистент за поддръжка на клиенти, който инжектира ново състояние на акаунта във всяка заявка.

Тук също така Model Gate и подобни многомоделни слоеве за маршрутизиране имат практическа роля. Шлюзовете, които проследяват използването на токени по модел, екип и API ключ, могат да помогнат на операторите да видят дали един предполагаемо евтин маршрут всъщност е евтин в производството. Съответният показател вече не е само токени за заявка; това е смесица от въвеждане на удари в кеша, некеширани входове и генериран изход в реален трафик.

Кой е засегнат

Разработчиците, използващи директно DeepSeek, трябва да проверят идентификаторите на модела, формата на крайната точка и флаговете за възможности, преди да превключат производствения трафик. Изходът на JSON и извикванията на инструментите са изброени, но поведението на приложението все още се нуждае от тестване, особено ако съществуващият код разчита на обработка на крайния случай на друг доставчик.

Операторите на шлюза и екипите на платформата имат по-широк списък за проверка.Те се нуждаят от актуализирани ценови таблици, контекстни лимити, лимити за максимален изход, метаданни за функции за всеки модел, бюджетни контроли и документация както за OpenAI-съвместим, така и за Anthropic-съвместим достъп. Ако изложат V4-Pro като модел за включване, те все пак трябва да предупредят клиентите, че еквивалентният синтаксис на заявка не гарантира еквивалентно поведение или цена.

Бизнесите, работещи с голям обем автоматизация, трябва да преразгледат допусканията на модела по подразбиране. Модел с контекстен прозорец от 1M-токен може да бъде привлекателен за правен преглед, синтез на изследвания, анализ на кодова база и дългогодишни агенти. Но моделите с дълъг контекст са склонни да насърчават по-големи подкани, а по-големите подкани увеличават всяка грешка в дизайна на кеша и контрола на изхода.

Какво остава несигурно

Страницата с цените предоставя текущите изброени тарифи и възможности, но все още има несигурност около докладваните бъдещи промени в цените. Публикации в общността казват, че DeepSeek е предупредил за значително увеличение на цените на API и че новите пикови и извън пиковите цени може да влязат в сила на 16 август. Тези твърдения са от значение за планирането на бюджета, но бъдещата тарифна таблица не беше потвърдена от пряко достъпно официално известие по време на проучването.

Тази несигурност трябва да накара екипите да бъдат предпазливи, а не да замразят. Разумният отговор е да добавите V4-Pro към пулове за оценка, да тествате реални натоварвания, да измервате поведението на кеша и да избягвате твърдото му кодиране като постоянна най-ниска цена по подразбиране, докато цената не бъде потвърдена. За някои натоварвания V4-Pro може да бъде отлична опция за дълъг контекст. За други, особено агенти с тежък изход или подкани с лошо повторно използване на кеша, икономиката може да е по-неблагоприятна, отколкото предполага процентът на попадение в заглавния кеш.

По-широката поука е, че наличността на модела сега е само първият въпрос за маршрутизиране. По-трудните въпроси са относно съвместимостта на форматите, надеждността на функциите, механиката на кеша, ограниченията на изхода и наблюдението на разходите. DeepSeek V4-Pro дава на разработчиците още една мощна опция за API, но също така изяснява, че „евтино“ се е превърнало в заключение, специфично за натоварването, а не в етикет на доставчик.