Модель DeepSeek V4-Pro перешла на территорию практического планирования API. В текущей документации по ценам на API компании DeepSeek-V4-Pro указан рядом с DeepSeek-V4-Flash, что предоставляется через базовый URL-адрес в формате OpenAI и отдельный базовый URL-адрес в формате Anthropic. В сообщениях сообщества со ссылкой на журнал изменений DeepSeek говорится, что версия V4-Pro 0813 была выпущена для пользователей приложений, Интернета и API 13 августа.
Список моделей примечателен не только доступностью. DeepSeek-V4-Pro рекламируется с длиной контекста токена 1 МБ и максимальным выходом токенов 384 КБ, а также выводом JSON, вызовами инструментов, бета-версией завершения префикса чата и бета-версией завершения FIM в необдуманном режиме. Для разработчиков, создающих агенты, инструменты кодирования, рабочие процессы с длинными документами или системы с большим объемом поиска, эти ограничения ставят V4-Pro в категорию моделей, которые могут изменить архитектуру подсказок, а не просто заменить меньшую модель чата.
Однако цена — это реальная операционная история. На странице DeepSeek V4-Pro указан по цене 0,003625 доллара США за 1 миллион входных токенов попадания в кеш, 0,435 доллара США за 1 миллион входных токенов с промахом в кеше и 0,87 доллара США за 1 миллион выходных токенов. Этот разброс означает, что стоимость запроса сильно зависит от того, действительно ли повторяющийся контекст попадает в кеш провайдера. Рабочая нагрузка, которая выглядит недорогой при оптимистических предположениях о кэше, может стать намного более дорогой, если запросы очень изменчивы, плохо сегментированы или маршрутизируются с помощью инструментов, предотвращающих повторное использование кэша.
Что изменилось для пользователей API
В документации DeepSeek теперь представлена V4-Pro как первоклассная модель API с двумя поверхностями совместимости: конечная точка в стиле OpenAI на основном базовом URL-адресе API DeepSeek и конечная точка в стиле Anthropic по отдельному пути. Это важно, потому что это снижает барьер интеграции для команд, уже использующих OpenAI-совместимые клиенты, а также дает клиентам в стиле Claude более прямой вариант формата.
Для шлюза AI API непосредственная работа является рутинной, но важной: обновить каталог моделей, обновить метаданные контекстного окна и максимального вывода, отметить поддерживаемые возможности и решить, как представлять два формата API. Рассматривать поверхности формата OpenAI и Anthropic как одно и то же может быть удобно для маркетинговых страниц, но это может создать путаницу в SDK, журналах и элементах управления политиками. Разработчикам необходимо знать, какая схема запроса, поведение вызова инструментов и предположения о потоковой передаче применяются.
Очень большой объявленный предел вывода также заслуживает внимания. Максимальный выход токенов в 384 КБ — это не просто большее число в таблице. Это меняет режимы отказа. Командам могут потребоваться более строгие ограничения на ответы, оповещения о выставлении счетов и меры защиты на уровне приложений, чтобы не допустить, чтобы неконтролируемые генерации или случайные длинные дампы превратили один шаг агента в событие материальных затрат.
Почему ценообразование при попадании в кеш теперь имеет большее значение
Многие разработчики уже давно ассоциируют DeepSeek с агрессивными ценами на API. V4-Pro усложняет это восприятие. Указанная цена ввода при попадании в кэш чрезвычайно низка по сравнению с ценой при промахе в кэше, но эта разница помогает только в том случае, если рабочая нагрузка предназначена для повторного использования кэша.
На практике эффективность кэша зависит от стабильности быстрого выполнения. Длинные системные запросы, блоки политик, пакеты документации и контекст репозитория могут принести пользу, если их последовательно использовать повторно. Но агентные системы часто изменяют подсказки на каждом этапе: добавляют журналы, выходные данные инструментов, временные метки, промежуточные планы и состояние, зависящее от пользователя. Если эти изменения изменят границы кэша или приведут к пропуску больших префиксов, эффективная стоимость может приблизиться к показателю пропусков в кэше.
Вот почему политики маршрутизации не должны ранжировать V4-Pro по единой смешанной входной цене. При моделировании затрат необходимо разделить входные токены попадания в кэш, входные и выходные токены, пропущенные в кэше, а затем протестировать репрезентативные рабочие нагрузки. Агент кодирования, который повторно использует большую сводку репозитория, может вести себя совсем иначе, чем помощник по поддержке клиентов, который вводит свежее состояние учетной записи в каждый запрос.
И здесь Model Gate и аналогичные уровни многомодельной маршрутизации играют практическую роль. Шлюзы, которые отслеживают использование токенов по модели, команде и ключу API, могут помочь операторам увидеть, действительно ли предположительно дешевый маршрут является дешевым в производстве. Соответствующей метрикой больше не являются только токены на запрос; это сочетание входных данных, попадающих в кеш, некэшированных входных данных и сгенерированных выходных данных в реальном трафике.
Кто затронут?
Разработчики, напрямую использующие DeepSeek, должны проверять идентификаторы модели, формат конечной точки и флаги возможностей перед переключением производственного трафика. Вывод JSON и вызовы инструментов перечислены, но поведение приложения по-прежнему требует тестирования, особенно если существующий код зависит от обработки крайних случаев другого поставщика.
Операторы шлюзов и команды платформы имеют более широкий контрольный список.Им нужны обновленные таблицы цен, ограничения контекста, ограничения максимальной производительности, метаданные функций каждой модели, средства контроля бюджета и документация для доступа как с OpenAI, так и с Anthropic. Если они представляют V4-Pro как встраиваемую модель, им все равно следует предупреждать клиентов о том, что эквивалентный синтаксис запросов не гарантирует эквивалентного поведения или затрат.
Компаниям, использующим масштабную автоматизацию, следует пересмотреть предположения модели по умолчанию. Модель с контекстным окном размером 1 М токен может быть привлекательной для юридической проверки, синтеза исследований, анализа кодовой базы и долговременных агентов. Но модели с длинным контекстом, как правило, поощряют более крупные подсказки, а более крупные подсказки увеличивают каждую ошибку в проектировании кэша и управлении выводом.
Что остается неопределенным
На странице цен представлены текущие перечисленные тарифы и возможности, но по-прежнему существует неопределенность в отношении сообщаемых будущих изменений цен. В сообщениях сообщества говорится, что DeepSeek предупредил о значительном повышении цен на API и о том, что новые пиковые и внепиковые цены могут вступить в силу 16 августа. Эти утверждения актуальны для планирования бюджета, но будущая таблица тарифов не была проверена на основе непосредственно доступного официального уведомления в ходе исследования.
Эта неопределенность должна заставить команды проявлять осторожность, а не заморозить. Разумный ответ — добавить V4-Pro в пулы оценки, протестировать реальные рабочие нагрузки, измерить поведение кэша и избегать жесткого кодирования его как постоянного самого дешевого варианта по умолчанию до тех пор, пока не будет подтверждена цена. Для некоторых рабочих нагрузок V4-Pro может быть отличным вариантом для длительного контекста. Для других, особенно для агентов с большим объемом вывода или подсказок с плохим повторным использованием кэша, экономика может быть менее благоприятной, чем предполагает общий коэффициент попадания в кэш.
Более общий урок заключается в том, что доступность модели теперь является только первым вопросом маршрутизации. Более сложные вопросы касаются совместимости форматов, надежности функций, механики кэша, ограничений выходной мощности и наблюдаемости затрат. DeepSeek V4-Pro предоставляет разработчикам еще один мощный вариант API, но также ясно дает понять, что «дешевизна» стала выводом, зависящим от рабочей нагрузки, а не ярлыком поставщика.