Anthropic добавила в API Claude Messages две тесно связанные бета-функции: сжатие разговоров по требованию и редактирование контекста. Оба нацелены на знакомую проблему для разработчиков, создающих помощников и агентов: полезные разговоры часто занимают больше времени, чем практический бюджет контекста модели, особенно когда накапливаются вызовы инструментов, полученные документы и многоходовые инструкции.

Важное изменение заключается в том, что Anthropic не только предлагает разработчикам суммировать старые сообщения самостоятельно. В примечаниях к выпуску платформы от 14 сентября описывается путь уплотнения на уровне API, активируемый через бета-заголовок compact-2026-09-04, который возвращает подписанный блок уплотнения. Этот блок может заменить предыдущую историю разговоров в более позднем запросе, при этом недавние ходы останутся нетронутыми. Anthropic также представила редактирование контекста в бета-версии, изначально ориентированное на автоматическую очистку старых результатов инструментов и вызовов инструментов по мере того, как диалог приближается к ограничениям токенов.

Для команд разработки приложений это функция удобства использования. Для операторов шлюзов, поставщиков средств наблюдения и компаний, которые нормализуют трафик между провайдерами, это изменение протокола. Сжатый разговор Клода больше не является просто более короткой подсказкой. Он содержит созданное провайдером подписанное представление предыдущего контекста, которое должно быть сохранено как таковое.

Что изменилось в Claude Messages API

При обычной длительной интеграции чата у разработчиков обычно есть три несовершенных варианта, когда окно контекста заполняется. Они могут удалять старые ходы, генерировать собственную сводку или просить пользователя перезапустить игру. Любой выбор может нарушить непрерывность, скрыть важные инструкции или затруднить отладку.

Новая бета-версия сжатия Anthropic переносит часть этой работы в API. API может создать подписанный блок сжатия для содержимого предыдущего разговора. Более поздний запрос может затем отправить этот блок вместо старых сообщений, сохраняя при этом новый разговор дословно. Дизайн имеет значение, поскольку он отличает сжатую историю от обычного краткого текста, написанного помощником. Шлюз, который преобразует блок в строку, удаляет неизвестные поля или обрабатывает его как обычное пользовательское сообщение, может нарушить предполагаемую семантику.

Редактирование контекста атакует связанный источник роста токенов: трафик инструментов. Агентские приложения могут накапливать большие выходные данные инструментов, промежуточные вызовы и устаревшие наблюдения. Anthropic сообщает, что бета-версия изначально поддерживает автоматическую очистку результатов и вызовов старых инструментов, когда разговор приближается к пределу токенов. Это имеет смысл для многих рабочих процессов, но это также означает, что более поздний ответ модели может зависеть от состояния диалога, которое было намеренно сокращено правилами на стороне поставщика.

Это особенно актуально для команд, создающих уровень управления ИИ над несколькими поставщиками моделей. Система управления должна знать не только, какое приглашение было отправлено, но и какие части предыдущего контекста были сохранены, сжаты или удалены.

Почему шлюзы не могут рассматривать это как общее обобщение

Непосредственным риском реализации является совместимость. Многие шлюзы API и оболочки SDK проверяют полезные данные запроса на соответствие известным схемам. Неизвестные параметры верхнего уровня могут быть удалены. Неизвестные блоки контента могут быть преобразованы в текст. Конвейеры журналирования могут редактировать или преобразовывать поля, которые они не распознают. Это разумные значения по умолчанию для обычных метаданных, но они опасны, когда неизвестный объект является частью контракта управления контекстом поставщика модели.

Шлюз, поддерживающий Claude, должен сохранять новый параметр сжатия и подписанные блоки, не переписывая их. Следует также проводить четкое различие в следах между оригинальными сообщениями, сжатым контекстом и недавними неизмененными поворотами. Это различие не является академическим. Когда клиент спрашивает, почему агент принял такое решение, журнал аудита должен показать, имела ли модель доступ к исходному результату инструмента, сжатому представлению или ни к чему другому.

Продукты-шлюзы, совместимые с OpenAI, сталкиваются с дополнительной проблемой проектирования. Экосистема чата и ответов в стиле OpenAI имеет свои собственные шаблоны управления контекстом, включая состояние размещенного агента и обработку сеансов для конкретного поставщика. Подписанный блок уплотнения Anthropic — это другой семантический объект. Одного общего поля, называемого «сводка» или «память», будет недостаточно, если системе необходимо сохранить гарантии поставщика и поведение воспроизведения.

Платформам типа Model Gate, которые поддерживают как маршрутизацию, совместимую с OpenAI, так и API-интерфейсы в стиле Anthropic, поэтому могут потребоваться адаптеры контекста, специфичные для конкретного поставщика. Это не означает, что каждый клиент видит сложность.Это означает, что шлюз должен предоставлять стабильный внешний интерфейс, сохраняя при этом внутреннюю семантику сжатия Anthropic.

Аналитика, выставление счетов и журналы аудита усложняются

В примечаниях к выпуску не говорится, выставляется ли счет за подписанные блоки уплотнения иначе, чем за обычный текст сообщения. Этот нерешенный вопрос имеет значение. Если сжатый блок учитывается как любой другой ввод, биллинговые системы могут рассматривать его как еще один компонент запроса, несущий токен. Если Anthropic будет применять другой учет, шлюзам придется четко отражать эту разницу в счетах клиентов и экспорте данных об использовании.

Даже без специального ценообразования уплотнение меняет способ объяснения аналитики. Разговор может казаться короче на уровне сообщений, но при этом сохранять эффект гораздо более продолжительного предыдущего обмена. Базовые графики токенов не отвечают на такие вопросы, как: сколько исходного контекста было сжато, сколько недавнего контекста осталось дословным, как часто вызывалось сжатие и коррелируют ли сбои с автоматически очищаемыми результатами инструмента.

Эти вопросы относятся к панели анализа использования AI API, а не скрыты в необработанных журналах. Корпоративные клиенты все чаще ожидают увидеть стоимость, поведение модели и использование инструментов в одном и том же оперативном представлении. Сжатие диалога добавляет к этому представлению еще один переход между состояниями.

Существует также аспект соответствия. Если регулируемый клиент спрашивает, какая информация была доступна помощнику в определенное время, оператор не может ответить исключительно из тела конечного запроса, если он не понимает цепочку уплотнения. Подписанные блоки могут помочь сохранить целостность, но они не устраняют необходимость в строгих правилах хранения, видимых для клиента трассировках и внутренних инструментах отладки.

Кто должен действовать сейчас

Разработчики, использующие Claude напрямую, должны проверить, передает ли их SDK, прокси-сервер или промежуточное программное обеспечение для ведения журналов бета-заголовки, параметр уплотнения верхнего уровня и возвращаемые блоки уплотнения без изменений. Им также следует протестировать поведение при сбоях, когда блоки уплотнения воспроизводятся в разных развертываниях, регионах или преобразованиях запросов.

Команды шлюзов должны добавить покрытие схемы до того, как клиенты столкнутся с незаметной деградацией. Минимальная практическая работа — прекратить удалять или перезаписывать новые поля. Лучший вариант — помечать сжатый контекст отдельно в журналах, трассировках и записях использования. Для команд, которые уже предоставляют унифицированное выставление счетов AI API, события уплотнения должны быть достаточно видимыми, чтобы группы поддержки могли согласовывать использование токенов и объяснять поведение во время длительных сеансов.

Компании, в которых работают агенты поддержки, помощники по программированию, исследовательские инструменты или помощники по продажам, должны рассматривать это как функцию надежности, имеющую последствия для управления. Сжатие может сделать длинные разговоры более продолжительными, но оно также создает еще один скрытый слой между видимой стенограммой чата и фактическим состоянием ввода модели.

Открытые вопросы по-прежнему существенны. Anthropic не сообщила, изменят ли блоки уплотнения учет выставленных токенов. Долгосрочная стабильность бета-заголовка также не гарантируется. А поскольку редактирование контекста изначально фокусируется на вызовах и результатах старых инструментов, разработчикам необходимо будет проверять, насколько хорошо настройки по умолчанию соответствуют рабочим процессам, в которых данные старых инструментов остаются важными с юридической или операционной точки зрения.

Однако более широкое направление ясно. Управление длинным контекстом переходит от связующего кода приложения к API-интерфейсам поставщика. Шлюзы, которые хотят надежно находиться между клиентами и поставщиками моделей, теперь должны поддерживать это движение на уровне протокола, а не просто пересылать более короткие запросы.