Anthropic добави две тясно свързани бета функции към Claude Messages API: уплътняване на разговори при поискване и редактиране на контекст. И двете са насочени към познат проблем за разработчиците, създаващи асистенти и агенти: полезните разговори често продължават по-дълго от бюджета на практическия контекст на модела, особено когато се натрупват извиквания на инструменти, извлечени документи и многократни инструкции.
Важната промяна е, че Anthropic не само казва на разработчиците сами да обобщават старите съобщения. Неговите бележки по изданието на платформата от 14 септември описват път за уплътняване на ниво API, активиран чрез бета заглавката compact-2026-09-04, който връща подписан блок за уплътняване. Този блок може да замени предишната история на разговорите в по-късна заявка, докато последните ходове остават непокътнати. Anthropic също така въведе редактиране на контекст в бета версия, първоначално фокусирано върху автоматично изчистване на по-стари резултати от инструменти и извиквания на инструменти, когато разговорът се доближи до ограниченията на токените.
За екипите на приложения това е функция за използваемост. За операторите на портали, доставчиците на наблюдаемост и компаниите, които нормализират трафика между доставчиците, това е промяна на протокола. Компактният разговор с Клод вече не е просто по-кратка подкана. Той съдържа създадено от доставчика, подписано представяне на предишен контекст, който трябва да бъде запазен като такъв.
Какво се промени в Claude Messages API
При конвенционална дълготрайна интеграция на чат разработчиците обикновено имат три несъвършени опции, когато контекстният прозорец се запълни. Те могат да премахнат стари ходове, да генерират свое собствено резюме или да помолят потребителя да рестартира. Всеки избор може да навреди на непрекъснатостта, да скрие важни инструкции или да затрудни отстраняването на грешки.
Новата бета версия на уплътняването на Anthropic премества част от тази работа в API. API може да създаде подписан блок за уплътняване за по-ранно съдържание на разговор. По-късна заявка може след това да изпрати този блок на мястото на по-старите съобщения, като същевременно се запази дословно по-новият разговор. Дизайнът има значение, защото разграничава компактната история от обикновения обобщен текст, съставен от асистент. Шлюз, който изравнява блока в низ, премахва неизвестни полета или го третира като нормално потребителско съобщение, може да наруши предвидената семантика.
Редактирането на контекст атакува свързан източник на растеж на токени: трафик на инструменти. Агентните приложения могат да натрупват големи резултати от инструмента, междинни извиквания и остарели наблюдения. Anthropic казва, че бета версията първоначално поддържа автоматично изчистване на по-стари резултати от инструменти и обаждания, когато разговорът наближава лимитите на символите. Това има смисъл за много работни потоци, но също така означава, че по-късен отговор на модела може да зависи от състояние на разговор, което е съзнателно съкратено от правилата от страна на доставчика.
Това е особено подходящо за екипи, които изграждат слой Управление на AI над множество доставчици на модели. Системата за управление трябва да знае не само каква подкана е изпратена, но и кои части от предишния контекст са били запазени, уплътнени или премахнати.
Защо шлюзовете не могат да третират това като общо обобщение
Непосредственият риск при внедряването е съвместимостта. Много API шлюзове и SDK обвивки проверяват полезните натоварвания на заявките спрямо известни схеми. Неизвестните параметри от най-високо ниво могат да бъдат премахнати. Блокове с неизвестно съдържание може да бъдат принудени да бъдат превърнати в текст. Регистриращите канали могат да редактират или трансформират полета, които не разпознават. Това са разумни стойности по подразбиране за обикновени метаданни, но те са опасни, когато неизвестният обект е част от договора за управление на контекста на доставчика на модела.
Шлюзът с Claude-aware трябва да запази новия параметър за уплътняване и подписаните блокове, без да ги пренаписва. Той също така трябва да прави ясно разграничение в следите между оригинални съобщения, компактен контекст и скорошни непроменени завои. Това разграничение не е академично. Когато клиент попита защо даден агент е взел решение, одитната пътека трябва да покаже дали моделът е имал достъп до оригиналния резултат от инструмента, компактно представяне или нито едно от двете.
Продуктите за шлюз, съвместими с OpenAI, са изправени пред допълнителен проблем при дизайна. Екосистемата за чат и отговори в стил OpenAI има свои собствени модели за управление на контекста, включително състояние на хостван агент и обработка на сесии, специфични за доставчика. Подписаният блок за уплътняване на Anthropic е различен семантичен обект. Едно общо поле, наречено „резюме“ или „памет“, няма да е достатъчно, ако системата трябва да запази гаранции на доставчика и поведението на повторение.
Моделни платформи в стил Gate, които поддържат както OpenAI-съвместимо маршрутизиране, така и API-и в стил Anthropic, може следователно да се нуждаят от специфични за доставчика контекстни адаптери. Това не означава, че всеки клиент вижда сложността.Това означава, че шлюзът трябва да показва стабилно външно изживяване, като същевременно запазва семантиката на уплътняване на Anthropic непокътната вътрешно.
Анализите, фактурирането и следите за одит стават по-сложни
Бележките по изданието не казват дали подписаните блокове за уплътняване се таксуват по различен начин от обикновения текст на съобщението. Тази неразрешена точка има значение. Ако компактен блок се брои като всеки друг вход, системите за таксуване могат да го третират като друг компонент на заявка, носещ токен. Ако Anthropic прилага различно счетоводство, шлюзовете ще трябва да представят тази разлика ясно във фактурите на клиентите и експортирания за използване.
Дори и без специално ценообразуване, уплътняването променя начина, по който трябва да се обяснява анализът. Един разговор може да изглежда по-кратък на ниво съобщение, като същевременно носи ефекта на много по-дълъг предишен обмен. Базовите графики на токени няма да отговорят на въпроси като: колко оригинален контекст е бил уплътнен, колко скорошен контекст е останал дословен, колко често е било извиквано уплътняване и дали неуспехите корелират с автоматично изчистените изходи на инструмента.
Тези въпроси принадлежат към таблото за управление на анализа на използването на AI API, а не погребани в сурови трупи. Корпоративните клиенти все повече очакват да видят разходите, поведението на модела и използването на инструмента в един и същ оперативен изглед. Уплътняването на разговора добавя друг преход към състоянието към този изглед.
Има и ъгъл на съответствие. Ако регулиран клиент попита каква информация е била достъпна за асистент в определен момент, операторът не може да отговори единствено от окончателното тяло на заявката, освен ако не разбира веригата на уплътняване. Подписаните блокове могат да помогнат за запазване на целостта, но те не премахват необходимостта от правила за внимателно задържане, видими от клиента следи и вътрешни инструменти за отстраняване на грешки.
Кой трябва да действа сега
Разработчиците, които използват директно Claude, трябва да прегледат дали техният SDK, прокси или междинен софтуер за регистриране преминава бета заглавки, параметъра за уплътняване от най-високо ниво и върнатите блокове за уплътняване непроменени. Те трябва също така да тестват поведението при отказ, когато блоковете за уплътняване се възпроизвеждат през внедрявания, региони или трансформации на заявки.
Екипите на Gateway трябва да добавят покритие на схемата, преди клиентите да се натъкнат на тихо влошаване. Минималната практическа работа е да спрете да изпускате или пренаписвате новите полета. По-добрата версия е да етикетирате компактния контекст отделно в регистрационни файлове, следи и записи за използване. За екипи, които вече предоставят унифицирано таксуване на AI API, събитията за уплътняване трябва да са достатъчно видими, за да могат екипите за поддръжка да съгласуват използването на токени и да обяснят поведението при дълги сесии.
Бизнесите, управляващи агенти за поддръжка, асистенти за кодиране, инструменти за изследване или копилоти за продажби, трябва да третират това като функция за надеждност с последици за управлението. Уплътняването може да направи дългите разговори по-трайни, но също така въвежда друг скрит слой между видимия препис на чата и действителното състояние на въвеждане на модела.
Отворените въпроси все още са съществени. Anthropic не каза дали блоковете за уплътняване променят отчитането на таксуваните токени. Дългосрочната стабилност на бета заглавката също не е гарантирана. И тъй като редактирането на контекст първоначално се фокусира върху по-стари извиквания на инструменти и резултати, разработчиците ще трябва да проверят доколко настройките по подразбиране отговарят на работните потоци, където старите доказателства за инструменти остават правно или оперативно важни.
По-голямата посока обаче е ясна. Управлението на дълъг контекст се премества от слепващия код на приложението към API на доставчика. Шлюзовете, които искат да стоят надеждно между клиентите и доставчиците на модели, сега трябва да поддържат това движение на ниво протокол, а не само чрез препращане на по-кратки подкани.