Anthropic je dodao dvije blisko povezane beta značajke Claude Messages API-ju: sažimanje razgovora na zahtjev i uređivanje konteksta. Obje su usmjerene na poznati problem za programere koji grade pomoćnike i agente: korisni razgovori često traju dulje od proračuna praktičnog konteksta modela, posebno kada se nakupe pozivi alata, dohvaćeni dokumenti i višestruke upute.

Važna promjena je da Anthropic ne samo da govori programerima da sami sažmu stare poruke. Bilješke o izdanju platforme od 14. rujna opisuju put sažimanja na razini API-ja, omogućen kroz beta zaglavlje compact-2026-09-04, koji vraća potpisani blok sažimanja. Taj blok može zamijeniti raniju povijest razgovora u kasnijem zahtjevu, dok nedavni redovi ostaju netaknuti. Anthropic je također predstavio uređivanje konteksta u beta verziji, u početku usmjereno na automatsko brisanje starijih rezultata alata i poziva alata kako se razgovor približava ograničenjima tokena.

Za timove aplikacija, ovo je značajka upotrebljivosti. Za operatere pristupnika, prodavače mogućnosti promatranja i tvrtke koje normaliziraju promet između pružatelja, to je promjena protokola. Sažeti Claudeov razgovor više nije samo kraći upit. Sadrži potpisani prikaz prethodnog konteksta koji je izradio pružatelj usluga i koji bi trebao biti sačuvan kao takav.

Što se promijenilo u Claude Messages API-ju

U konvencionalnoj dugotrajnoj integraciji chata, programeri obično imaju tri nesavršene opcije kada se kontekstni prozor ispuni. Oni mogu ispustiti stare poteze, generirati vlastiti sažetak ili zatražiti od korisnika ponovno pokretanje. Svaki izbor može oštetiti kontinuitet, sakriti važne upute ili otežati otklanjanje pogrešaka.

Anthropicova nova beta verzija sažimanja premješta dio tog posla u API. API može proizvesti potpisani blok sažimanja za raniji sadržaj razgovora. Kasniji zahtjev tada može poslati taj blok umjesto starijih poruka, dok se noviji razgovor pretvara doslovno. Dizajn je važan jer razlikuje sažetu povijest od običnog teksta sažetka koji je napisao pomoćnik. Pristupnik koji svodi blok u niz, uklanja nepoznata polja ili ga tretira kao normalnu korisničku poruku može pokvariti predviđenu semantiku.

Uređivanje konteksta napada povezani izvor rasta tokena: promet alata. Agentske aplikacije mogu akumulirati velike rezultate alata, međupozive i zastarjela opažanja. Anthropic kaže da beta inicijalno podržava automatsko brisanje rezultata starijih alata i poziva kako se razgovor približava ograničenjima tokena. To ima smisla za mnoge tijekove rada, ali također znači da kasniji odgovor modela može ovisiti o stanju razgovora koje je namjerno smanjeno pravilima na strani pružatelja usluga.

Ovo je posebno relevantno za timove koji grade sloj upravljanja umjetnom inteligencijom iznad više pružatelja modela. Sustav upravljanja treba znati ne samo koji je upit poslan, već i koji su dijelovi prethodnog konteksta zadržani, zbijeni ili uklonjeni.

Zašto gatewayi ne mogu ovo tretirati kao generičko sažimanje

Neposredni rizik implementacije je kompatibilnost. Mnogi API pristupnici i SDK omotači provjeravaju valjanost korisnih opterećenja zahtjeva prema poznatim shemama. Unknown top-level parameters may be dropped. Unknown content blocks may be coerced into text. Cjevovodi za bilježenje mogu redigirati ili transformirati polja koja ne prepoznaju. To su razumne zadane postavke za obične metapodatke, ali su opasne kada je nepoznati objekt dio ugovora o upravljanju kontekstom pružatelja modela.

Claude-aware gateway trebao bi sačuvati novi parametar sažimanja i potpisane blokove bez njihovog ponovnog pisanja. Također bi trebalo napraviti jasnu razliku u tragovima između izvornih poruka, zbijenog konteksta i nedavnih neizmijenjenih skretanja. That distinction is not academic. Kada kupac pita zašto je agent donio odluku, revizijski bi trag trebao pokazati je li model imao pristup izvornom rezultatu alata, sažetom prikazu ili nijednom.

Proizvodi pristupnika kompatibilni s OpenAI suočavaju se s dodatnim problemom dizajna. Ekosustav čavrljanja i odgovora u stilu OpenAI ima vlastite obrasce upravljanja kontekstom, uključujući stanje hostiranog agenta i rukovanje sesijom specifičnom za pružatelja usluga. Anthropicov potpisani blok zbijanja drugačiji je semantički objekt. Jedno generičko polje pod nazivom "sažetak" ili "memorija" neće biti dovoljno ako sustav treba očuvati jamstva pružatelja i ponašanje ponavljanja.

Platforme u stilu modela Gate koje podržavaju usmjeravanje kompatibilno s OpenAI-jem i API-je u Anthropic stilu stoga mogu trebati adaptere konteksta specifične za pružatelja. To ne znači da svaki kupac vidi složenost.To znači da bi pristupnik trebao izložiti stabilno vanjsko iskustvo dok interno zadržava netaknutu Anthropicovu semantiku sažimanja.

Analitika, naplata i revizijski tragovi postaju kompliciraniji

Napomene o izdanju ne govore da li se potpisani blokovi sažimanja naplaćuju drugačije od uobičajenog teksta poruke. Ta neriješena točka je važna. Ako se zbijeni blok broji kao bilo koji drugi unos, sustavi naplate mogu ga tretirati kao drugu komponentu zahtjeva koja nosi token. Ako Anthropic primjenjuje drugačije računovodstvo, pristupnici će morati jasno prikazati tu razliku u fakturama kupaca i izvozima korištenja.

Čak i bez posebnih cijena, sažimanje mijenja način na koji treba objasniti analitiku. Razgovor se može činiti kraćim na razini poruke, a još uvijek ima učinak mnogo dulje prethodne razmjene. Grafikoni osnovnih tokena neće odgovarati na pitanja kao što su: koliko je izvornog konteksta bilo sabijeno, koliko je nedavnog konteksta ostalo doslovno, koliko je često pozivano sažimanje i jesu li kvarovi u korelaciji s automatski izbrisanim rezultatima alata.

Ta pitanja pripadaju nadzornoj ploči analitike upotrebe AI API-ja, a ne zakopana. u sirovim trupcima. Poslovni korisnici sve više očekuju vidjeti cijenu, ponašanje modela i korištenje alata u istom operativnom prikazu. Sažimanje razgovora dodaje još jedan prijelaz stanja tom prikazu.

Postoji i kut usklađenosti. Ako regulirani kupac pita koje su informacije bile dostupne pomoćniku u određenom trenutku, operater ne može odgovoriti samo od tijela konačnog zahtjeva osim ako ne razumije lanac sažimanja. Potpisani blokovi mogu pomoći u očuvanju integriteta, ali ne uklanjaju potrebu za pažljivim pravilima zadržavanja, korisničkim vidljivim tragovima i internim alatima za otklanjanje pogrešaka.

Tko bi trebao djelovati sada

Razvojni programeri koji izravno koriste Claude trebali bi provjeriti prolazi li njihov SDK, proxy ili međuprogram za bilježenje beta zaglavlja, parametar sažimanja najviše razine i vraćene blokove sažimanja nepromijenjene. Također bi trebali testirati ponašanje neuspjeha kada se blokovi zbijanja ponovno reproduciraju kroz implementacije, regije ili zahtijevaju transformacije.

Gateway timovi trebaju dodati pokrivenost sheme prije nego što korisnici naiđu na tihu degradaciju. Minimalni praktični posao je prestati ispuštati ili prepisivati ​​nova polja. Bolja je inačica odvojeno označavanje zbijenog konteksta u zapisnicima, tragovima i zapisima o korištenju. Za timove koji već pružaju objedinjenu naplatu AI API-ja, događaji sažimanja trebali bi biti dovoljno vidljivi da timovi za podršku mogu uskladiti upotrebu tokena i objasniti ponašanje dugih sesija.

Tvrtke koje vode agente za podršku, pomoćnike kodiranja, alate za istraživanje ili prodajne kopilote trebale bi ovo tretirati kao značajku pouzdanosti s posljedicama upravljanja. Sažimanje može učiniti duge razgovore trajnijim, ali također uvodi još jedan skriveni sloj između vidljivog transkripta razgovora i stvarnog stanja unosa modela.

Otvorena pitanja još uvijek su materijalna. Anthropic nije rekao mijenjaju li blokovi zbijanja računovodstvo naplaćenih tokena. Dugoročna stabilnost beta zaglavlja također nije zajamčena. A budući da se uređivanje konteksta u početku usredotočuje na starije pozive alata i rezultate, programeri će morati provjeriti koliko dobro zadane postavke odgovaraju tijekovima rada gdje dokazi o starim alatima ostaju pravno ili operativno važni.

No, širi smjer je jasan. Upravljanje dugim kontekstom prelazi iz koda ljepila aplikacije u API-je pružatelja usluga. Pristupnici koji žele pouzdano sjediti između kupaca i pružatelja modela sada moraju podržavati to kretanje na razini protokola, a ne samo prosljeđivanjem kraćih upita.