Anthropic ha aggiunto due funzionalità beta strettamente correlate all'API Claude Messages: compattazione delle conversazioni su richiesta e modifica del contesto. Entrambi mirano a un problema familiare per gli sviluppatori che creano assistenti e agenti: le conversazioni utili spesso durano più a lungo del budget del contesto pratico di un modello, soprattutto quando si accumulano chiamate a strumenti, documenti recuperati e istruzioni a più turni.

Il cambiamento importante è che Anthropic non sta solo dicendo agli sviluppatori di riassumere loro stessi i vecchi messaggi. Le note di rilascio della piattaforma del 14 settembre descrivono un percorso di compattazione a livello API, abilitato tramite l'intestazione beta compact-2026-09-04, che restituisce un blocco di compattazione firmato. Quel blocco può sostituire la cronologia delle conversazioni precedenti in una richiesta successiva mentre i turni recenti rimangono intatti. Anthropic ha anche introdotto la modifica del contesto nella versione beta, inizialmente incentrata sulla cancellazione automatica dei risultati e delle chiamate degli strumenti meno recenti quando una conversazione si avvicina ai limiti dei token.

Per i team applicativi, questa è una funzionalità di usabilità. Per gli operatori gateway, i fornitori di osservabilità e le aziende che normalizzano il traffico tra provider, si tratta di un cambiamento di protocollo. Una conversazione compatta di Claude non è più solo un suggerimento più breve. Contiene una rappresentazione firmata dal provider del contesto precedente che dovrebbe essere preservata come tale.

Cosa è cambiato nell'API Claude Messages

In un'integrazione di chat convenzionale di lunga durata, gli sviluppatori di solito hanno tre opzioni imperfette quando la finestra del contesto si riempie. Possono eliminare le vecchie svolte, generare il proprio riepilogo o chiedere all'utente di riavviare. Ogni scelta può danneggiare la continuità, nascondere istruzioni importanti o rendere più difficile il debug.

La nuova beta di compattazione di Anthropic sposta parte di questo lavoro nell'API. L'API può produrre un blocco di compattazione firmato per il contenuto della conversazione precedente. Una richiesta successiva può quindi inviare quel blocco al posto dei messaggi più vecchi, preservando la conversazione più recente alla lettera. Il design è importante perché distingue la storia compattata dal normale testo riassuntivo scritto da un assistente. Un gateway che appiattisce il blocco in una stringa, rimuove campi sconosciuti o lo tratta come un normale messaggio utente può interrompere la semantica prevista.

La modifica del contesto attacca una fonte correlata di crescita dei token: il traffico degli strumenti. Le applicazioni agentiche possono accumulare output di strumenti di grandi dimensioni, chiamate intermedie e osservazioni obsolete. Anthropic afferma che la beta inizialmente supporta la cancellazione automatica dei risultati e delle chiamate degli strumenti più vecchi quando la conversazione si avvicina ai limiti dei token. Ciò ha senso per molti flussi di lavoro, ma significa anche che una risposta successiva del modello può dipendere da uno stato di conversazione che è stato deliberatamente eliminato dalle regole lato fornitore.

Ciò è particolarmente rilevante per i team che creano un livello di governance AI sopra più fornitori di modelli. Il sistema di governance deve sapere non solo quale prompt è stato inviato, ma anche quali parti del contesto precedente sono state conservate, compattate o rimosse.

Perché i gateway non possono trattarlo come un riepilogo generico

Il rischio immediato di implementazione è la compatibilità. Molti gateway API e wrapper SDK convalidano i payload delle richieste rispetto a schemi noti. I parametri di livello superiore sconosciuti potrebbero essere eliminati. I blocchi di contenuto sconosciuti potrebbero essere trasformati in testo. Le pipeline di registrazione potrebbero oscurare o trasformare campi che non riconoscono. Questi sono valori predefiniti ragionevoli per i metadati ordinari, ma sono pericolosi quando l'oggetto sconosciuto fa parte del contratto di gestione del contesto del fornitore del modello.

Un gateway compatibile con Claude dovrebbe preservare il nuovo parametro di compattazione e i blocchi firmati senza riscriverli. Dovrebbe anche fare una chiara distinzione nelle tracce tra messaggi originali, contesto compattato e svolte recenti non modificate. Questa distinzione non è accademica. Quando un cliente chiede perché un agente ha preso una decisione, la traccia di controllo dovrebbe mostrare se il modello ha avuto accesso al risultato dello strumento originale, a una rappresentazione compattata o a nessuno dei due.

I prodotti gateway compatibili con OpenAI devono affrontare un ulteriore problema di progettazione. L'ecosistema di chat e risposte in stile OpenAI ha i propri modelli di gestione del contesto, tra cui lo stato dell'agente ospitato e la gestione della sessione specifica del provider. Il blocco di compattazione con segno di Anthropic è un oggetto semantico diverso. Un singolo campo generico chiamato "summary" o "memory" non sarà sufficiente se il sistema ha bisogno di preservare le garanzie del provider e il comportamento di riproduzione.

Le piattaforme in stile Model Gate che supportano sia il routing compatibile con OpenAI che le API in stile Anthropic potrebbero quindi richiedere adattatori di contesto specifici del provider. Ciò non significa che ogni cliente veda la complessità.Ciò significa che il gateway dovrebbe offrire un'esperienza esterna stabile mantenendo intatta internamente la semantica di compattazione di Anthropic.

Analisi, fatturazione e audit trail diventano più complicati

Le note di rilascio non dicono se i blocchi di compattazione firmati vengono fatturati in modo diverso dal normale testo del messaggio. Questo punto irrisolto è importante. Se un blocco compattato viene conteggiato come qualsiasi altro input, i sistemi di fatturazione possono trattarlo come un altro componente della richiesta contenente token. Se Anthropic applica una contabilità diversa, i gateway dovranno rappresentare chiaramente tale differenza nelle fatture dei clienti e nelle esportazioni di utilizzo.

Anche senza prezzi speciali, la compattazione cambia il modo in cui l'analisi dovrebbe essere spiegata. Una conversazione può apparire più breve a livello di messaggio pur portando con sé l'effetto di uno scambio precedente molto più lungo. I grafici dei token di base non risponderanno a domande quali: quanto contesto originale è stato compresso, quanto contesto recente è rimasto letterale, quanto spesso è stata richiamata la compattazione e se gli errori sono correlati agli output dello strumento cancellati automaticamente.

Queste domande appartengono a un dashboard di analisi dell'utilizzo dell'API AI anziché sepolte nei log non elaborati. I clienti aziendali si aspettano sempre più di vedere costi, comportamento dei modelli e utilizzo degli strumenti nella stessa visione operativa. La compattazione della conversazione aggiunge un'altra transizione di stato a questa visualizzazione.

C'è anche un aspetto di conformità. Se un cliente regolamentato chiede quali informazioni erano a disposizione di un assistente in un determinato momento, un operatore non può rispondere esclusivamente dall'organismo di richiesta finale a meno che non comprenda la catena di compattazione. I blocchi firmati possono aiutare a preservare l'integrità, ma non eliminano la necessità di regole di conservazione attente, tracce visibili al cliente e strumenti di debug interni.

Chi dovrebbe agire ora

Gli sviluppatori che utilizzano Claude direttamente dovrebbero verificare se il loro SDK, proxy o middleware di registrazione supera le intestazioni beta, il parametro di compattazione di primo livello e i blocchi di compattazione restituiti invariati. Dovrebbero inoltre testare il comportamento degli errori quando i blocchi di compattazione vengono riprodotti tra distribuzioni, regioni o trasformazioni di richieste.

I team del gateway dovrebbero aggiungere la copertura dello schema prima che i clienti riscontrino un degrado silenzioso. Il lavoro pratico minimo è smettere di eliminare o riscrivere i nuovi campi. La versione migliore consiste nell'etichettare il contesto compresso separatamente in log, tracce e record di utilizzo. Per i team che già forniscono fatturazione API AI unificata, gli eventi di compattazione dovrebbero essere sufficientemente visibili da consentire ai team di supporto di riconciliare l'utilizzo dei token e spiegare il comportamento di sessioni lunghe.

Le aziende che gestiscono agenti di supporto, assistenti di codifica, strumenti di ricerca o copiloti di vendita dovrebbero considerare questo come una caratteristica di affidabilità con conseguenze sulla governance. La compattazione può rendere le conversazioni lunghe più durevoli, ma introduce anche un altro livello nascosto tra la trascrizione visibile della chat e l'effettivo stato di input del modello.

Le domande aperte sono ancora rilevanti. Anthropic non ha detto se i blocchi di compattazione modificheranno la contabilità dei token fatturati. Anche la stabilità a lungo termine dell'intestazione beta non è garantita. E poiché la modifica del contesto si concentra inizialmente sulle chiamate e sui risultati degli strumenti più vecchi, gli sviluppatori dovranno verificare quanto bene le impostazioni predefinite si adattino ai flussi di lavoro in cui le prove dei vecchi strumenti rimangono importanti dal punto di vista legale o operativo.

La direzione più ampia, tuttavia, è chiara. La gestione a lungo contesto si sta spostando dal codice adesivo dell'applicazione alle API del provider. I gateway che vogliono collocarsi in modo affidabile tra clienti e fornitori di modelli ora devono supportare questo movimento a livello di protocollo, non solo inoltrando richieste più brevi.