Anthropic ha agregado dos funciones beta estrechamente relacionadas a la API de Claude Messages: compactación de conversaciones bajo demanda y edición de contexto. Ambos apuntan a un problema familiar para los desarrolladores que crean asistentes y agentes: las conversaciones útiles a menudo duran más que el presupuesto de contexto práctico de un modelo, especialmente cuando se acumulan llamadas a herramientas, documentos recuperados e instrucciones de varios turnos.

El cambio importante es que Anthropic no solo les dice a los desarrolladores que resuman ellos mismos los mensajes antiguos. Las notas de la versión de la plataforma del 14 de septiembre describen una ruta de compactación a nivel de API, habilitada a través del encabezado beta compact-2026-09-04, que devuelve un bloque de compactación firmado. Ese bloque puede reemplazar el historial de conversaciones anteriores en una solicitud posterior, mientras que los turnos recientes permanecen intactos. Anthropic también introdujo la edición de contexto en versión beta, inicialmente enfocada en borrar automáticamente los resultados de herramientas más antiguas y las llamadas a herramientas a medida que una conversación se acerca a los límites de tokens.

Para los equipos de aplicaciones, esta es una característica de usabilidad. Para los operadores de puertas de enlace, los proveedores de observabilidad y las empresas que normalizan el tráfico entre proveedores, se trata de un cambio de protocolo. Una conversación compacta con Claude ya no es solo un mensaje más breve. Contiene una representación firmada y creada por el proveedor del contexto anterior que debe conservarse como tal.

Qué cambió en la API de Claude Messages

En una integración de chat convencional de larga duración, los desarrolladores generalmente tienen tres opciones imperfectas cuando la ventana de contexto se llena. Pueden eliminar giros antiguos, generar su propio resumen o pedirle al usuario que reinicie. Cada elección puede dañar la continuidad, ocultar instrucciones importantes o dificultar la depuración.

La nueva versión beta de compactación de Anthropic traslada parte de ese trabajo a la API. La API puede producir un bloque de compactación firmado para el contenido de una conversación anterior. Una solicitud posterior puede enviar ese bloqueo en lugar de los mensajes más antiguos, preservando al mismo tiempo la conversación más reciente palabra por palabra. El diseño es importante porque distingue la historia compactada del texto resumido ordinario escrito por un asistente. Una puerta de enlace que aplana el bloque en una cadena, elimina campos desconocidos o lo trata como un mensaje de usuario normal puede romper la semántica prevista.

La edición de contexto ataca una fuente relacionada de crecimiento simbólico: el tráfico de herramientas. Las aplicaciones agentes pueden acumular grandes resultados de herramientas, llamadas intermedias y observaciones obsoletas. Anthropic dice que la versión beta inicialmente admite la eliminación automática de llamadas y resultados de herramientas más antiguas a medida que la conversación se acerca a los límites de los tokens. Esto tiene sentido para muchos flujos de trabajo, pero también significa que una respuesta posterior del modelo puede depender de un estado de conversación que ha sido eliminado deliberadamente por reglas del lado del proveedor.

Esto es especialmente relevante para los equipos que crean una capa de gobierno de IA por encima de múltiples proveedores de modelos. El sistema de gobernanza necesita saber no solo qué mensaje se envió, sino también qué partes del contexto anterior se retuvieron, compactaron o eliminaron.

Por qué las puertas de enlace no pueden tratar esto como un resumen genérico

El riesgo de implementación inmediata es la compatibilidad. Muchas puertas de enlace API y contenedores de SDK validan las cargas útiles de las solicitudes con esquemas conocidos. Es posible que se eliminen los parámetros desconocidos de nivel superior. Los bloques de contenido desconocidos pueden convertirse en texto. Las canalizaciones de registro pueden redactar o transformar campos que no reconocen. Estos son valores predeterminados razonables para los metadatos ordinarios, pero son peligrosos cuando el objeto desconocido forma parte del contrato de gestión de contexto del proveedor del modelo.

Una puerta de enlace compatible con Claude debe conservar el nuevo parámetro de compactación y los bloques firmados sin reescribirlos. También debería hacer una distinción clara entre los mensajes originales, el contexto compactado y los giros recientes no modificados. Esa distinción no es académica. Cuando un cliente pregunta por qué un agente tomó una decisión, la pista de auditoría debe mostrar si el modelo tuvo acceso al resultado original de la herramienta, a una representación compacta o a ninguna de las dos cosas.

Los productos de puerta de enlace compatibles con OpenAI enfrentan un problema de diseño adicional. El ecosistema de respuestas y chat estilo OpenAI tiene sus propios patrones de gestión de contexto, incluido el estado del agente alojado y el manejo de sesiones específicas del proveedor. El bloque de compactación firmado de Anthropic es un objeto semántico diferente. Un único campo genérico llamado "resumen" o "memoria" no será suficiente si el sistema necesita preservar las garantías del proveedor y el comportamiento de reproducción.

Las plataformas modelo estilo Gate que admiten tanto enrutamiento compatible con OpenAI como API de estilo Anthropic pueden, por lo tanto, necesitar adaptadores de contexto específicos del proveedor. Eso no significa que todos los clientes vean la complejidad.Significa que la puerta de enlace debe exponer una experiencia externa estable mientras mantiene intacta la semántica de compactación de Anthropic internamente.

Los análisis, la facturación y los registros de auditoría se vuelven más complicados

Las notas de la versión no dicen si los bloques de compactación firmados se facturan de manera diferente al texto de mensaje normal. Ese punto no resuelto importa. Si un bloque compactado se cuenta como cualquier otra entrada, los sistemas de facturación pueden tratarlo como otro componente de solicitud con token. Si Anthropic aplica una contabilidad diferente, las puertas de enlace deberán representar esa diferencia claramente en las facturas de los clientes y en las exportaciones de uso.

Incluso sin precios especiales, la compactación cambia la forma en que se deben explicar los análisis. Una conversación puede parecer más corta a nivel de mensaje y al mismo tiempo tener el efecto de un intercambio previo mucho más largo. Los gráficos de tokens básicos no responderán preguntas como: cuánto contexto original se compactó, cuánto contexto reciente permaneció textualmente, con qué frecuencia se invocó la compactación y si las fallas se correlacionan con los resultados de las herramientas borrados automáticamente.

Esas preguntas deben estar en un panel de análisis de uso de API de IA en lugar de estar enterrados en registros sin procesar. Los clientes empresariales esperan cada vez más ver el costo, el comportamiento del modelo y el uso de herramientas en la misma vista operativa. La compactación de la conversación añade otra transición de estado a esa vista.

También hay un ángulo de cumplimiento. Si un cliente regulado pregunta qué información estaba disponible para un asistente en un momento determinado, un operador no puede responder únicamente desde el organismo de solicitud final a menos que comprenda la cadena de compactación. Los bloques firmados pueden ayudar a preservar la integridad, pero no eliminan la necesidad de reglas de retención cuidadosas, seguimientos visibles para el cliente y herramientas de depuración internas.

Quién debe actuar ahora

Los desarrolladores que utilizan Claude directamente deben revisar si su SDK, proxy o middleware de registro pasa los encabezados beta, el parámetro de compactación de nivel superior y los bloques de compactación devueltos sin cambios. También deben probar el comportamiento de falla cuando los bloques de compactación se reproducen en implementaciones, regiones o transformaciones de solicitudes.

Los equipos de puerta de enlace deben agregar cobertura de esquema antes de que los clientes encuentren una degradación silenciosa. El trabajo práctico mínimo es dejar de eliminar o reescribir los nuevos campos. La mejor versión es etiquetar el contexto compactado por separado en registros, seguimientos y registros de uso. Para los equipos que ya proporcionan facturación unificada de API de IA, los eventos de compactación deben ser lo suficientemente visibles como para que los equipos de soporte puedan conciliar el uso de tokens y explicar el comportamiento de las sesiones largas.

Las empresas que ejecutan agentes de soporte, asistentes de codificación, herramientas de investigación o copilotos de ventas deben tratar esto como una característica de confiabilidad con consecuencias de gobernanza. La compactación puede hacer que las conversaciones largas sean más duraderas, pero también introduce otra capa oculta entre la transcripción visible del chat y el estado de entrada real del modelo.

Las preguntas abiertas siguen siendo importantes. Anthropic no ha dicho si los bloques de compactación cambian la contabilidad de los tokens facturados. Tampoco se garantiza la estabilidad a largo plazo del encabezado beta. Y debido a que la edición de contexto inicialmente se enfoca en llamadas y resultados de herramientas más antiguas, los desarrolladores necesitarán verificar qué tan bien los valores predeterminados se ajustan a los flujos de trabajo donde la evidencia de herramientas antiguas sigue siendo legal u operativamente importante.

Sin embargo, la dirección más amplia es clara. La gestión de contexto largo está pasando del código adhesivo de aplicaciones a las API de proveedores. Las puertas de enlace que quieran establecerse de manera confiable entre los clientes y los proveedores de modelos ahora deben respaldar ese movimiento a nivel de protocolo, no solo enviando mensajes más breves.