El modelo V4-Pro de DeepSeek se ha trasladado al territorio práctico de planificación de API. La documentación de precios de API actual de la compañía enumera DeepSeek-V4-Pro junto con DeepSeek-V4-Flash, expuestos a través de una URL base en formato OpenAI y una URL base separada en formato Anthropic. Las publicaciones de la comunidad que citan el registro de cambios de DeepSeek dicen que la versión V4-Pro 0813 se lanzó para los usuarios de aplicaciones, web y API el 13 de agosto.
La lista de modelos se destaca por algo más que la disponibilidad. DeepSeek-V4-Pro se anuncia con una longitud de contexto de 1 millón de tokens y una salida máxima de 384 000 tokens, además de salida JSON, llamadas a herramientas, versión beta de finalización de prefijo de chat y versión beta de finalización FIM en modo sin pensamiento. Para los desarrolladores que crean agentes, herramientas de código, flujos de trabajo de documentos largos o sistemas con gran cantidad de recuperación, esos límites colocan a V4-Pro en la categoría de modelos que pueden remodelar la arquitectura de mensajes en lugar de simplemente reemplazar un modelo de chat más pequeño.
El precio, sin embargo, es la verdadera historia operativa. La página de DeepSeek enumera V4-Pro a $ 0,003625 por 1 millón de tokens de entrada de caché, $ 0,435 por 1 millón de tokens de entrada sin caché y $ 0,87 por 1 millón de tokens de salida. Esa dispersión significa que el costo de una solicitud depende en gran medida de si el contexto repetido realmente llega al caché del proveedor. Una carga de trabajo que parece económica bajo supuestos optimistas de caché puede volverse mucho más costosa si las indicaciones son muy variables, mal segmentadas o enrutadas a través de herramientas que impiden la reutilización de caché.
Lo que cambió para los usuarios de API
La documentación de DeepSeek ahora presenta V4-Pro como un modelo API de primera clase con dos superficies de compatibilidad: un punto final de estilo OpenAI en la URL base principal de la API de DeepSeek y un punto final de estilo Antrópico bajo una ruta separada. Esto es importante porque reduce la barrera de integración para los equipos que ya utilizan clientes compatibles con OpenAI y, al mismo tiempo, ofrece a los clientes estilo Claude una opción de formato más directa.
Para una puerta de enlace API de IA, el trabajo inmediato es mundano pero importante: actualizar el catálogo de modelos, actualizar la ventana de contexto y los metadatos de salida máxima, marcar las capacidades admitidas y decidir cómo representar los dos formatos de API. Tratar las superficies de formato OpenAI y Anthropic como lo mismo puede ser conveniente para las páginas de marketing, pero puede crear confusión en los SDK, los registros y los controles de políticas. Los desarrolladores necesitan saber qué esquema de solicitud, comportamiento de llamada de herramientas y supuestos de transmisión se aplican.
El gran límite de salida anunciado también merece atención. Una salida máxima de 384.000 tokens no es simplemente un número mayor en una tabla. Cambia los modos de falla. Los equipos pueden necesitar límites de respuesta más estrictos, alertas de facturación y barreras de seguridad a nivel de aplicación para evitar que generaciones descontroladas o volcados accidentales de formato largo conviertan el paso de un solo agente en un evento de costo de material.
Por qué ahora son más importantes los precios de caché
Muchos desarrolladores han asociado durante mucho tiempo DeepSeek con precios de API agresivos. V4-Pro complica esa percepción. El precio de entrada de caché indicado es extremadamente bajo en comparación con el precio de entrada de caché perdida, pero esa diferencia solo ayuda si una carga de trabajo está diseñada para la reutilización de caché.
En la práctica, la eficiencia de la caché depende de la estabilidad inmediata. Las indicaciones largas del sistema, los bloques de políticas, los paquetes de documentación y el contexto del repositorio pueden beneficiarse cuando se reutilizan de manera consistente. Pero los sistemas agentes a menudo modifican las indicaciones en cada paso: agregando registros, resultados de herramientas, marcas de tiempo, planes intermedios y estados específicos del usuario. Si esos cambios cambian los límites de la caché o hacen que se pierdan prefijos grandes, el costo efectivo puede acercarse a la tasa de fallas de caché.
Es por eso que las políticas de enrutamiento no deben clasificar V4-Pro según un único precio de entrada combinado. La simulación de costos debe separar los tokens de entrada de acierto de caché, de entrada de falta de caché y de salida, y luego probar cargas de trabajo representativas. Un agente de codificación que reutiliza un gran resumen de repositorio puede comportarse de manera muy diferente a un asistente de atención al cliente que inyecta un nuevo estado de cuenta en cada solicitud.
Aquí también es donde Model Gate y capas de enrutamiento multimodelo similares tienen un papel práctico. Las puertas de enlace que rastrean el uso de tokens por modelo, equipo y clave API pueden ayudar a los operadores a ver si una ruta supuestamente barata es realmente barata en producción. La métrica relevante ya no es solo tokens por solicitud; es la combinación de entradas de caché, entradas no almacenadas en caché y salidas generadas a través del tráfico real.
Quién se ve afectado
Los desarrolladores que utilizan DeepSeek directamente deben verificar los identificadores de modelo, el formato de punto final y los indicadores de capacidad antes de cambiar el tráfico de producción. Se enumeran la salida JSON y las llamadas a herramientas, pero aún es necesario probar el comportamiento de la aplicación, especialmente si el código existente depende del manejo de casos extremos de otro proveedor.
Los operadores de puerta de enlace y los equipos de plataforma tienen una lista de verificación más amplia.Necesitan tablas de precios actualizadas, límites de contexto, límites de producción máxima, metadatos de características por modelo, controles de presupuesto y documentación para acceso compatible con OpenAI y Anthropic. Si exponen V4-Pro como un modelo directo, aún así deberían advertir a los clientes que una sintaxis de solicitud equivalente no garantiza un comportamiento o costo equivalente.
Las empresas que ejecutan automatización de gran volumen deben revisar los supuestos del modelo predeterminado. Un modelo con una ventana de contexto de 1 millón de tokens puede resultar atractivo para revisión legal, síntesis de investigaciones, análisis de base de código y agentes de larga duración. Pero los modelos de contexto largo tienden a fomentar avisos más grandes, y los avisos más grandes magnifican cada error en el diseño de la caché y el control de salida.
Lo que sigue siendo incierto
La página de precios proporciona las tarifas y capacidades enumeradas actualmente, pero todavía hay incertidumbre sobre los cambios de precios futuros informados. Las publicaciones de la comunidad dicen que DeepSeek advirtió sobre un aumento significativo en el precio de la API y que los nuevos precios pico y valle pueden entrar en vigor el 16 de agosto. Esas afirmaciones son relevantes para la planificación presupuestaria, pero la tabla de tarifas futuras no se verificó a partir de un aviso oficial directamente accesible durante la investigación.
Esa incertidumbre debería hacer que los equipos sean cautelosos en lugar de congelarse. La respuesta sensata es agregar V4-Pro a los grupos de evaluación, probar cargas de trabajo reales, medir el comportamiento del caché y evitar codificarlo como el valor predeterminado permanente de menor costo hasta que se confirme el precio. Para algunas cargas de trabajo, V4-Pro puede ser una excelente opción de contexto prolongado. Para otros, especialmente los agentes con gran producción o avisos con mala reutilización de caché, la economía puede ser menos favorable de lo que sugiere la tasa de aciertos de caché.
La lección más amplia es que la disponibilidad del modelo es ahora sólo la primera pregunta de enrutamiento. Las preguntas más difíciles son sobre compatibilidad de formatos, confiabilidad de funciones, mecánica de caché, límites de salida y observabilidad de costos. DeepSeek V4-Pro ofrece a los desarrolladores otra potente opción de API, pero también deja claro que "barato" se ha convertido en una conclusión específica de la carga de trabajo, no en una etiqueta de proveedor.