DeepSeek の V4-Pro モデルは、実用的な API 計画の領域に移行しました。 同社の現在の API 価格ドキュメントには、OpenAI 形式のベース URL と別の Anthropic 形式のベース URL を通じて公開されている DeepSeek-V4-Flash と並んで DeepSeek-V4-Pro がリストされています。 DeepSeek の変更ログを引用したコミュニティの投稿によると、V4-Pro 0813 リリースは 8 月 13 日にアプリ、ウェブ、API ユーザーに展開されました。

モデルのリストは、入手可能であること以上に注目に値します。 DeepSeek-V4-Pro は、1M トークンのコンテキスト長と 384K トークンの最大出力に加えて、JSON 出力、ツール呼び出し、非思考モードでのチャット プレフィックス補完ベータ版および FIM 補完ベータ版でアドバタイズされます。 エージェント、コード ツール、長いドキュメントのワークフロー、または検索負荷の高いシステムを構築する開発者にとって、これらの制限により、V4-Pro は、単に小規模なチャット モデルを置き換えるのではなく、プロンプト アーキテクチャを再構築できるモデルのカテゴリーに入れられます。

ただし、価格は実際の運用上の話です。 DeepSeek のページには、V4-Pro の価格が 100 万キャッシュヒット入力トークンあたり 0.003625 ドル、100 万キャッシュミス入力トークンあたり 0.435 ドル、100 万出力トークンあたり 0.87 ドルと記載されています。 この広がりは、リクエストのコストが、繰り返されるコンテキストが実際にプロバイダーのキャッシュにヒットするかどうかに大きく依存することを意味します。 楽観的なキャッシュの仮定の下では安価に見えるワークロードは、プロンプトが非常に可変的であったり、セグメント化が不十分であったり、キャッシュの再利用を妨げるツールによってルーティングされたりする場合には、はるかに高価になる可能性があります。

API ユーザーにとっての変更点

DeepSeek のドキュメントでは、メインの DeepSeek API ベース URL にある OpenAI スタイルのエンドポイントと、別のパスにある Anthropic スタイルのエンドポイントという 2 つの互換性面を備えたファーストクラス API モデルとして V4-Pro が示されるようになりました。 これは、すでに OpenAI 互換クライアントを使用しているチームにとって統合の障壁を下げると同時に、Claude スタイルのクライアントにより直接的な形式のオプションを提供するため、重要です。

AI API ゲートウェイの場合、当面の作業は地味ですが重要です。モデル カタログを更新し、コンテキスト ウィンドウと最大出力メタデータを更新し、サポートされている機能をマークし、2 つの API 形式を表現する方法を決定します。 OpenAI 形式と Anthropic 形式のサーフェスを同じものとして扱うことは、マーケティング ページには便利かもしれませんが、SDK、ログ、ポリシー制御で混乱を引き起こす可能性があります。 開発者は、どのリクエスト スキーマ、ツール呼び出し動作、ストリーミングの前提条件が適用されるかを知る必要があります。

非常に大きな出力制限が公表されている点にも注意が必要です。 384K トークンの最大出力は、単にテーブル内の大きな数値ではありません。 故障モードが変わります。 チームには、暴走世代や偶発的な長文ダンプによって単一のエージェント ステップが材料費イベントに変わることを防ぐために、より厳格な応答制限、請求アラート、アプリケーション レベルのガードレールが必要になる場合があります。

キャッシュ ヒット価格設定が今より重要になる理由

DeepSeek は、多くの開発者によって長い間、積極的な API 価格設定と関連付けられてきました。 V4-Pro はその認識を複雑にします。 リストされているキャッシュヒット入力の価格は、キャッシュミス入力の価格に比べて非常に低いですが、この差が役立つのは、ワークロードがキャッシュを再利用できるように設計されている場合のみです。

実際には、キャッシュの効率はプロンプトの安定性に依存します。 長いシステム プロンプト、ポリシー ブロック、ドキュメント バンドル、およびリポジトリ コンテキストは、一貫して再利用するとメリットが得られます。 しかし、エージェント システムでは、ログ、ツール出力、タイムスタンプ、中間計画、ユーザー固有の状態の追加など、あらゆるステップでプロンプトが変更されることがよくあります。 これらの変更によりキャッシュ境界が移動したり、大きなプレフィックスが欠落したりすると、実効コストがキャッシュミス率に近づく可能性があります。

そのため、ルーティング ポリシーは単一の混合入力価格によって V4-Pro をランク付けすべきではありません。 コスト シミュレーションでは、キャッシュ ヒット入力トークン、キャッシュ ミス入力トークンと出力トークンを分離し、代表的なワークロードをテストする必要があります。 大規模なリポジトリの概要を再利用するコーディング エージェントは、すべてのリクエストに新しいアカウントの状態を挿入するカスタマー サポート アシスタントとは大きく異なる動作をする可能性があります。

これは、Model Gate や同様のマルチモデル ルーティング レイヤーが実際的な役割を持つ場所でもあります。 モデル、チーム、API キーごとにトークンの使用状況を追跡するゲートウェイは、オペレーターが、安価であると思われるルートが運用環境で実際に安価であるかどうかを確認するのに役立ちます。 関連するメトリクスは、リクエストごとのトークンだけではなくなりました。これは、実際のトラフィック全体でキャッシュヒット入力、キャッシュされていない入力、生成された出力が混在したものです。

誰が影響を受けるか

DeepSeek を直接使用する開発者は、運用トラフィックを切り替える前に、モデル識別子、エンドポイント形式、および機能フラグを確認する必要があります。 JSON 出力とツール呼び出しがリストされていますが、特に既存のコードが別のプロバイダーのエッジケース処理に依存している場合は、アプリケーションの動作をテストする必要があります。

ゲートウェイ オペレーターとプラットフォーム チームには、より広範なチェックリストがあります。OpenAI 互換と Anthropic 互換の両方のアクセスのための更新された価格表、コンテキスト制限、最大出力制限、モデルごとの機能メタデータ、予算管理、およびドキュメントが必要です。 V4-Pro をドロップイン モデルとして公開する場合でも、同等のリクエスト構文が同等の動作やコストを保証するものではないことを顧客に警告する必要があります。

大規模な自動化を実行している企業は、デフォルト モデルの前提条件を再検討する必要があります。 1M トークンのコンテキスト ウィンドウを備えたモデルは、法的レビュー、調査統合、コードベース分析、および長時間実行されるエージェントにとって魅力的です。 しかし、ロングコンテキスト モデルは、より大きなプロンプトを奨励する傾向があり、より大きなプロンプトは、キャッシュの設計と出力制御におけるあらゆる間違いを拡大します。

不確実な点

価格ページには、現在記載されている料金と機能が記載されていますが、報告される将来の価格変更については依然として不確実性があります。 コミュニティの投稿によると、DeepSeekはAPI価格の大幅な値上げについて警告しており、新しいピーク価格とオフピーク価格が8月16日に発効する可能性があるとしている。 これらの主張は予算計画に関連していますが、将来の料金表は、調査中に直接アクセスできる公式通知から検証されていませんでした。

その不確実性により、チームは凍結されるのではなく、慎重になるはずです。 賢明な対応は、V4-Pro を評価プールに追加し、実際のワークロードをテストし、キャッシュの動作を測定し、価格が確認されるまで永続的な最低コストのデフォルトとして V4-Pro をハードコーディングしないことです。 一部のワークロードでは、V4-Pro が優れたロングコンテキスト オプションとなる場合があります。 その他、特に出力の多いエージェントやキャッシュの再利用が不十分なプロンプトの場合、ヘッドラインのキャッシュ ヒット率が示唆するほど経済性は良くない可能性があります。

より広範な教訓は、モデルの可用性は現在、ルーティングの最初の質問にすぎないということです。 より難しい質問は、形式の互換性、機能の信頼性、キャッシュの仕組み、出力の上限、コストの監視可能性に関するものです。 DeepSeek V4-Pro は、開発者に別の強力な API オプションを提供しますが、「安価」がプロバイダーのラベルではなく、ワークロード固有の結論になっているということも明確にしています。