DeepSeek の V4 API の価格設定は、単純なモデル選択の質問からタイミングの質問に変わりました。

同社の公式 API 価格設定ページには、100 万トークンの大規模なコンテキスト ウィンドウ、OpenAI 形式および Anthropic 形式のベース URL、キャッシュ ヒット入力、キャッシュ ミス入力および出力トークンに対する個別の請求カテゴリを備えた DeepSeek V4 Flash および DeepSeek V4 Pro がリストされています。 Techmeme が 8 月 13 日にまとめたレポートによると、DeepSeek は V4 モデルの価格を引き上げ、ダイナミックなピーク/オフピーク課金を導入しており、新しい価格は 2026 年 8 月 16 日の 16:00 UTC に発効します。

これにより、この変更は単なる定期的な価格表の更新以上のものとなります。 取得が多いエージェント、長いコンテキストのコーディング アシスタント、バッチ分析ジョブ、または顧客向け AI 製品を実行しているチームの場合、DeepSeek リクエストのコストは、どのモデルが選択されたかだけでなく、リクエストがいつ送信されるか、およびキャッシュから提供できるプロンプトの量に依存する可能性があります。

DeepSeek V4 の課金の変更点

DeepSeek の現在の API ドキュメントでは、V4 Flash と V4 Pro が両方で利用可能であると示されています。 OpenAI スタイルと Anthropic スタイルの API 形式。 多くの開発者がプロ​​バイダー固有のアプリケーション コードを作成するのではなく、互換性レイヤーを通じて他のプロバイダーと並行して DeepSeek をルーティングしているため、これは重要です。

注目すべき課金構造は、キャッシュ ヒット入力、キャッシュミス入力と出力が分離されていることです。 実際には、これは、繰り返されるプロンプト プレフィックス、システム命令、ツール スキーマ、または長く再利用可能なコンテキスト ブロックが、新しく送信されたプロンプト テキストとは異なるコスト プロファイルを持つ可能性があることを意味します。 これはすでに DeepSeek V4-Pro のコストの重要な部分でした。 新しいピーク/オフピーク レイヤーにより、別の変数が追加されます。同じワークロードでも、実行時期に応じて価格が異なる可能性があります。

二次レポートでは、V4 モデルの材料価格の値上げと、8 月 16 日から始まる動的スケジュールが指摘されています。 一部のコミュニティの計算では、特定のキャッシュを大量に使用するケース、特にキャッシュ ヒットの価格が急激に変化した場合に、非常に大きな割合の増加が見込まれると主張しています。 これらの数字は、実際の請求書または DeepSeek の現在の請求表と照合するまで、慎重に扱う必要があります。 ただし、方向性は明らかです。API コンシューマは、もはやヘッドライン モデルの機能とトークンあたりの名目レートだけで DeepSeek V4 を評価することはできません。

ピーク価格とオフピーク価格が重要な理由

ピーク/オフピーク価格はインフラストラクチャ市場では一般的ですが、主流の LLM API ではまだ比較的新しいパターンです。 これは、クラウド チームやデータ チームにとってよく知られたインセンティブを生み出します。たとえば、柔軟な作業を高価な時間枠から移動し、ユーザー対応のリクエストのためにプレミアム時間を確保し、レイテンシーが重要ではないときにバッチ ジョブを待機させます。

AI アプリケーションの場合、これはいくつかの実際的な効果をもたらします。 リアルタイム サポート ボットは、通常、より安価な期間まで顧客の応答を遅らせることはできません。 夜間のコードベース分析ジョブ、ドキュメント エンリッチメント パイプライン、または評価の実行が頻繁に行われます。 エージェント システムはその中間に位置します。一部のツール呼び出しは対話型ですが、その他の呼び出しはキューに入れたり、再試行したり、スケジュールしたりできます。

これにより、ルーティングの問題が変わります。 品質、遅延、トークン価格に基づいてモデルを選択するゲートウェイは、時間を考慮する必要があります。 DeepSeek V4 Pro がオフピークでは費用対効果が高いものの、ピーク時間帯では高価である場合、アプリケーションは日中は別のモデルを好み、後で DeepSeek に戻る可能性があります。 V4 Flash が素早いタスクには引き続き魅力的でも、共有プレフィックスが長いとキャッシュの経済性が悪化する場合は、プロンプト アーキテクチャ自体を見直す必要があるかもしれません。

AI API ゲートウェイを使用しているチームにとって、最も役立つ機能は別のモデルの切り替えではない可能性があります。 それは、インタラクティブなリクエストを即時に送信する、緊急ではないジョブをキューに入れる、リクエストが高コスト枠に入ったときに警告する、またはバッチ実行が開始される前にチームレベルの予算を適用するなどのポリシーである場合があります。 これは、Model Gate スタイルのインフラストラクチャに直接関係します。プロバイダーの価格が静的ではなく動的である場合、統合請求、使用状況分析、ルーティング制御の価値が高まるためです。

誰が最も危険にさらされているか

最大の影響は、予測可能なワークロードを抱える大量の開発者と企業に降りかかる可能性があります。 消費者向けチャット製品、コーディング エージェント プラットフォーム、リサーチ ツール、データ クリーニング サービス、および内部自動化チームはすべて、同様のリクエストを大量に送信する可能性があります。 これらのシステムは、プロンプト キャッシュの恩恵を受けることがよくありますが、数百万または数十億のトークンにまたがるトークンごとの小さな変更にも敏感です。

OpenAI 互換インターフェイスを介して DeepSeek を使用しているチームは、互換性によって請求変更が妨げられると想定すべきではありません。 見覚えのあるリクエストに見えるかもしれませんが、請求書は依然として DeepSeek のモデル固有の価格設定ルールに従っています。人間形式のアクセスは、別の方向から同じ問題を引き起こします。統合が容易になっても、プロバイダーの請求カテゴリを理解する必要性がなくなるわけではありません。

価格計算ツール、リセラー ダッシュボード、または内部チャージバック ツールを維持している開発者は、前提条件を迅速に更新する必要があります。 製品の価格表が依然として DeepSeek V4 をトークンごとの単一の定額コストとして扱っている場合、実際の使用量が過小評価または過大評価される可能性があります。 これにより、顧客利益、チームの予算、モデル選択の決定が歪められる可能性があります。

調達チームと財務チームも注意を払う必要があります。 API の動的な価格設定により、毎月の予測が難しくなります。 ユーザー トラフィックがピーク ウィンドウに集中すると、テストでは手頃なワークロードでも実稼働環境では動作が異なる可能性があります。 同じリスクがデモ、評価、エージェントのベンチマークにも当てはまります。1 日のある時間帯に実行されるモデル比較は、同じワークフローを継続的に実行する経済性を表していない可能性があります。

チームが今すべきこと

当面のステップは、技術的な移行と財務的な検証を分離することです。 アプリケーションがサポートされている API 形式を通じてすでに DeepSeek V4 Flash または V4 Pro を呼び出している場合は、コードの変更は必要ありません。 ただし、請求の前提条件、アラート、ダッシュボードには見直しが必要です。

エンジニアリング チームは、どの DeepSeek ワークロードが対話型で、どのワークロードが延期可能であるかを特定する必要があります。 製品要件で許可されている場合、バッチ要約、埋め込み隣接エンリッチメント、リポジトリ分析、合成データ生成、および評価スイートがオフピーク スケジューリングの候補となります。 エージェント フレームワークは、トークン数とモデル ID だけでなく、リクエスト時間、キャッシュ ヒット動作、出力ボリュームも記録する必要があります。

チームはプロンプト キャッシュ戦略も再確認する必要があります。 再利用可能なコンテキスト ブロックがキャッシュされていない入力よりも依然として安価である場合、キャッシュには依然として価値があります。 キャッシュ ヒットの価格が特定のモデルと時間枠で大幅に上昇した場合は、システム プロンプトを短縮したり、ワークフローを分割したり、長いコンテキストのタスクを繰り返す場合に別のプロバイダーを比較したりする価値があるかもしれません。

依然として不確実なのは、すべてのワークロードの実際の価格への影響です。 DeepSeek の公式ドキュメントでは、価格設定ページに表示されるモデル形式、コンテキスト ウィンドウ、請求カテゴリが確認されており、二次レポートでは 8 月 16 日のピーク/オフピークのアクティベーションと値上げについて説明されています。 正確なコストの差は、現在のライブ テーブル、リクエストの送信時間、キャッシュの動作、出力の長さによって異なります。

より広範な教訓は、それほど不確実ではありません。 LLM の価格設定が有効になりつつあります。 モデルの選択、リクエストのタイミング、キャッシュの設計、予算ポリシーがリンクされるようになりました。 開発者や企業にとって、AI API のコスト管理は、展開後の単なるスプレッドシートの作業ではなくなりました。これは、本番 AI システムのルーティング方法の一部です。