ストリーミング

増分応答のサーバー送信イベント。

セット "stream": true リクエスト本文に。ストリーミングは両方の推論形式で機能し、価格は変わりません。

Anthropic は次のようなイベントを発行します。 message_startcontent_block_delta、 そして message_stop。 OpenAIが排出する data: {...} チャンクと終了 data: [DONE]

from openai import OpenAI
client = OpenAI(api_key="mg_live_...", base_url="https://api.model-gate.com/v1")
stream = client.chat.completions.create(model="claude-opus-4.8", messages=[{"role":"user","content":"Hello"}], stream=True)
for chunk in stream:
    text = chunk.choices[0].delta.content
    if text:
        print(text, end="", flush=True)

接続を開いたままにし、リバース プロキシ バッファリングを無効にします。クライアント接続を閉じると、アップストリームの生成がキャンセルされます。すでに生成された使用量は引き続き請求の対象となります。見る エラー リトライガイダンス用です。

完了と欠落した使用法

HTTP 200 は、推論が終了したことを確認するものではなく、ストリームが開始されたことを確認します。プロバイダー エラーまたは中断/切り捨てられたストリームは、「使用法」で失敗または不完全として表示されます。チャット完了の完了は、要求されたすべての選択肢の終了理由です。 [DONE];応答の用途 response.completed;人間の用途 message_stop。リクエスト ID を保持し、すでに受信したテキスト/ツール引数を部分的なものとして扱います。ゲートウェイはこのリクエストを黙って繰り返すことはありません。

プロバイダーによって報告された使用状況 (ゼロまたは部分的なカウンターを含む) は信頼できるものです。使用されていない確認済みの成功したテキスト ストリームは、SSE/JSON フレーム化を除く、デコードされたテキスト/推論/ツール引数デルタ バイトに基づいて、明示的にラベル付けされた推定値を受け取る場合があります。明示的な出力制限の上限推定値のみ。使用状況が表示されない、失敗したストリームまたはサポートされていないストリーム 用途不明・要検討 また、バイト推定による自動料金は発生しません。不明であることは、プロバイダーの実行が無料であったことを証明するものではありません。見る エラー