Streaming
Evenimente trimise de server pentru răspunsuri incrementale.
Set "stream": true în corpul de cerere. Streamingul funcționează în ambele formate de inferență și nu modifică prețul.
Antropic emite evenimente precum message_start, content_block_delta, și message_stop. OpenAI emite data: {...} bucăți și se termină cu data: [DONE].
from openai import OpenAI
client = OpenAI(api_key="mg_live_...", base_url="https://api.model-gate.com/v1")
stream = client.chat.completions.create(model="claude-opus-4.8", messages=[{"role":"user","content":"Hello"}], stream=True)
for chunk in stream:
text = chunk.choices[0].delta.content
if text:
print(text, end="", flush=True)
Păstrați conexiunea deschisă și dezactivați bufferingul proxy invers. Închiderea conexiunii client anulează generarea în amonte; utilizarea deja generată rămâne facturabilă. Vedea Erori pentru reîncercarea de ghidare.
Finalizare și utilizare lipsă
HTTP 200 confirmă că fluxul a început, nu că inferența sa terminat. O eroare de furnizor sau un flux întrerupt/trunchiat este afișat ca eșuat sau incomplet în Utilizare. Finalizarea Terminărilor Chat este un motiv final pentru fiecare alegere solicitată sau [DONE]; Utilizări de răspunsuri response.completed; Utilizări antropice message_stop. Păstrați ID-ul solicitării și tratați argumentele text/instrument deja primite ca fiind parțiale. Gateway-ul nu repetă în tăcere această solicitare.
Utilizarea raportată de furnizor, inclusiv contoare zero sau parțiale, este autorizată. Un flux de text cu succes confirmat fără utilizare poate primi o estimare etichetată în mod explicit, bazată pe octeți delta text decodificat/raționament/instrument-argument, excluzând încadrarea SSE/JSON; limitele de ieșire explicite numai estimări ale plafonului. Se afișează fluxuri eșuate sau neacceptate fără utilizare Utilizare necunoscută · este necesară o revizuire și nu primiți o taxă automată estimată pe octeți. Necunoscut nu este dovada că execuția furnizorului a fost gratuită. Vedea Erori.