Transmissão

Eventos enviados pelo servidor para respostas incrementais.

Definir "stream": true no corpo da solicitação. O streaming funciona em ambos os formatos de inferência e não altera os preços.

Antrópico emite eventos como message_start, content_block_delta, e message_stop. OpenAI emite data: {...} pedaços e acabamentos com data: [DONE].

from openai import OpenAI
client = OpenAI(api_key="mg_live_...", base_url="https://api.model-gate.com/v1")
stream = client.chat.completions.create(model="claude-opus-4.8", messages=[{"role":"user","content":"Hello"}], stream=True)
for chunk in stream:
    text = chunk.choices[0].delta.content
    if text:
        print(text, end="", flush=True)

Mantenha a conexão aberta e desative o buffer de proxy reverso. Fechar a conexão do cliente cancela a geração upstream; o uso já gerado permanece faturável. Ver Erros para obter orientação sobre novas tentativas.

Conclusão e uso ausente

O HTTP 200 confirma que o fluxo começou, não que a inferência terminou. Um erro do provedor ou fluxo interrompido/truncado é mostrado como com falha ou incompleto em Uso. A conclusão das conclusões do bate-papo é um motivo final para cada escolha solicitada ou [DONE]; Usos de respostas response.completed; Usos antrópicos message_stop. Mantenha o ID da solicitação e trate os argumentos de texto/ferramenta já recebidos como parciais. O gateway não repete silenciosamente essa solicitação.

O uso relatado pelo provedor, incluindo contadores zero ou parciais, é oficial. Um fluxo de texto bem-sucedido confirmado sem uso pode receber uma estimativa explicitamente rotulada com base em bytes delta de texto/raciocínio/argumento de ferramenta decodificados, excluindo o enquadramento SSE/JSON; limites de produção explícitos apenas para estimativas de limite. Streams com falha ou sem suporte sem exibição de uso Uso desconhecido · revisão necessária e não receba uma cobrança automática estimada em bytes. Desconhecido não é prova de que a execução do provedor foi gratuita. Ver Erros.