流媒体
用于增量响应的服务器发送事件。
放 "stream": true 在请求正文中。流式传输适用于两种推理格式,并且不会改变定价。
Anthropic 会发出诸如 message_start, content_block_delta, 和 message_stop。 OpenAI 发出 data: {...} 块和结束 data: [DONE]。
from openai import OpenAI
client = OpenAI(api_key="mg_live_...", base_url="https://api.model-gate.com/v1")
stream = client.chat.completions.create(model="claude-opus-4.8", messages=[{"role":"user","content":"Hello"}], stream=True)
for chunk in stream:
text = chunk.choices[0].delta.content
if text:
print(text, end="", flush=True)
保持连接打开并禁用反向代理缓冲。关闭客户端连接会取消上游生成;已产生的使用量仍需计费。看 错误 以获得重试指导。
完成和缺失的用法
HTTP 200 确认流开始,而不是推理完成。提供程序错误或中断/截断的流在使用情况中显示为失败或不完整。聊天完成完成是每个请求的选择的完成原因或 [DONE];响应用途 response.completed;人为用途 message_stop。保留请求 ID 并将已收到的文本/工具参数视为部分参数。网关不会默默地重复此请求。
提供商报告的使用情况(包括零或部分计数器)具有权威性。未使用的已确认成功文本流可能会收到基于解码文本/推理/工具参数增量字节的显式标记估计,不包括 SSE/JSON 框架;明确的产出仅限制上限估计。未显示使用情况的失败或不受支持的流 用途未知 · 需要审核 并且不会收到自动字节估计费用。未知并不能证明提供者执行是免费的。看 错误。