OpenAI 兼容接口

POST /api/v1/chat/completions。OpenAI Python SDK / Node SDK / 任何 OpenAI 兼容客户端都可直接接入。

支持的模型

目录里的对话模型全部支持这个接口。模型名是扁平的, 不带厂商前缀,也不体现由哪家上游履约:

claude-fable-5
claude-opus-5
gpt-5.6-sol
gpt-5.6-terra
gpt-5.6-luna
kimi-k3
glm-5.2
deepseek-v4-flash
deepseek-v4-pro

带厂商前缀的旧写法(如 anthropic/claude-opus-5)仍然可以解析, 但不再出现在目录里。完整列表见 GET /api/v1/models 或控制台Models 页

支持的参数

  • model, messages · 必填
  • temperature, top_p, max_tokens
  • stream = true · SSE 字节级透传
  • tools, tool_choice · function calling
  • response_format · JSON mode (仅支持的模型)
  • seed · 可重现性
  • user · 透传到上游用于审计

暂不支持

  • logit_bias, logprobs · 只有部分模型接受,行为不一致,网关不做补齐
  • n > 1 · 单次多 completion,与 µ¢ 计费精度不兼容
  • frequency_penalty/presence_penalty · 部分上游不支持, 网关不做翻译;如设了会原样转发,由上游自行处理

返回

OpenAI 标准 wire shape——idchoices[]usagefinish_reason 全部字节级保留。 网关额外注入:

  • 响应 Header X-Request-Id:网关侧 ULID,用于在控制台 Logs 页搜索。你也可以自己传入一个 req_<ULID> 格式的值,网关会原样回显
  • 响应 Header X-RateLimit-Limit / X-RateLimit-Remaining / X-RateLimit-Window:当前限流窗口的余量

本次调用的费用不在 Header 里,在控制台Logs 页Billing 页—— 它需要等上游返回完整 usage 才能确定,流式请求尤其如此。

流式 (SSE)

stream: true 时网关字节级透传,不解析、不重打包, 客户端体验与直连 OpenAI 完全一致。延迟可观测;usage 字段在最后一帧。

详见 流式响应章节