限流

SilvaMux 对模型调用施加两层限制:请求速率(每分钟请求数)和生成并发(图片/视频同时进行的任务数)。超限时请求返回 429。

请求速率(RPM)

  • 限流按组织计:同一组织下所有 API Key 的请求合并计数,不区分 Key 或用户。
  • 默认配额为每分钟 3600 个请求;如需更高配额请联系平台。
  • 计数窗口为 UTC 分钟固定窗口。
限流保护在鉴权之后、扣费之前执行;触发限流的请求不会产生扣费。

超限返回 HTTP 429,错误码 RATE_LIMITED,错误体按接口协议渲染:

  • OpenAI 格式:{"error":{"message":"rate limited","type":"gateway_error","code":"RATE_LIMITED"}}
  • Anthropic 格式:{"type":"error","error":{"type":"rate_limit_error","message":"rate limited"}}
  • Gemini 格式:"status":"RESOURCE_EXHAUSTED"
  • Volcengine 格式:{"error":{"code":"RATE_LIMITED","message":"rate limited"}}

生成并发上限

图片和视频生成为异步任务,并发上限按组织配置(默认 5),由管理员调整:

能力错误码说明
图片生成CONCURRENCY_LIMIT_EXCEEDED(429)同时进行的图片生成任务超过上限
视频生成CONCURRENCY_LIMIT_EXCEEDED(429)同时进行的视频生成任务超过上限

超限后等待进行中的任务完成再提交新任务。

超限重试建议

收到 429 时使用指数退避重试(如 1s、2s、4s...),并检查:

  • RATE_LIMITED:请求频率超过 RPM 配额,降低请求速率。
  • CONCURRENCY_LIMIT_EXCEEDED:等待生成任务完成,或联系平台提升并发上限。
平台不返回 X-RateLimit-*Retry-After 响应头,客户端应以错误码为准自行实现退避。