限流
SilvaMux 对模型调用施加两层限制:请求速率(每分钟请求数)和生成并发(图片/视频同时进行的任务数)。超限时请求返回 429。
请求速率(RPM)
- 限流按组织计:同一组织下所有 API Key 的请求合并计数,不区分 Key 或用户。
- 默认配额为每分钟 3600 个请求;如需更高配额请联系平台。
- 计数窗口为 UTC 分钟固定窗口。
限流保护在鉴权之后、扣费之前执行;触发限流的请求不会产生扣费。
超限返回 HTTP 429,错误码 RATE_LIMITED,错误体按接口协议渲染:
- OpenAI 格式:
{"error":{"message":"rate limited","type":"gateway_error","code":"RATE_LIMITED"}} - Anthropic 格式:
{"type":"error","error":{"type":"rate_limit_error","message":"rate limited"}} - Gemini 格式:
"status":"RESOURCE_EXHAUSTED" - Volcengine 格式:
{"error":{"code":"RATE_LIMITED","message":"rate limited"}}
生成并发上限
图片和视频生成为异步任务,并发上限按组织配置(默认 5),由管理员调整:
| 能力 | 错误码 | 说明 |
|---|---|---|
| 图片生成 | CONCURRENCY_LIMIT_EXCEEDED(429) | 同时进行的图片生成任务超过上限 |
| 视频生成 | CONCURRENCY_LIMIT_EXCEEDED(429) | 同时进行的视频生成任务超过上限 |
超限后等待进行中的任务完成再提交新任务。
超限重试建议
收到 429 时使用指数退避重试(如 1s、2s、4s...),并检查:
RATE_LIMITED:请求频率超过 RPM 配额,降低请求速率。CONCURRENCY_LIMIT_EXCEEDED:等待生成任务完成,或联系平台提升并发上限。
平台不返回
X-RateLimit-* 或 Retry-After 响应头,客户端应以错误码为准自行实现退避。