关键信息
速率限制
每个 xAI API 团队在两个维度上都有针对每个模型的速率限制:每秒请求数 (RPS) 和 每分钟令牌数 (TPM)。您的每秒限制是根据您的每分钟请求预算 (RPM / 60) 计算得出的:您不能在一秒钟内用完一整分钟的请求,这可以防止 API 出现突发流量。这些限制随您团队的 层级 而扩展,层级由在 API 上的累计消费决定。
您可以在 xAI 控制台的速率限制页面查看您团队的当前层级和每个模型的限制。
速率限制层级
您的层级基于自2026年1月1日起在 xAI API 上的累计消费。层级会随着您的消费增加而自动解锁。
| 层级 | 消费阈值 |
|---|---|
| Tier 0 | $0 (默认) |
| Tier 1 | $50 |
| Tier 2 | $250 |
| Tier 3 | $1,000 |
| Tier 4 | $5,000 |
| Enterprise | 按需申请 |
资格基于通过预付信用购买或成功完成的发票收到的总收入。一旦您获得某个层级,您将永久保持在该层级;层级永远不会降级。
NOTE
速率限制层级适用于文本和嵌入模型。如需提高语音和图像 API 的限制,请联系 sales@x.ai。
每个模型的限制
每个层级为每个模型设置硬性的 RPS 和 TPM 上限。限制随层级呈指数级增长。超过任何限制都会返回 429 Too Many Requests 错误。
下表列出了每个模型在每个层级的 RPS 和 TPM 限制。您也可以在 xAI 控制台的速率限制页面查看您团队的个性化限制。
| Model | RPS | TPM |
|---|---|---|
| grok-4.5 | T0: 150, T1: 172, T2: 208, T3: 312, T4: 500 | T0: 50M, T1: 53M, T2: 60M, T3: 74M, T4: 100M |
| grok-4.3 | T0: 37, T1: 50, T2: 75, T3: 125, T4: 208 | T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M |
| grok-4.20-0309-reasoning | T0: 37, T1: 50, T2: 75, T3: 125, T4: 208 | T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M |
| grok-4.20-0309-non-reasoning | T0: 37, T1: 50, T2: 75, T3: 125, T4: 208 | T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M |
| grok-build-0.1 | T0: 37, T1: 50, T2: 75, T3: 125, T4: 208 | T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M |
| grok-4.20-multi-agent-0309 | T0: 9, T1: 12, T2: 18, T3: 31, T4: 56 | T0: 2.5M, T1: 3.7M, T2: 6.2M, T3: 11M, T4: 21M |
| grok-imagine-image | 5 | — |
| grok-imagine-image-quality | 5 | — |
| grok-imagine-video-1.5 | 10 | — |
| grok-imagine-video | 10 | — |
什么计入 TPM
请求消耗的所有令牌都计入该模型的 TPM 限制:
- 提示令牌(文本、图像和音频)
- 完成令牌
- 推理令牌(在推理模型上)
- 缓存的提示令牌(尽管以较低费率计费,但仍计入 TPM)
有关令牌如何计数和定价的详细信息,请参阅模型与定价。有关每请求成本跟踪,请参阅成本跟踪。
处理速率限制错误
当您超出速率限制时,API 会返回 HTTP 429。实现指数退避来优雅地处理这种情况:
python
import os
import time
from openai import OpenAI, RateLimitError
client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))
def request_with_backoff(messages, max_retries=5):
for attempt in range(max_retries):
try:
return client.chat.completions.create(
model="grok-4.5",
messages=messages,
)
except RateLimitError:
wait = 2 ** attempt
time.sleep(wait)
raise RateLimitError("Max retries exceeded")python
import os
import time
from xai_sdk import Client
from xai_sdk.chat import user
from xai_sdk.exceptions import RateLimitError
client = Client(api_key=os.getenv("XAI_API_KEY"))
def request_with_backoff(prompt, max_retries=5):
chat = client.chat.create(model="grok-4.5")
chat.append(user(prompt))
for attempt in range(max_retries):
try:
return chat.sample()
except RateLimitError:
wait = 2 ** attempt
time.sleep(wait)
raise RateLimitError("Max retries exceeded")提高您的限制
- 增加消费。 层级会根据累计消费自动升级。无需您采取任何行动。
- 申请提高限制。 如果您需要在不增加消费的情况下获得更高的限制,或超过 Tier 4 的限制,请通过 xAI 控制台提交申请。
- 联系销售。 如需企业级容量,请发送邮件至 sales@x.ai。