跳转到内容

关键信息

速率限制

每个 xAI API 团队在两个维度上都有针对每个模型的速率限制:每秒请求数 (RPS)每分钟令牌数 (TPM)。您的每秒限制是根据您的每分钟请求预算 (RPM / 60) 计算得出的:您不能在一秒钟内用完一整分钟的请求,这可以防止 API 出现突发流量。这些限制随您团队的 层级 而扩展,层级由在 API 上的累计消费决定。

您可以在 xAI 控制台的速率限制页面查看您团队的当前层级和每个模型的限制。

速率限制层级

您的层级基于自2026年1月1日起在 xAI API 上的累计消费。层级会随着您的消费增加而自动解锁。

层级消费阈值
Tier 0$0 (默认)
Tier 1$50
Tier 2$250
Tier 3$1,000
Tier 4$5,000
Enterprise按需申请

资格基于通过预付信用购买或成功完成的发票收到的总收入。一旦您获得某个层级,您将永久保持在该层级;层级永远不会降级。

NOTE

速率限制层级适用于文本和嵌入模型。如需提高语音和图像 API 的限制,请联系 sales@x.ai

每个模型的限制

每个层级为每个模型设置硬性的 RPS 和 TPM 上限。限制随层级呈指数级增长。超过任何限制都会返回 429 Too Many Requests 错误。

下表列出了每个模型在每个层级的 RPS 和 TPM 限制。您也可以在 xAI 控制台的速率限制页面查看您团队的个性化限制。

ModelRPSTPM
grok-4.5T0: 150, T1: 172, T2: 208, T3: 312, T4: 500T0: 50M, T1: 53M, T2: 60M, T3: 74M, T4: 100M
grok-4.3T0: 37, T1: 50, T2: 75, T3: 125, T4: 208T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M
grok-4.20-0309-reasoningT0: 37, T1: 50, T2: 75, T3: 125, T4: 208T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M
grok-4.20-0309-non-reasoningT0: 37, T1: 50, T2: 75, T3: 125, T4: 208T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M
grok-build-0.1T0: 37, T1: 50, T2: 75, T3: 125, T4: 208T0: 10M, T1: 15M, T2: 25M, T3: 45M, T4: 85M
grok-4.20-multi-agent-0309T0: 9, T1: 12, T2: 18, T3: 31, T4: 56T0: 2.5M, T1: 3.7M, T2: 6.2M, T3: 11M, T4: 21M
grok-imagine-image5
grok-imagine-image-quality5
grok-imagine-video-1.510
grok-imagine-video10

什么计入 TPM

请求消耗的所有令牌都计入该模型的 TPM 限制:

  • 提示令牌(文本、图像和音频)
  • 完成令牌
  • 推理令牌(在推理模型上)
  • 缓存的提示令牌(尽管以较低费率计费,但仍计入 TPM)

有关令牌如何计数和定价的详细信息,请参阅模型与定价。有关每请求成本跟踪,请参阅成本跟踪

处理速率限制错误

当您超出速率限制时,API 会返回 HTTP 429。实现指数退避来优雅地处理这种情况:

python
import os
import time
from openai import OpenAI, RateLimitError

client = OpenAI(base_url="https://api.x.ai/v1", api_key=os.getenv("XAI_API_KEY"))

def request_with_backoff(messages, max_retries=5):
    for attempt in range(max_retries):
        try:
            return client.chat.completions.create(
                model="grok-4.5",
                messages=messages,
            )
        except RateLimitError:
            wait = 2 ** attempt
            time.sleep(wait)
    raise RateLimitError("Max retries exceeded")
python
import os
import time
from xai_sdk import Client
from xai_sdk.chat import user
from xai_sdk.exceptions import RateLimitError

client = Client(api_key=os.getenv("XAI_API_KEY"))

def request_with_backoff(prompt, max_retries=5):
    chat = client.chat.create(model="grok-4.5")
    chat.append(user(prompt))
    for attempt in range(max_retries):
        try:
            return chat.sample()
        except RateLimitError:
            wait = 2 ** attempt
            time.sleep(wait)
    raise RateLimitError("Max retries exceeded")

提高您的限制

  • 增加消费。 层级会根据累计消费自动升级。无需您采取任何行动。
  • 申请提高限制。 如果您需要在不增加消费的情况下获得更高的限制,或超过 Tier 4 的限制,请通过 xAI 控制台提交申请。
  • 联系销售。 如需企业级容量,请发送邮件至 sales@x.ai

本文档为 docs.x.ai 全站中文翻译,由 AI 自动翻译生成。代码示例请以原文为准。