跳转到内容

高级 API 用法

优先处理

优先处理为您的 xAI API 请求提供更高的调度优先级,这通常会导致更短的首个令牌生成时间(TTFT)和更低的令牌间延迟(ITL),特别是在高需求期间。在任意请求体中添加 service_tier: "priority" 即可启用此功能,无需容量预留或提前预配。该参数在文本推理端点上受支持:聊天补全和响应。

当优先处理容量可用时,请求会被安排在标准流量之前。响应中始终包含一个 service_tier 字段,指示是否授予了优先级;请检查该字段以确认。

工作原理

service_tier 字段添加到任何受支持的请求中。API 会在响应中返回实际使用的层级,因此您可以确认升级已生效。

service_tier 字段接受以下值:

ValueMeaning
"default"标准处理。这与完全省略该字段相同。
"priority"以更高的令牌价格请求更高的调度优先级。

优先请求按每令牌溢价费率计费。在应用乘数之前,缓存输入令牌仍可获得折扣。有关当前每模型费率和确切的优先级溢价,请参阅定价页面。

快速入门

在请求体中传递 service_tier: "priority"。响应中包含一个 service_tier 字段,确认使用了哪个层级。

bash
curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Explain the Riemann hypothesis in one paragraph.",
    "service_tier": "priority"
  }'
python
import os

from xai_sdk import Client
from xai_sdk.chat import user

client = Client(api_key=os.getenv("XAI_API_KEY"))

chat = client.chat.create(
    model="grok-4.5",
    service_tier="priority",
)
chat.append(user("Explain the Riemann hypothesis in one paragraph."))

response = chat.sample()

print(response.content)
print(f"Tier used: {response.service_tier}")
python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("XAI_API_KEY"),
    base_url="https://api.x.ai/v1",
)

response = client.responses.create(
    model="grok-4.5",
    input="Explain the Riemann hypothesis in one paragraph.",
    service_tier="priority",
)

print(response.output_text)
print(f"Tier used: {response.service_tier}")
javascript
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.XAI_API_KEY,
  baseURL: "https://api.x.ai/v1",
});

const response = await client.responses.create({
  model: "grok-4.5",
  input: "Explain the Riemann hypothesis in one paragraph.",
  service_tier: "priority",
});

console.log(response.output_text);
console.log(`Tier used: ${response.service_tier}`);

当请求在优先层级得到服务时,响应中会包含 "service_tier": "priority",如果是在默认层级得到服务,则包含 "service_tier": "default"。只有当响应确认了 "priority" 时,您才会按优先级费率计费。

json
{
  "id": "resp_abc123",
  "model": "grok-4.5",
  "service_tier": "priority",
  "usage": {
    "input_tokens": 42,
    "output_tokens": 156,
    "cost_in_usd_ticks": 37756000
  }
}

最佳实践

  • 优先延迟敏感路径 — 优先处理对面向用户的请求最有价值,因为响应时间直接影响用户体验。后台作业、评估和批量处理更适合使用批量 API
  • 监控 service_tier 字段 — 记录返回的层级,以跟踪您的请求在优先级和默认层级之间被服务的频率,并将其与您的延迟指标相关联。
  • 结合提示缓存使用 — 缓存输入令牌的折扣会在应用优先级乘数之前生效,因此提示缓存和优先处理可以很好地互补。

本文档为 docs.x.ai 全站中文翻译,由 AI 自动翻译生成。代码示例请以原文为准。