高级 API 用法
优先处理
优先处理为您的 xAI API 请求提供更高的调度优先级,这通常会导致更短的首个令牌生成时间(TTFT)和更低的令牌间延迟(ITL),特别是在高需求期间。在任意请求体中添加 service_tier: "priority" 即可启用此功能,无需容量预留或提前预配。该参数在文本推理端点上受支持:聊天补全和响应。
当优先处理容量可用时,请求会被安排在标准流量之前。响应中始终包含一个 service_tier 字段,指示是否授予了优先级;请检查该字段以确认。
工作原理
将 service_tier 字段添加到任何受支持的请求中。API 会在响应中返回实际使用的层级,因此您可以确认升级已生效。
service_tier 字段接受以下值:
| Value | Meaning |
|---|---|
"default" | 标准处理。这与完全省略该字段相同。 |
"priority" | 以更高的令牌价格请求更高的调度优先级。 |
优先请求按每令牌溢价费率计费。在应用乘数之前,缓存输入令牌仍可获得折扣。有关当前每模型费率和确切的优先级溢价,请参阅定价页面。
快速入门
在请求体中传递 service_tier: "priority"。响应中包含一个 service_tier 字段,确认使用了哪个层级。
bash
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Explain the Riemann hypothesis in one paragraph.",
"service_tier": "priority"
}'python
import os
from xai_sdk import Client
from xai_sdk.chat import user
client = Client(api_key=os.getenv("XAI_API_KEY"))
chat = client.chat.create(
model="grok-4.5",
service_tier="priority",
)
chat.append(user("Explain the Riemann hypothesis in one paragraph."))
response = chat.sample()
print(response.content)
print(f"Tier used: {response.service_tier}")python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("XAI_API_KEY"),
base_url="https://api.x.ai/v1",
)
response = client.responses.create(
model="grok-4.5",
input="Explain the Riemann hypothesis in one paragraph.",
service_tier="priority",
)
print(response.output_text)
print(f"Tier used: {response.service_tier}")javascript
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.XAI_API_KEY,
baseURL: "https://api.x.ai/v1",
});
const response = await client.responses.create({
model: "grok-4.5",
input: "Explain the Riemann hypothesis in one paragraph.",
service_tier: "priority",
});
console.log(response.output_text);
console.log(`Tier used: ${response.service_tier}`);当请求在优先层级得到服务时,响应中会包含 "service_tier": "priority",如果是在默认层级得到服务,则包含 "service_tier": "default"。只有当响应确认了 "priority" 时,您才会按优先级费率计费。
json
{
"id": "resp_abc123",
"model": "grok-4.5",
"service_tier": "priority",
"usage": {
"input_tokens": 42,
"output_tokens": 156,
"cost_in_usd_ticks": 37756000
}
}